Sammanfattning
Experimentella kliniska studier ska utgå från en tydlig klinisk frågeställning med en på förhand definierad population, mätprincip, utfall, analysplan och säkerhetsuppföljning. Metoden ska vara validerad för avsedd användning, genomföras standardiserat och omfatta definierad funktionskontroll, dokumentation, felkällor och mätosäkerhet. Randomisering minskar systematiska skillnader mellan behandlingsgrupper, men studiens tillförlitlighet måste även bedömas utifrån risken för systematiska fel, mätkvalitet, statistisk analys och rapportering. Primära resultat ska skiljas från sekundära effektmått, subgruppsanalyser och efterhandsanalyser, och nytta ska alltid vägas mot risk. Resultaten från parallellgruppsstudier och metaanalyser ska tillämpas med hänsyn till den enskilda patientens kliniska situation, hälsotillstånd och preferenser samt med öppen redovisning av osäkerhet.
Grundprinciper för experimentella kliniska studier
En experimentell klinisk studie behöver utgå från en tydligt beskriven medicinsk bakgrund och en metod som kan genomföras, kontrolleras och utvärderas på ett enhetligt sätt. Sambandet mellan studiens syfte, mätprincip, undersökningsförfarande och analys ska vara tydligt. Det ska också framgå under vilka förutsättningar resultaten är giltiga och vilka felkällor som kan påverka tolkningen.
Medicinsk bakgrund, syfte och avgränsning
Den medicinska bakgrunden ska motivera varför studien genomförs och vilken klinisk fråga den ska belysa. Syftet behöver vara tillräckligt precist för att styra val av deltagare, mätmetod och utvärdering. Följande ska definieras innan studien startar:
- klinisk indikation och avsedd användning
- relevanta kontraindikationer
- studiens avgränsningar
- vilken patientgrupp eller klinisk situation som undersöks
- om studien avser diagnostik, prognostik, riskvärdering, uppföljning eller annan klinisk tillämpning
- vilka fynd eller mätdata som ska ligga till grund för bedömningen
Kontraindikationer bör delas upp efter klinisk betydelse när metoden kräver det. Medicinsk säkerhet ska bedömas redan vid planeringen, inte först när undersökningen utförs.
Mätprincip och kvantifiering
Mätprincipen ska beskriva vad som faktiskt mäts och hur mätningen relaterar till den kliniska frågan. Enbart apparatnamn eller undersökningsnamn är inte tillräckligt. Metodbeskrivningen behöver ange hur data registreras, bearbetas och kvantifieras samt om morfologisk bedömning ingår.
| Del | Fråga som ska besvaras |
|---|---|
| Mätprincip | Vilken fysiologisk, anatomisk eller annan medicinsk egenskap registreras? |
| Kvantifieringsprincip | Hur omvandlas registreringen till mätvärden eller kategoriserade fynd? |
| Referensmaterial | Mot vilka normalfynd eller annat referensmaterial bedöms resultatet? |
| Mätosäkerhet | Hur stor variation kan hänföras till mätmetoden? |
| Felkällor | Vilka omständigheter kan ge missvisande eller svårtolkade resultat? |
Mätmetoden ska valideras för den avsedda användningen. Vid införande på den egna avdelningen behöver det dessutom beskrivas hur metoden införs lokalt. Lokal tillämpning får inte lämna centrala delar av utförandet odefinierade.
Standardiserat genomförande
Förberedelser och undersökningsförfarande ska vara så tydligt beskrivna att metoden kan utföras enhetligt. Det omfattar:
- kallelseinstruktioner och förberedelser före besöket
- patientförberedelser på kliniken
- lokal, material, läkemedel och apparatur
- eventuell inmärkning eller särskild hantering av utrustning
- bemanning och ansvarsfördelning
- undersökningens ordningsföljd
- sammanställning och analys av prover eller mätdata
- dokumentation och lagring av resultat
Om särskilda läkemedel, radioaktiva läkemedel eller annan specifik utrustning används ska detta framgå tillsammans med relevanta säkerhetskrav. För barn eller andra särskilda patientgrupper kan en separat metodbeskrivning behövas.
Verifiering, funktionskontroll och kvalitet
Utrustning och mätkedja ska verifieras genom definierad funktionskontroll. Kalibrering, datasystem och andra tekniska komponenter behöver ingå när de påverkar resultatet. Kontrollen bör särskiljas från metodvalideringen: validering avser om metoden är ändamålsenlig, medan funktionskontroll avser om den fungerar som avsett vid användning.
Resultaten ska rapporteras enligt en förutbestämd struktur. Utlåtandet bör tydligt skilja registrerade fynd från den medicinska bedömningen. Normalfynd, metodfel, felkällor och eventuella medicinska komplikationer ska beaktas vid tolkningen. Slutligen behövs klinisk uppföljning och kvalitetsuppföljning för att identifiera avvikelser, bedöma metodens användbarhet och säkerställa att den lokala tillämpningen förblir tillförlitlig.
Randomiserade kontrollerade parallellgruppsstudier
Randomiserade kontrollerade parallellgruppsstudier är centrala när effekten av olika behandlingsstrategier ska jämföras. Studiens sammanfattande resultat beskriver dock i första hand utfallet för den genomsnittliga patient som den studerade populationen representerar. Resultatet behöver därför alltid sättas i relation till den enskilda patientens hälsotillstånd, kliniska situation och preferenser.
Från studieresultat till patientnytta
Ett statistiskt sammanfattat behandlingsutfall anger inte med säkerhet hur en specifik patient kommer att svara. Vid klinisk tillämpning behöver läkaren bedöma hur väl den aktuella patienten motsvarar de patienter som ingick i studien. Även när en randomiserad studie ger tydligt stöd för en behandling kan den förväntade nyttan för en enskild patient avvika från studiens genomsnittliga resultat.
Detta innebär att resultat från parallellgruppsstudier ska användas som beslutsunderlag, inte som en automatisk instruktion. Den slutliga behandlingsstrategin behöver bestämmas av ansvarig läkare i samråd med patienten och, när det är lämpligt, närstående eller annan företrädare. Bedömningen ska väga samman:
- studiens sammanfattande behandlingsresultat
- patientens aktuella hälsotillstånd
- den kliniska situationen
- läkarens kliniska överväganden och erfarenhet
- patientens värderingar och preferenser
Evidens från randomiserade studier ersätter således inte individuellt beslutsfattande. Den kompletterar den kliniska bedömningen genom att ge ett kvantitativt underlag för jämförelse mellan behandlingsalternativ.
Betydelsen för evidenssammanställningar
Väl genomförda randomiserade studier är också en nödvändig grund för meningsfulla metaanalyser av behandlingsfrågor. En metaanalys kan sammanställa befintlig evidens, men den kan inte skapa tillförlitlig evidens om adekvata randomiserade studier saknas. Ett sammanvägt resultat blir därför inte starkare än det underlag som ingår.
Avsaknad av randomiserade studier ska inte döljas bakom en kvantitativ sammanställning. När underlaget är otillräckligt behöver osäkerheten framgå och beaktas i det kliniska beslutet. Evidensbaserad medicin är ett ideal och ett arbetssätt, inte en färdig uppsättning svar för varje klinisk situation.
Begränsningar i klinisk tillämpning
Många frågor som läkare möter i vardagen kommer inte att undersökas fullständigt i randomiserade studier. Direkt studiestöd för den aktuella patientgruppen, kombinationen av sjukdomar eller beslutssituationen kan därför vara begränsat eller helt utebli. Frånvaro av evidens från randomiserade studier innebär inte att behovet av beslut försvinner. Däremot ökar kraven på tydliga kliniska överväganden och öppen redovisning av osäkerheten.
När evidensen från parallellgruppsstudier tillämpas bör följande frågor ställas:
- Representerar studiens sammanfattande resultat rimligen den aktuella patienten?
- Finns adekvata randomiserade studier bakom eventuella metaanalyser eller riktlinjerekommendationer?
- Vilka delar av beslutet stöds direkt av kvantitativa data?
- Vilka delar bygger i stället på klinisk erfarenhet och individuell bedömning?
- Hur påverkar patientens preferenser valet mellan behandlingsalternativen?
Randomiserade kontrollerade parallellgruppsstudier kan ge ett starkt jämförande underlag, men resultatet måste alltid tolkas i sitt kliniska sammanhang. God klinisk handläggning kräver även fortsättningsvis en kombination av relevant forskning, kvantitativa verktyg, klinisk erfarenhet och patientens egna prioriteringar.
Överkorsningsstudier och faktoriella studiedesigner
Överkorsningsstudier
I en överkorsningsstudie (crossover) randomiseras varje deltagare inte till en enda behandling utan till en sekvens av behandlingar som ges under på varandra följande perioder. Varje deltagare fungerar därmed som sin egen kontroll, vilket eliminerar variationen mellan individer och gör designen betydligt effektivare än en parallellgruppsstudie när svaret på de jämförda behandlingarna är starkt positivt korrelerat: färre deltagare krävs för samma statistiska styrka vid given effektstorlek och felrisk [1,2]. Den vanligaste formen är AB/BA-designen med två behandlingar och två perioder, där en sekvens (AB) inleds med behandling A och den andra (BA) med behandling B [1].
Designen lämpar sig för symtomlindrande behandling av kroniska eller stabila tillstånd, exempelvis multipel skleros eller reumatoid artrit, förutsatt att behandlingseffekten är reversibel och kortvarig. Den är olämplig när tillståndet kan botas, när det förändras oberoende av behandling eller när deltagaren kan avlida under studietiden [1,2].
De centrala metodproblemen sammanfattas nedan:
| Fenomen | Innebörd | Hantering |
|---|---|---|
| Överhängseffekt (carryover) | Effekten av behandlingen i den första perioden kvarstår in i den andra och gör att skillnaden mellan behandlingarna beror på ordningsföljden | Tillräckligt lång utsköljningsperiod (washout), ofta fem eller fler halveringstider, mellan perioderna [1] |
| Periodeffekt | Utfallet ändras med tiden oberoende av behandling | Lika många deltagare per sekvens gör att periodeffekten i medeltal inte snedvrider behandlingsestimatet, men den påverkar variansen och bör redovisas [1] |
| Bortfall efter första perioden | Deltagare som avbryter efter period 1, särskilt på grund av biverkningar, kan inte ingå i den parvisa jämförelsen | Beaktas i analysplan och tolkning [1,2] |
Analysen ska baseras på parvisa data och ta hänsyn till att upprepade mätningar hos samma individ är korrelerade, till exempel med parat t-test för kontinuerliga utfall och Mainland-Gart-test för binära utfall [1]. I AB/BA-designen kan överhängseffekt och interaktion mellan behandling och period inte särskiljas statistiskt. Den tidigare rekommenderade strategin att testa för överhängseffekt och vid signifikans förkasta period 2 och analysera enbart period 1 ger snedvridna resultat och avråds; designen förutsätter i stället att överhängseffekten är försumbar, vilket ska motiveras med en adekvat utsköljningsperiod [1,2].
Faktoriella studiedesigner
I en faktoriell studie randomiseras deltagarna för fler än en faktor samtidigt, där varje faktor omfattar en intervention och dess jämförelse. I den fullständiga 2×2-designen finns två faktorer med två nivåer var, vilket ger fyra behandlingsgrupper: A ensamt, B ensamt, A och B tillsammans, samt dubbel placebo [3].
Designen används för två principiellt skilda syften, som i praktiken är svåra att förena i samma studie [3]:
- Effektiv utvärdering av flera interventioner ("två studier till priset av en"). Varje faktor analyseras "vid marginalerna": alla som fått aktiv A jämförs med alla som fått kontroll A, och på motsvarande sätt för faktor B. Detta ger effektivitetsvinsten men vilar på antagandet att interventionerna inte interagerar.
- Att påvisa interaktion mellan interventionerna. Här är själva samspelet det primära utfallet. Att upptäcka en interaktion kräver väsentligt större stickprov än att jämföra nivåerna inom en faktor, varför en studie som dimensionerats för effektivitet är underdimensionerad för att påvisa interaktion, och tvärtom.
En interaktion föreligger när effekten av den ena interventionen beror på om deltagaren också får den andra. Risken kan begränsas genom att välja interventioner som verkar via skilda mekanismer eller ges vid skilda tidpunkter, men den kan sällan uteslutas helt på förhand. Bedömning av interaktion är därför en central del även i effektivitetssyftande faktoriella studier [3]. Den marginella (faktoriella) analysen kompletteras då lämpligen med en flerarmsanalys (inuti tabellen), som jämför de enskilda behandlingsgrupperna och inte kräver antagandet om utebliven interaktion men är mindre statistiskt effektiv; den används som känslighetsanalys. Deltagare som av behörighetsskäl eller tidigt avslut inte randomiserats för en viss faktor ska inte ingå i analysen av den faktorn, eftersom jämförelsen då inte längre är randomiserad [3].
Klusterrandomiserade studier och stegvis införande
Klusterrandomiserade studier
I en klusterrandomiserad studie randomiseras hela grupper (kluster), till exempel vårdcentraler, avdelningar, skolor eller geografiska områden, i stället för enskilda individer [4]. Designen väljs framför allt när interventionen naturligen levereras på gruppnivå och när individuell randomisering skulle medföra kontaminationsbias, det vill säga att deltagare i kontrollgruppen påverkas av interventionen via kontakt med interventionsgruppen. Klusterrandomisering minskar men eliminerar inte den risken [4].
Observationer inom samma kluster är mer lika varandra än observationer från olika kluster, en statistisk beroendestruktur som kvantifieras med intraklasskorrelationskoefficienten (ICC, ρ). ICC är andelen av den totala variansen som förklaras av variationen mellan kluster och antar värden mellan 0 och 1; i praktiken ligger de flesta ICC mellan 0,00 och 0,20 [4]. Detta beroende minskar den effektiva stickprovsstorleken, och en analys som felaktigt antar oberoende (naiv analys) ger för snäva konfidensintervall och för låga p-värden, det vill säga falskt positiva fynd [4].
Stickprovsstorleken beräknas därför genom att multiplicera storleken för en individrandomiserad studie med designeffekten (DE):
DE = 1 + ρ(m-1)
där m är klusterstorleken. Är ρ = 0 blir DE = 1 och klusterbildningen saknar betydelse; med växande ICC och klusterstorlek ökar det antal individer som krävs [4]. Analysen ska matcha designen och kan göras på klusternivå (ett sammanfattande mått per kluster) eller på individnivå med metoder som tar hänsyn till klusterstrukturen, exempelvis blandade modeller med slumpeffekter eller generaliserade estimeringsekvationer (GEE). Analys på klusternivå rekommenderas när antalet kluster är litet, riktvärdesmässigt färre än 15 till 20 kluster per arm [4]. Rapporteringen följer CONSORT-tillägget för klusterrandomiserade studier och ska ange skälet till klusterdesign, randomiseringsenhet, antal kluster och deras storlek, den skattade ICC samt bortfall på både kluster- och individnivå [4,5].
Stegvis införande
Den stegvis införda klusterrandomiserade studien (stepped-wedge, SW-CRT) är en klustervariant där alla kluster inleder i kontrolltillståndet och därefter, i en slumpmässigt bestämd ordning, ett i taget korsar över till interventionen vid på förhand fastställda tidpunkter (steg), tills samtliga fått interventionen [5]. Varje kluster bidrar med data från varje mätperiod och fungerar som sin egen kontroll över tid. Designen är attraktiv när interventionen förväntas göra mer nytta än skada och ändå måste införas successivt av praktiska eller resursmässiga skäl. De flesta sådana studier omfattar färre än 20 kluster [5].
Designen medför särskilda metodproblem som ska beaktas i både dimensionering och analys [5]:
- Tid som störfaktor. Eftersom observationer i kontrolltillstånd i genomsnitt insamlas tidigare i kalendertid än observationer i interventionstillstånd, är tiden associerad med både behandling och utfall. Analys och stickprovsberäkning måste justera för sekulära trender.
- Komplex korrelationsstruktur. Upprepade mätningar inom kluster, ibland på samma individer, ger beroenden som kan variera över tid och kräver longitudinella modeller.
- Kontamination inom kluster. Vid lång exponeringstid kan deltagare hinna exponeras för både kontroll- och interventionstillstånd; fördröjd utfallsmätning bör då undvikas.
- Fördröjda och tidsvarierande effekter. När effekten inte är omedelbar eller inte ger en bestående förändring kan en övergångsperiod byggas in i designen, och en analys av hur effekten ändras över tid bör övervägas.
En SW-CRT är mer komplex i design, analys och genomförande än en parallell klusterstudie och exponerar ofta fler kluster för interventionen; valet av stegvis införande bör därför motiveras, och studien registreras och prövas etiskt som forskning [5].
Adaptiva studier och sekventiella analyser
Adaptiva studiedesigner
En adaptiv studiedesign tillåter på förhand specificerade ändringar av en pågående studie utifrån analyser av ackumulerande data, utan att studiens validitet och integritet undergrävs [6]. Det avgörande är att adaptionerna är planerade i protokollet före start; sådana ändringar skiljer sig principiellt från de oplanerade ad hoc-ändringar som är vanliga i traditionella studier. Adaptioner kan tillämpas i alla faser, från tidig dosökning till konfirmerande studier, och flera kan kombineras i samma studie [6].
| Typ av adaption | Princip |
|---|---|
| Gruppsekventiell design | Planerade interimsanalyser med möjlighet att avsluta tidigt för effekt, skada eller utsiktslöshet |
| Omprövning av stickprovsstorlek | Justering av antalet deltagare utifrån interimsdata för att bevara den statistiska styrkan |
| Flerarmad flerstegsdesign (MAMS) | Flera behandlingsarmar där underlägsna armar kan utgå vid interim ("drop the loser") |
| Responsadaptiv randomisering | Allokeringskvoten förskjuts mot de armar som visar lovande resultat |
| Populationsberikning | Rekryteringen inriktas mot de patienter som mest sannolikt har nytta |
| Sömlös fas I/II eller II/III | Sammanslagning av på varandra följande utvecklingsfaser i en studie |
Fördelarna är främst effektivitet och etik: färre deltagare exponeras för underlägsna behandlingar, utsiktslösa studier kan avslutas, en underdimensionerad studie kan undvikas och en säker och effektiv dos kan identifieras snabbare [6]. Priset är ökad komplexitet. Två egenskaper måste värnas: integritet, det vill säga att informationsläckage vid interimsanalyserna minimeras, och validitet, det vill säga att skattningar, p-värden och konfidensintervall förblir korrekta. Naiva skattningar efter en adaption kan vara systematiskt felaktiga och kräva statistisk justering, och tidigt avslut för effekt tenderar att överskatta behandlingseffekten [6]. Interimsdata granskas därför av en oberoende datasäkerhetskommitté (till exempel en DSMB eller IDMC) som lämnar rekommendationer till en styrgrupp som hålls oblindad för armvisa resultat; alla adaptionsregler ska vara fastställda i protokoll och kommittéernas stadgar före start [6]. Regulatoriska myndigheter i Europa och USA har utfärdat vägledningar för adaptiva designer och ställer sig positiva när kontroll av typ I-fel och bias är säkerställd [6].
Sekventiella analyser
Interimsanalyser i konfirmerande studier görs för att bedöma effekt, utsiktslöshet, säkerhet eller stickprovsstorlek [7]. Vid upprepad testning ökar risken för typ I-fel, och ett enstaka gränsvärde på p < 0,05 kan inte användas vid varje avstämning; teststatistikan är dessutom instabil tidigt i studien [7]. Kontrollen av det samlade typ I-felet sker med gruppsekventiella metoder och alfaförbrukande funktioner (alpha spending), som fördelar felrisken över studiens gång:
| Gräns eller metod | Egenskap |
|---|---|
| Pocock | Konstant och relativt generös gräns vid varje analys (cirka p < 0,016 vid fem analyser) |
| O'Brien-Fleming | Mycket strikta gränser tidigt, som mjukas upp så att slutanalysen ligger nära p < 0,05 |
| Alfaförbrukande funktion (Lan-DeMets) | Flexibel tidpunkt för analyserna utifrån informationsandel, kan efterlikna Pocock- eller O'Brien-Fleming-profil |
En utsiktslöshetsanalys bedömer om studien sannolikt når sitt mål om den fullföljs, ofta via betingad styrka (conditional power) med en tröskel på typiskt 0,1 till 0,2. Att pröva för utsiktslöshet inflaterar inte typ I-felet men minskar styrkan, och icke-bindande stoppregler är att föredra framför bindande [7]. Säkerhetsövervakning ska finnas i alla faser och bedöms mot förhållandet mellan nytta och risk; utan samtidig effektinformation är säkerhetssignaler svårtolkade [7]. Omprövning av stickprovsstorlek kan ske blindat, för att revidera störparametrar som variansen, vilket inte inflaterar typ I-felet, eller oblindat utifrån den observerade effekten, vilket kräver justering [7]. Besluten fattas av en oberoende datasäkerhetskommitté, som väger interimsresultaten mot studiens helhet och inte i isolering [7].
Dos-responsstudier och val av dos
Tidiga dosfinnande studier
Fas I-studier utgör den första prövningen på människa och syftar till att fastställa rekommenderad dos och administreringsschema för fortsatt prövning. De är typiskt små, enarmade, öppna och sekventiella [8]. Den vägledande principen är att undvika att exponera för många deltagare för subterapeutiska doser samtidigt som säkerheten bevaras och rekryteringen hålls snabb [8]. Centrala begrepp är dosbegränsande toxicitet (DLT), som definieras i protokollet före start och graderas med standardiserade kriterier (till exempel CTCAE), och den målnivå för toxicitet som accepteras, vanligen 20 till 33 % [8].
Definitionen av högsta tolererade dos (MTD) skiljer sig mellan traditioner:
| Sammanhang | Definition av MTD |
|---|---|
| Regelbaserade studier i USA | Den högsta dos vid vilken ≤ 33 % av deltagarna får DLT |
| Regelbaserade studier i Europa och Japan | Den lägsta dos vid vilken ≥ 33 % får DLT |
| Modellbaserade studier | Den dos som ger den fastställda målnivån för toxicitet |
Dosökningsmetoderna delas i regelbaserade och modellbaserade [8]. Den regelbaserade 3+3-designen är alltjämt vanligast: kohorter om tre patienter behandlas vid stigande, på förhand bestämda dosnivåer (historiskt enligt en modifierad Fibonacci-sekvens). Uppträder ingen DLT bland de tre trappas dosen upp; uppträder en DLT utökas kohorten med ytterligare tre, och dosökningen avbryts när minst två av tre till sex (det vill säga ≥ 33 %) får DLT. Rekommenderad fas II-dos sätts konventionellt till dosnivån närmast under denna [8]. Designen är enkel och säker men exponerar många patienter för subterapeutiska doser och utnyttjar bara data från aktuell dosnivå. Modellbaserade metoder, såsom continual reassessment method (CRM) och eskalering med överdoskontroll, modellerar dos-toxicitetssambandet, använder data från alla patienter, definierar måltoxiciteten explicit och ger en skattning av rekommenderad dos med konfidensintervall; de kräver dock en förhandsgissning och biostatistiskt stöd i realtid [8]. För molekylärt riktade läkemedel kan effekt uppträda vid doser som inte ger kliniskt betydelsefull toxicitet, varför optimal biologisk dos (OBD), baserad på till exempel målinhibition eller plasmakoncentration, kan användas som alternativt effektmått [8].
Dosresponsstudier i fas II
Otillräckligt dosval är en av de främsta orsakerna till misslyckade fas III-studier, och dosvalet inför konfirmerande prövning bör betraktas som ett skattningsproblem snarare än en hypotesprövning [9]. Fas II-dosresponsstudier genomförs vanligen som parallellgruppsstudier där deltagarna randomiseras till flera dosnivåer och placebo eller aktiv jämförelse [9]. Traditionell parvis jämförelse mellan doser och kontroll (till exempel med variansanalys) bygger på minimala antaganden men har begränsad statistisk styrka, kräver justering för multipla jämförelser och utnyttjar data ineffektivt [9].
Målet bör vara att karakterisera hela dos-exponerings-responssambandet. E-max-modellen, härledd ur receptorbindningens massverkan, är den vanligaste modellen för detta [9]. MCP-Mod (multiple comparison procedure and modelling) är en principfast metod i två steg: först prövas om det finns en dosresponssignal, det vill säga en dosrelaterad trend över placebo, mot en uppsättning på förhand angivna kandidatkurvor (MCP-steget), därefter skattas dosresponskurvan genom modellval eller modellmedelvärdesbildning (Mod-steget) [9]. Metoden är effektivare än parvis jämförelse när det gäller att upptäcka en signal och skatta kurvan, ska specificeras redan vid designen och har fått positivt regulatoriskt utlåtande av CHMP och en lämplighetsbedömning av FDA [9]. Dessa metoder utesluter inte varandra utan bör användas tillsammans för att bygga ett vetenskapligt underbyggt dosval [9].
Effektmått, säkerhetsutfall och behandlingsföljsamhet
Effektmått och mätkvalitet
Effektmåtten ska ha en tydlig koppling till studiens medicinska frågeställning och till den mätprincip som används. För varje effektmått behöver studieprotokollet beskriva vad som mäts, hur resultatet kvantifieras, när mätningen utförs och hur fynden ska tolkas. Om en metod införs lokalt ska dess validering, verifiering och funktionskontroll vara definierade innan resultaten används för att bedöma behandlingseffekt.
Följande delar behöver vara fastställda:
- medicinsk bakgrund och indikation för mätningen
- eventuella kontraindikationer
- mätprincip och kvantifieringsprincip
- patientförberedelser och särskilda förberedelser i undersökningsrummet
- läkemedel, material och apparatur som krävs
- undersökningens praktiska utförande och bemanning
- sammanställning och analys av prover eller mätdata
- utformning av undersökningssvar eller bedömning
- referensmaterial och normalfynd, när sådana används
- kända felkällor och medicinska komplikationer
- mätosäkerhet samt plan för verifiering och funktionskontroll.
Otillräckligt genomförd mätning kan medföra feltolkning. Vid arbetsprov anges exempelvis att ofullständig belastning innebär risk för underdiagnostik och att betablockad kan minska testets känslighet. Avvikande vilo-EKG kan påverka både känslighet och specificitet. Detta illustrerar behovet av att i förväg definiera vad som utgör en tekniskt och kliniskt bedömbar undersökning. Ett genomfört moment bör inte automatiskt likställas med ett tillförlitligt effektmått om förutsättningarna för tolkning inte är uppfyllda.
Patientrapporterade effektmått, PROM, och patientrapporterade erfarenhetsmått, PREM, kan ingå när sådana finns tillgängliga och är relevanta för den kliniska frågan. De bör då värderas tillsammans med övriga hälsoutfall, patientens samsjuklighet, individuella påverkande faktorer och preferenser.
Säkerhetsutfall
Bedömningen av en behandling ska omfatta förhållandet mellan förväntad nytta och risk. Säkerhetsuppföljningen behöver därför vara integrerad i studiens undersökningsförfarande och inte hanteras enbart som en efterhandsgranskning. Relevanta säkerhetsutfall kan omfatta biverkningar, toxicitet och medicinska komplikationer, men exakt vilka händelser som ska följas måste anpassas till den studerade behandlingen och mätmetoden.
Vid behandling med molekylärt riktade cancerläkemedel uppmärksammas bland annat toxicitet i hud, njurar, ögon samt hjärta och kärl. Detta visar att säkerhetsutfallen kan behöva omfatta flera organsystem och att nya behandlingar kan ge toxicitetsmönster som kräver särskild tolkning och uppföljning.
Vid en oönskad händelse ska följande dokumenteras när det är tillämpligt:
- vilken behandling eller vilket preparat som var aktuellt
- händelsens omfattning
- vidtagna åtgärder
- planerad efterkontroll eller fortsatt uppföljning.
Oönskade händelser och avsteg från fastställda rutiner ska rapporteras i relevant avvikelsesystem. Ansvarig chef ska säkerställa utredning, åtgärd och uppföljning. Säkerhetsdata bör utvärderas återkommande enligt en på förhand fastställd uppföljningsplan.
Behandlingsföljsamhet
Behandlingsföljsamhet kan mätas icke-invasivt med frågeformulär, tabletträkning eller elektronisk registrering. Elektroniska burklock som registrerar datum och tid för varje öppning (medication event monitoring system, MEMS) betraktas ofta som referensmetod [10]. Det vanligaste utfallsmåttet är en följsamhetspoäng uttryckt som andelen dagar då rätt dos togs, och gränsen för att klassas som följsam sätts oftast, men godtyckligt, vid 80 % (spännvidd 67 till 95 %) [10]. Inga valideringsstudier har kunnat underbygga en viss gräns; idealt bör gränsvärdet fastställas och valideras för det enskilda läkemedlet utifrån dess farmakokinetik och farmakodynamik snarare än generiskt, och även definitionen av korrekt intag varierar betydligt mellan studier [10]. Avvikelser från behandlingsrutinen bör dokumenteras separat från biverkningar och medicinska komplikationer, och protokollet bör tydliggöra vem som ansvarar för registrering, uppföljning och bedömning, så att bristande följsamhet inte felaktigt tolkas som utebliven behandlingseffekt [10].
Bias, statistisk analys och etiska överväganden
Bias och studiens trovärdighet
Randomisering används för att minska systematiska skillnader mellan behandlingsgrupper och möjliggöra kausal tolkning. Observationsdata kan vara påverkade av störfaktorer och ger därför inte samma förutsättningar för säkra slutsatser om orsak och verkan. Randomisering undanröjer dock inte automatiskt alla felkällor. Studiens genomförande, mätmetoder, analys och rapportering måste också bedömas.
Risken för bias påverkar evidensvärdet även när studien formellt är randomiserad. Enligt SIGN motsvarar en välgjord randomiserad kontrollerad studie med mycket låg risk för bias evidensnivå 1++, medan en studie med låg risk motsvarar 1+. Randomiserade studier med hög risk för bias klassificeras som 1-. Studiedesignens namn är därför inte tillräckligt för att bedöma resultatets tillförlitlighet.
Kognitiva bias kan dessutom påverka hur resultat tolkas:
| Bias | Betydelse vid bedömning av studieresultat |
|---|---|
| Förankringsbias | Tidig fixering vid en viss förklaring, utan tillräcklig omprövning när nya uppgifter tillkommer |
| Bekräftelsebias | Sökande efter fynd som stödjer den förväntade slutsatsen snarare än fynd som talar emot den |
| Tillgänglighetsbias | Övervärdering av resultat eller förklaringar som är aktuella, uppmärksammade eller lätta att minnas |
| Försummelse av grundfrekvens | Otillräcklig hänsyn till hur vanligt ett tillstånd eller utfall är i den aktuella populationen |
| Inramningsbias | Bedömningen påverkas av hur frågan eller resultatet presenteras |
| För tidigt avslut | En slutsats accepteras innan den har verifierats tillräckligt |
Dessa mekanismer ersätter inte den formella bedömningen av studiekvalitet, men är relevanta när primära resultat, sekundära effektmått, subgrupper och analyser som inte planerats i förväg tolkas.
Statistisk analys
Analysplanen behöver skilja mellan primära och sekundära effektmått. Studiens dimensionering och statistiska styrka ska vara anpassade till den primära frågeställningen och den metod som används för att mäta utfallet. Sekundära effektmått, subgruppsanalyser och analyser som görs efter att data har granskats måste tolkas separat från studiens primära resultat.
Många kliniska utfallsstudier analyserar tiden till den första händelsen i ett sammansatt effektmått. Den metoden fångar inte nödvändigtvis hela sjukdomsbördan när samma deltagare kan få flera händelser. Alternativa analysmetoder omfattar:
- analys av totalt antal händelser, inklusive både första och återkommande händelser
- hierarkiska metoder med så kallad vinstkvot
- modellfria metoder såsom begränsad genomsnittlig överlevnadstid
Valet av analys ska motsvara den kliniska frågan. Resultatet bör inte bedömas enbart utifrån om en statistisk skillnad påvisats, utan även utifrån vilket effektmått som analyserats och vilka händelser som faktiskt bidragit till resultatet.
Vid adaptiva studier kan exempelvis stickprovsstorleken omvärderas med ledning av ackumulerade blindade händelsedata. Mer omfattande ändringar baserade på oblindade data kräver skydd mot avblindning och bias. Sådana beslut kan hanteras av en oberoende datasäkerhetskommitté som hålls organisatoriskt åtskild från övriga prövare.
Etiska överväganden och säkerhetsövervakning
Det etiska ramverket ska omfatta informerat samtycke, klinisk jämvikt mellan behandlingsalternativen, användning av placebo eller standardbehandling samt risken för skada. Dessa frågor måste bedömas tillsammans med studiens medicinska betydelse och möjligheten att besvara frågeställningen på ett tillförlitligt sätt.
Deltagarnas säkerhet kräver fortlöpande övervakning av data och säkerhetsutfall. Särskilt i studier där oblindade data från interimsanalyser kan påverka doser, inklusions- och exklusionskriterier eller urvalet av deltagare behövs tydliga skyddsmekanismer. En oberoende datasäkerhetskommitté kan då granska informationen utan att prövare och andra som genomför studien får tillgång till uppgifter som riskerar att påverka handläggning, bedömning eller rapportering. Registrering och transparent rapportering är slutligen centrala för att primära resultat, sekundära analyser och analyser i efterhand ska kunna skiljas åt.
Källor
- Dwan K, Li T, Altman DG, Elbourne D. CONSORT 2010 statement: extension to randomised crossover trials. BMJ 2019. PMID: 31366597
- Mills EJ, Chan AW, Wu P m.fl. Design, analysis, and presentation of crossover trials. Trials 2009. PMID: 19405975
- Kahan BC, Juszczak E, Beller E m.fl. Guidance for protocol content and reporting of factorial randomised trials: explanation and elaboration of the CONSORT 2010 and SPIRIT 2013 extensions. BMJ 2025. PMID: 39904527
- Dreyhaupt J, Mayer B, Keis O m.fl. Cluster-randomized Studies in Educational Research: Principles and Methodological Aspects. GMS J Med Educ 2017. PMID: 28584874
- Hemming K, Taljaard M, McKenzie JE m.fl. Reporting of stepped wedge cluster randomised trials: extension of the CONSORT 2010 statement with explanation and elaboration. BMJ 2018. PMID: 30413417
- Pallmann P, Bedding AW, Choodari-Oskooei B m.fl. Adaptive designs in clinical trials: why use them, and how to run and report them. BMC Med 2018. PMID: 29490655
- Ciolino JD, Kaizer AM, Balmert Bonner L. Guidance on interim analysis methods in clinical trials. J Clin Transl Sci 2023. PMID: 37313374
- Le Tourneau C, Lee JJ, Siu LL. Dose Escalation Methods in Phase I Cancer Clinical Trials. J Natl Cancer Inst 2009. PMID: 19436029
- Musuamba FT, Manolis E, Holford N m.fl. Advanced Methods for Dose and Regimen Finding During Drug Development: Summary of the EMA/EFPIA Workshop on Dose Finding. CPT Pharmacometrics Syst Pharmacol 2017. PMID: 28722322
- Hartman L, Lems WF, Boers M. Outcome measures for adherence data from a medication event monitoring system: A literature review. J Clin Pharm Ther 2018. PMID: 30171815