Sammenfatning
Et randomiseret kontrolleret forsøg, RCT, sammenligner interventioner ved at fordele deltagere eller grupper tilfældigt. Korrekt randomisering skaber grupper, der er sammenlignelige i forventning, og gør det muligt at tolke en forskel i udfald som en kausal behandlingseffekt. Dette forudsætter, at allokeringssekvensen er uforudsigelig, at afvigelser og frafald håndteres korrekt, at udfaldene måles uden systematiske forskelle, og at resultaterne ikke udvælges efter, hvad analyserne viser.
Ved kritisk vurdering bør klinikeren først identificere forsøgets spørgsmål og estimand, altså hvilken behandlingseffekt der faktisk sigtes til. Derefter vurderes randomisering og skjult allokering, blinding, frafald, udfaldsmål, analyseprincip og selektiv rapportering. Resultatet skal vurderes ud fra effektstørrelse og 95 %-konfidensinterval, ikke alene ud fra P-værdien. For binære udfald kræves både relative og absolutte effekter. Til sidst vurderes klinisk betydning, sikkerhed og overførbarhed til den aktuelle patient.
CONSORT 2025 angiver, hvad et publiceret RCT som minimum bør rapportere, mens SPIRIT 2025 gælder forsøgsprotokoller. Tjeklisterne forbedrer gennemsigtigheden, men er ikke instrumenter til at pointgive metodologisk kvalitet [1,2]. Risiko for bias bør i stedet vurderes for hvert udfald med et struktureret værktøj, eksempelvis Cochrane RoB 2 [3].
RCT'ets rolle i evidensbaseret medicin
Hvad randomisering opnår
I et RCT bestemmes behandlingen af en tilfældighedsmekanisme. I modsætning til et observationelt studie påvirkes allokeringen derfor ikke systematisk af prognose, behandlerens vurdering eller patientens præference. Randomiseringen balancerer i forventning både kendte og ukendte prognostiske faktorer. Dette er den vigtigste grund til, at et veludført RCT sædvanligvis giver mere sikker kausal evidens for interventionseffekter end en ikke-randomiseret sammenligning.
Randomisering garanterer derimod ikke, at grupperne bliver identiske. Tilfældige forskelle, også klinisk store, kan opstå, især i små forsøg. Forskelle ved baseline er derfor ikke i sig selv bevis på mislykket randomisering. Signifikanstest af baselinevariabler er uhensigtsmæssige, fordi alle forskelle, givet korrekt randomisering, er opstået ved tilfældighed.
Et RCT beskytter heller ikke automatisk mod bias efter randomiseringen. Effekten kan forvrides af eksempelvis:
- kendskab til den kommende allokering, før patienten inkluderes
- forskellige tillægsbehandlinger eller forskellig opfølgning i grupperne
- frafald, der afhænger af både behandling og prognose
- subjektiv udfaldsmåling uden blinding
- analyse i en anden gruppe end den, deltageren blev randomiseret til
- selektiv rapportering af udfald, tidspunkter eller analyser
Metaepidemiologisk forskning har vist, at mangelfuld eller uklart beskrevet sekvensgenerering, skjult allokering og blinding er associeret med større estimerede behandlingseffekter. Sammenhængen er særlig tydelig for subjektive udfald. Små forsøg har også en tendens til at rapportere større effekter end større forsøg [4].
Hvad et RCT kan og ikke kan besvare
RCT egner sig især til spørgsmål om gavn og skade af forebyggende, terapeutiske, diagnostiske eller organisatoriske interventioner. Det kan estimere effekten under idealiserede forhold, efficacy, eller effekten i rutinemæssig klinisk praksis, effectiveness.
RCT er mindre egnet, når:
- sjældne eller meget sene skader er hovedspørgsmålet
- eksponeringen ikke kan tildeles etisk forsvarligt
- lang latenstid gør forsøget urimeligt stort eller langvarigt
- prognose, prævalens, ætiologi eller diagnostisk nøjagtighed er det egentlige spørgsmål
- interventionen allerede er så etableret, at randomisering mod ingen behandling er uetisk
Sikkerhedsdata fra RCT er ofte begrænset af patientudvælgelse, opfølgningstid og stikprøvestørrelse. Fravær af en statistisk sikker forskel i bivirkninger viser derfor ikke, at interventionen er sikker. Randomiserede data skal ofte suppleres med registre, lægemiddelovervågning og andre observationelle data.
Fra klinisk spørgsmål til forsøgsdesign
Formulér spørgsmålet og behandlingseffekten
Forsøget bør tage udgangspunkt i et eksplicit klinisk spørgsmål:
- population
- intervention
- sammenligning
- udfald
- relevant tidspunkt
- behandlingskontekst
Det er ikke tilstrækkeligt at angive, at to behandlinger skal sammenlignes. Protokollen skal præcisere, hvilken effekt der skal estimeres. Et estimand beskriver i praksis:
- populationen
- interventionerne
- udfaldet
- hvordan hændelser efter randomiseringen skal håndteres
- effektmålet på populationsniveau
Hændelser efter randomiseringen kan være seponering, behandlingsskift, tillægsbehandling, transplantation eller død før den planlagte måling. Forskellige måder at håndtere dem på besvarer forskellige kliniske spørgsmål. En behandlingsstrategisk effekt kan eksempelvis inkludere alle hændelser efter randomiseringen, mens en hypotetisk effekt forsøger at estimere, hvad der ville være sket, hvis behandlingsskift ikke havde fundet sted.
En detaljeret protokol og en statistisk analyseplan bør være offentligt tilgængelige. SPIRIT 2025 angiver 34 minimumspunkter for protokoller og fremhæver bl.a. registrering, primære udfald, skader, analysepopulation, frafald, datadeling og patientinddragelse [5].
Valg af kontrolgruppe
Kontrolgruppen afgør, hvilket spørgsmål forsøget besvarer.
| Kontrol | Egnet spørgsmål | Vigtige begrænsninger |
|---|---|---|
| Placebo eller skinintervention | Specifik effekt ud over forventning, naturligt forløb og kontakt med sundhedsvæsenet | Kan være uetisk, hvis effektiv behandling tilbageholdes |
| Ingen intervention | Samlet effekt sammenlignet med at afstå | Svær at blinde, risiko for forskelle i opmærksomhed og tillægsbehandling |
| Sædvanlig behandling | Effekt af at indføre interventionen i aktuel praksis | Sædvanlig behandling skal beskrives og kan variere mellem centre |
| Aktiv kontrol | Sammenligning med etableret behandling | Kræver ofte et større forsøg, især ved non-inferiority |
| Dosis eller strategi | Hvilken af flere aktive strategier der er bedst | Forskelle i adhærens og kointerventioner skal rapporteres |
Placebokontrol er metodologisk værdifuld, men ikke altid klinisk relevant. En aktiv kontrol kan bedre understøtte behandlingsvalg, men resultatet afhænger af, at kontrolbehandlingen gives på adækvat vis og har den forventede effekt i den undersøgte kontekst.
Valg af udfald
Det primære udfald bør være klinisk relevant, veldefineret, valideret og muligt at måle med tilstrækkelig præcision. Definitionen skal omfatte målemetode, tidspunkt, analyseform og håndtering af konkurrerende hændelser.
Patientvigtige udfald, eksempelvis overlevelse, symptomer, funktion og livskvalitet, er som regel mere direkte anvendelige end laboratorieværdier. Surrogatudfald kan forkorte forsøg, men kan være misvisende, hvis sammenhængen med patientvigtige udfald ikke er valideret for samme sygdom, intervention og kontekst. Rapportering af forsøg med surrogatudfald bør tydeligt begrunde surrogatets biologiske og empiriske validitet [6].
Sammensatte udfald øger ofte antallet af hændelser, men kan skjule, at effekten hovedsageligt drives af en mindre vigtig og hyppig komponent. Vurdér derfor:
- om komponenterne har tilsvarende klinisk betydning
- om deres forventede hyppighed er sammenlignelig
- om behandlingseffekten med rimelighed er ensartet
- om hver komponent rapporteres separat
Flere primære udfald, tidspunkter og analysemetoder skaber multiplicitet. Hvis hver test gennemføres på 5-procentsniveauet, øges risikoen for mindst ét falsk positivt fund. Strategien for kontrol af type 1-fejl bør være prædefineret, eksempelvis hierarkisk testning eller justeret signifikansniveau.
Stikprøvestørrelse og målforskel
Stikprøveberegningen bør baseres på det primære udfald og en klinisk relevant målforskel, ikke på den største effekt, der gør forsøget økonomisk muligt. Den kræver sædvanligvis antagelser om:
- signifikansniveau, ofte tosidet 5 procent
- statistisk styrke, ofte 80 eller 90 procent
- klinisk relevant målforskel
- kontrolgruppens hændelsesrisiko eller udfaldenes standardafvigelse
- frafald
- allokeringsforhold
- korrelation ved gentagne målinger eller klyngedesign
Hvis den målforskel, der skal kunne påvises, halveres, kræver et toarmet forsøg med kontinuert, normalfordelt udfald omtrent fire gange så mange deltagere, hvis de øvrige antagelser er uændrede. Valget af målforskel har derfor både videnskabelige og etiske konsekvenser [7].
Et lille forsøg kan give et korrekt, men meget upræcist resultat. At et resultat ikke er statistisk signifikant, betyder ikke, at behandlingerne er ligeværdige. Konfidensintervallet viser, hvilke klinisk vigtige effekter der stadig er forenelige med data.
Randomisering, allokering og blinding
Generering af randomiseringssekvens
En korrekt sekvens kan skabes med computergenererede tilfældige tal. Systematisk veksling, fødselsdato, journalnummer eller ugedag er ikke randomisering, fordi den næste allokering kan forudsiges.
Almindelige metoder er:
- simpel randomisering
- blokrandomisering for omtrent lige store grupper
- stratificeret randomisering for balance inden for nogle få vigtige prognostiske faktorer
- minimering, sædvanligvis med et tilfældighedselement, ved flere balanceringsfaktorer
Små og faste blokke kan gøre den kommende allokering forudsigelig. Blokstørrelser bør derfor ofte varieres og skjules for det rekrutterende personale.
Skjult allokering
Skjult allokering, allocation concealment, betyder, at den næste behandling ikke kan forudses, før deltageren er endeligt inkluderet. Dette er adskilt fra blinding, som vedrører kendskab til behandlingen efter allokeringen.
Robuste metoder er eksempelvis:
- central webbaseret randomisering
- central telefonrandomisering
- apoteksstyret allokering
- fortløbende nummererede, uigennemsigtige, forseglede kuverter med manipulationssikring, hvis processen gennemføres stringent
Formuleringer som "deltagerne blev randomiseret" eller "der blev anvendt forseglede kuverter" er utilstrækkelige. Rapporten bør beskrive sekvensgenereringen, hvem der skabte sekvensen, hvem der inkluderede deltagerne, og hvordan allokeringen blev holdt skjult. Mangler i dette trin kan gøre det muligt at påvirke, hvilke patienter der får hvilken behandling, og dermed gøre randomiseringen virkningsløs [4].
Blinding
Blinding mindsker risikoen for, at kendskab til behandlingen påvirker adfærd, kointerventioner, rapportering, måling eller analyse. Rapporten bør angive, hvem der var blindet:
- deltagere
- behandlende personale
- øvrigt sundhedspersonale
- udfaldsbedømmere
- datagennemgåere og adjudikeringskomité
- statistikere
Begreberne enkeltblind og dobbeltblind er tvetydige og bør undgås.
Blinding er særlig vigtig for subjektive udfald såsom smerte, funktion og kliniske vurderinger. Ved objektive udfald som totalmortalitet er risikoen for målebias mindre, men kendskab til behandlingen kan stadig påvirke tillægsbehandling og opfølgning.
Hvis deltagere eller behandlere ikke kan blindes, bør forsøget overveje:
- blindet udfaldsvurdering
- standardiserede kointerventioner
- objektive eller centralt vurderede udfald
- prædefinerede kriterier for behandlingsskift
- blindet statistisk analyse, når dette er muligt
Almindelige forsøgsdesigns
| Design | Styrke | Særlig risiko eller analyseproblem |
|---|---|---|
| Individuelt parallelgruppedesign | Enkel tolkning, sædvanligvis robust | Kontaminering mellem deltagere, frafald |
| Klyngerandomiseret | Egnet til organisations- og gruppeinterventioner | Intraklyngekorrelation, rekruttering efter allokering |
| Overkrydsningsforsøg | Hver deltager er sin egen kontrol | Vedvarende behandlingseffekt og periodeeffekt |
| Faktorielt | Kan afprøve flere interventioner effektivt | Interaktion mellem interventionerne |
| Pragmatisk | Høj relevans for rutinemæssig klinisk praksis | Varierende adhærens, kointerventioner og implementering |
| Non-inferiority | Sammenligner ny behandling med effektiv standard | Valg af margin, analysepopulation og assay sensitivity |
| Adaptivt forsøg eller platformsforsøg | Kan modificere forsøget efter prædefinerede regler | Multiplicitet, samtidige kontrolgrupper og tidsmæssige ændringer |
| Pilot- og gennemførlighedsstudie | Afprøver, om et definitivt RCT kan gennemføres | Bør normalt ikke bruges til konklusioner om behandlingseffekt |
Klyngerandomisering
Ved klyngerandomisering allokeres eksempelvis lægepraksisser i primærsektoren, sygehuse eller kommuner frem for individer. Designet anvendes, når interventionen er rettet mod en organisation, eller når individuel randomisering ville give betydelig kontaminering.
Deltagere inden for samme klynge er korrelerede. Det effektive informationsindhold er derfor mindre end ved lige så mange uafhængige individer. Stikprøveberegning og analyse skal tage højde for intraklyngekorrelationen. I en gennemgang af 300 klyngeforsøg rapporterede kun 55 procent en stikprøveberegning, og 35 procent angav et mål for korrelation inden for klynger [8].
Særlig selektionsbias kan opstå, hvis individer identificeres, efter at klyngens allokering er blevet kendt. I en systematisk gennemgang af klyngeforsøg var omtrent en fjerdedel potentielt påvirket af rekrutteringsproceduren [9]. Inklusionskriterier og rekruttering bør derfor så vidt muligt fastlægges før randomiseringen eller udføres af personer uden kendskab til allokeringen. CONSORT har en særlig udvidelse for klyngerandomiserede forsøg [10].
Overkrydsningsforsøg
I et overkrydsningsforsøg får hver deltager flere interventioner i randomiseret rækkefølge. Designet kan være effektivt ved stabile kroniske tilstande, hurtigt reversibel behandlingseffekt og udfald, der kan måles gentagne gange.
Det er uegnet ved kurativ behandling, irreversible udfald, hurtigt progredierende sygdom eller langvarig behandlingseffekt. Periode- og sekvenseffekter skal tages i betragtning. En washout-periode kan mindske carryover, men garanterer ikke, at den elimineres.
Klynger kan også randomiseres til forskellige behandlingssekvenser over tid. Dette kan øge den statistiske effektivitet, men kræver analyse af korrelation inden for klynger, periodeeffekter og carryover på både individ- og klyngeniveau [11].
Pragmatisk eller eksplanatorisk tilgang
Pragmatisk og eksplanatorisk er endepunkter på et kontinuum. Et eksplanatorisk forsøg spørger primært, om interventionen virker under kontrollerede forhold. Et pragmatisk forsøg spørger, om den virker, når den indføres i almindelig klinisk praksis.
En pragmatisk tilgang omfatter ofte bredere inklusionskriterier, sædvanlig behandling som kontrol, fleksibel behandling, rutinemæssige kointerventioner og patientvigtige udfald. Begrebet pragmatisk indebærer dog ikke lavere metodekrav. Randomisering, allokering, udfaldsmåling og analyse skal stadig være robuste.
En systematisk gennemgang af 57 pragmatiske smerteforsøg viste, at interventionernes fleksibilitet og udfaldenes kliniske relevans ofte var god, mens rekrutteringen og den ekstra opfølgning, som forsøget krævede, var mindre repræsentative for rutinemæssig klinisk praksis [12].
Adaptive forsøg og platformsforsøg
Et adaptivt forsøg kan efter prædefinerede regler ændre eksempelvis stikprøvestørrelse, randomiseringsforhold eller hvilke behandlingsarme der fortsætter. Et platformsforsøg kan tilføje og afslutte behandlinger inden for en løbende protokol.
Disse designs kan udnytte ressourcerne effektivt, men stiller særlige krav til:
- simulationsbaseret planlægning
- kontrol af type 1-fejl
- uafhængig datamonitorering
- tydelige stopregler
- sammenlignelighed mellem samtidige grupper
- håndtering af tidsmæssige ændringer i population og behandling
- gennemsigtighed om alle tilpasninger
En ikke-samtidig kontrolgruppe kan være misvisende, hvis prognose, diagnostik eller standardbehandling ændrer sig over tid. Analysen skal derfor adskille den randomiserede samtidige sammenligning fra sammenligning med historiske eller ikke-samtidige kontroller.
Pilot- og gennemførlighedsstudier
Et pilotstudies hovedspørgsmål er, om et fremtidigt definitivt forsøg kan og bør gennemføres, og i så fald hvordan. Relevante udfald er rekruttering, fastholdelse, accept, adhærens, dataindsamling og prædefinerede kriterier for videre udvikling.
Pilotstudier er normalt for små til pålidelig hypotesetestning af klinisk effekt. Manglende statistisk signifikans viser ikke manglende effekt, og et nominelt signifikant fund har ofte lav reproducerbarhed. CONSORT-udvidelsen for pilotstudier fraråder derfor formel hypotesetestning af effekt, når studiet ikke er dimensioneret til dette [13].
Analyse af randomiserede forsøg
Intention-to-treat og analyse efter randomiseret gruppe
Grundprincippet i et superiority-forsøg er, at deltagerne analyseres i den gruppe, de blev randomiseret til, uanset adhærens, behandlingsskift eller fejlagtigt givet behandling. Dette bevarer randomiseringens prognostiske balance og estimerer ofte effekten af at blive allokeret til en behandlingsstrategi.
Betegnelsen intention-to-treat anvendes inkonsekvent. Rapporten bør derfor præcist angive:
- hvilke randomiserede deltagere der indgik
- hvilken gruppe de blev analyseret i
- hvordan manglende udfald blev håndteret
- om nogle deltagere blev ekskluderet, og hvorfor
En per-protokolanalyse inkluderer kun deltagere, der har opfyldt visse protokolkrav. Den kan være klinisk relevant, men er ikke længere beskyttet af randomiseringen. Adhærens kan afhænge af prognose, bivirkninger og tidligt behandlingsrespons. Per-protokolanalysen bliver derfor en ikke-randomiseret sammenligning, medmindre avancerede kausale metoder anvendes.
Manglende udfaldsdata
Frafald giver primært problemer, når sandsynligheden for, at et udfald mangler, er relateret til det sande udfald, behandlingen eller begge. Frafaldsandelen alene er derfor ikke tilstrækkelig til at vurdere bias.
Almindelige antagelser er:
- MCAR, frafaldet er helt uafhængigt af observerede og ikke-observerede data
- MAR, frafaldet kan forklares af observerede data
- MNAR, frafaldet afhænger også af ikke-observerede værdier
Komplet case-analyse kræver ofte MCAR eller andre stærke betingelser. Multipel imputation kan være rimelig under MAR, hvis imputationsmodellen inkluderer behandlingsgruppe, prognostiske variabler og faktorer, der forudsiger frafald og udfald. Ingen statistisk metode kan uden antagelser genskabe information, der aldrig er blevet observeret.
En metodologisk oversigt identificerede 101 arbejder om frafald. Hovedparten behandlede metoder under MAR eller MNAR, mens mange publicerede RCT stadig anvender metoder, der i praksis kræver den stærkere MCAR-antagelse [14]. Hovedanalysen bør derfor suppleres med følsomhedsanalyser under klinisk rimelige MNAR-scenarier.
Justerede analyser
Justering for stærke prognostiske baselinevariabler kan øge præcisionen. Variablerne og modellerne bør prædefineres. Justering for variabler, der er opstået efter randomiseringen, eksempelvis adhærens eller behandlingsrespons, kan introducere bias og ændre det spørgsmål, analysen besvarer.
Ved kontinuerte udfald er justering for baselineværdien ofte mere effektiv end analyse af ændringen fra baseline. Ved stratificeret randomisering bør stratifikationsfaktorerne sædvanligvis tages i betragtning i analysen.
Subgruppeanalyser
En subgruppeeffekt betyder, at behandlingseffekten er forskellig mellem grupper, ikke at effekten er signifikant i én gruppe, men ikke-signifikant i en anden. Den relevante analyse er en interaktionstest.
Troværdigheden øges, hvis:
- hypotesen og effektens retning blev specificeret på forhånd
- kun nogle få subgrupper blev afprøvet
- inddelingen bygger på baselinevariabler
- interaktionen er statistisk overbevisende
- samme mønster ses i beslægtede udfald og andre forsøg
- der findes en stærk biologisk eller klinisk forklaring
Subgruppeanalyser har ofte lav statistisk styrke, samtidig med at mange analyser giver høj risiko for falsk positive fund. I en gennemgang af RCT ved pulmonal hypertension anvendte kun 37 procent en interaktionstest. De fleste påstande om subgruppeeffekter opfyldte højst fire af ti troværdighedskriterier [15].
Superiority, non-inferiority og ækvivalens
Superiority
Et superiority-forsøg tester, om en intervention er bedre end kontrollen. Hvis konfidensintervallet inkluderer nuleffekt, kan man ikke konkludere, at behandlingerne er ligeværdige. Et ikke-signifikant resultat kan skyldes reel lighed, utilstrækkelig præcision, dårlig adhærens eller stort frafald.
Non-inferiority
Et non-inferiority-forsøg tester, om den nye behandling ikke er uacceptabelt dårligere end en etableret behandling. Marginen skal fastlægges før forsøget og angive det største effekttab, der kan accepteres. Den bør begrundes både klinisk og ud fra tidligere evidens for kontrolbehandlingens effekt [16].
Den nye behandling bør tilbyde en anden fordel, eksempelvis:
- færre alvorlige bivirkninger
- enklere administration
- lavere omkostninger
- bedre tilgængelighed
- mindre invasiv behandling
Dårlig adhærens, behandlingsskift og uspecifik udfaldsmåling kan gøre grupperne mere ens og dermed kunstigt favorisere konklusionen non-inferiority. Både analyse efter randomiseret gruppe og per-protokolanalyse bør normalt rapporteres, med ensartede konklusioner.
En systematisk gennemgang af 823 non-inferiority-forsøg viste, at marginen var angivet i ca. 95 procent, men kun begrundet i 57 procent af forsøgene fra 2019. Færre end halvdelen anvendte både intention-to-treat-lignende analyse og per-protokolanalyse, og mere end halvdelen var åbne forsøg [17].
Ækvivalens
Et ækvivalensforsøg tester, om behandlingseffekten ligger inden for et prædefineret interval på begge sider af nuleffekt. Ækvivalens kan derfor ikke påvises med en ikke-signifikant superiority-test. Hele konfidensintervallet skal ligge inden for begge ækvivalensgrænser.
Tolkning af resultater
Effektmål
For et binært udfald kan følgende beregnes:
- risiko i interventionsgruppen, EER
- risiko i kontrolgruppen, CER
- relativ risiko, RR = EER / CER
- absolut risikoforskel, RD = EER minus CER
- relativ risikoreduktion = 1 minus RR, når risikoen mindskes
- number needed to treat, NNT = 1 / absolut risikoreduktion
NNT skal rundes op til nærmeste hele tal og skal angives sammen med udfald, tidsperiode, kontrolrisiko og konfidensinterval. NNT er ikke en konstant egenskab ved et lægemiddel. Samme relative effekt giver større absolut gavn og lavere NNT ved højere baselinerisiko.
Oddsratio kan overvurdere indtrykket af en relativ risiko, når udfaldet er hyppigt. Hazard ratio beskriver en relativ øjeblikkelig hændelsesintensitet og er ikke direkte ensbetydende med relativ risiko eller forskel i medianoverlevelse. Proportionalitetsantagelsen bør være rimelig.
For kontinuerte udfald bør middelværdiforskellen tolkes i forhold til skalaens klinisk vigtige forskel. Standardiseret middelværdiforskel letter sammenligning mellem forskellige skalaer, men udtrykkes i standardafvigelser og er mindre intuitiv.
P-værdi og konfidensinterval
P-værdien er sandsynligheden, under den statistiske model og nulhypotesen, for at opnå et resultat mindst lige så ekstremt som det observerede. Den er ikke sandsynligheden for, at nulhypotesen er sand, og angiver ikke effektens størrelse eller kliniske betydning.
Et 95 %-konfidensinterval viser både effektens retning og præcision. Ved vurderingen bør man spørge:
- Inkluderer intervallet nuleffekt?
- Inkluderer det en klinisk vigtig gavn?
- Inkluderer det en klinisk vigtig skade?
- Er intervallet tilstrækkeligt smalt til at træffe beslutning?
Dikotomisering ved P = 0,05 er ofte misvisende. Resultater med P = 0,049 og P = 0,051 er ikke principielt forskellige. Fokus bør ligge på estimat, præcision, forsøgskvalitet og overensstemmelse med øvrig evidens.
Rapporteringen er ofte dårligere end anbefalet. I en gennemgang af 88 kirurgiske RCT rapporterede 68 procent kun P-værdi og ikke 95 %-konfidensinterval for gavn. Kun 6 procent angav NNT, og ingen angav number needed to harm [18].
Gavn og skade
Alle relevante udfald skal vejes sammen. En moderat reduktion af et hyppigt, mildt udfald kan være mindre betydningsfuld end en lille stigning i en sjælden, alvorlig skade.
Vurdér:
- hvordan bivirkninger blev defineret og efterspurgt
- om indsamlingen var aktiv eller passiv
- opfølgningstid
- antal eksponerede deltagere
- behandlingsophør på grund af bivirkninger
- alvorlige hændelser og mortalitet
- absolutte risici og konfidensintervaller
CONSORT Harms anbefaler gennemsigtig rapportering af, hvordan skader blev defineret, indsamlet, kodet og analyseret [19]. Et RCT er ofte dimensioneret til effekt, ikke til sjældne skader, hvilket gør usikkerheden om sikkerhedsudfald stor.
Kritisk vurdering i klinisk praksis
flowchart TD
A["Definér klinisk spørgsmål<br>og relevant estimand"] --> B["Sammenlign protokol, register<br>og publikation"]
B --> C["Vurdér randomisering<br>og skjult allokering"]
C --> D["Vurdér afvigelser,<br>blinding og kointerventioner"]
D --> E["Vurdér frafald<br>og udfaldsmåling"]
E --> F["Kontrollér analysegruppe,<br>multiplicitet og selektion"]
F --> G["Tolk effektstørrelse<br>og 95 %-KI"]
G --> H["Afvej absolut gavn<br>mod skade"]
H --> I["Vurdér overførbarhed<br>til patient og behandlingskontekst"]Trin 1: Er spørgsmålet relevant?
Identificér population, intervention, sammenligning, udfald og tidspunkt. Kontrollér, om forsøgets primære spørgsmål svarer til din kliniske beslutning. Et veludført forsøg kan være irrelevant, hvis kontrolbehandlingen, dosis eller behandlingskonteksten ikke svarer til svensk praksis.
Trin 2: Var metoderne prædefinerede?
Søg efter registreringsnummer, protokol og statistisk analyseplan. Sammenlign:
- primært udfald
- tidspunkt
- stikprøvestørrelse
- subgrupper
- analysepopulation
- stopregler
- non-inferiority-margin
Ændringer kan være berettigede, men tidspunktet for og årsagen til dem skal angives. Ændringer foretaget efter adgang til udfaldsdata har større risiko for at være resultatstyrede.
Trin 3: Er der risiko for bias?
RoB 2 vurderer fem hoveddomæner:
- randomiseringsprocessen
- afvigelser fra de tilsigtede interventioner
- manglende udfaldsdata
- måling af udfald
- selektion af det rapporterede resultat
Vurderingen skal gælde et specifikt resultat, fordi risikoen kan være forskellig for eksempelvis mortalitet og selvrapporteret smerte. RoB 2 giver kategorierne lav risiko, visse betænkeligheder og høj risiko, ikke en numerisk kvalitetsscore [3].
Trin 4: Er resultatet klinisk vigtigt?
Tag udgangspunkt i den prædefinerede primære analyse. Søg efter absolutte hændelsestal, risikoforskel og konfidensinterval. Vurdér, om effektens størrelse når en klinisk vigtig tærskel, og om den berettiger omkostninger, behandlingsbyrde og skader.
Vær opmærksom på spin. I en gennemgang af 93 kardiovaskulære RCT med ikke-signifikant primært udfald forekom positivt vinklet rapportering i 57 procent af abstracts og 67 procent af hovedteksterne [20]. Almindelige strategier var fokus på signifikante sekundære udfald, subgrupper eller ændringer inden for behandlingsgruppen.
Trin 5: Er resultatet overførbart?
Intern validitet besvarer, om resultatet er troværdigt i den undersøgte population. Ekstern validitet vedrører, om resultatet kan anvendes på andre patienter og behandlingsmiljøer.
Vurdér især:
- alder og skrøbelighed
- køn og etnicitet
- komorbiditet og polyfarmaci
- sygdomssværhedsgrad og baselinerisiko
- tidligere behandling
- behandlingsniveau og behandlerens kompetence
- adhærens og adgang til monitorering
- interventionens faktiske dosis og intensitet
En systematisk oversigt over 305 RCT fandt en median eksklusionsandel på 77,1 procent, når forsøgenes kriterier blev anvendt på kliniske populationer. Hyppige årsager var alder, komorbiditet og samtidig medicinering [21]. Relative effekter kan undertiden overføres mellem risikoniveauer, men absolutte effekter og skader ændrer sig, når baselinerisikoen er forskellig.
Trin 6: Stemmer resultatet overens med øvrig evidens?
Et enkelt RCT er sjældent alene afgørende. Vurdér forsøget sammen med:
- andre RCT
- systematiske oversigter og metaanalyser
- biologisk plausibilitet
- sikkerhedsdata
- patientpræferencer
- ressourceforbrug og gennemførlighed
Store effekter i et lille, tidligt stoppet eller metodologisk svagt forsøg kræver særlig forsigtighed. Replikation i uafhængige forsøg og konsistente absolutte effekter styrker pålideligheden.
Rapportering og forskningsintegritet
CONSORT 2025 omfatter en tjekliste med 30 punkter og et deltagerflow. Nyere elementer vedrører bl.a. datadeling, interessekonflikter, patientinddragelse, skader, analysegrupper, manglende data og hvordan interventionen faktisk blev gennemført [1]. CONSORT skal anvendes sammen med relevante udvidelser for eksempelvis klyngeforsøg, non-inferiority, adaptive designs og pilotstudier.
En fuldstændig CONSORT-rapport er ikke nødvendigvis et veludført forsøg. Tjeklisten angiver, hvad der skal rapporteres, ikke hvilke metodevalg der altid er korrekte. Omvendt kan et metodologisk robust forsøg være umuligt at vurdere, hvis rapporteringen er ufuldstændig.
Pålidelig rapportering kræver:
- prospektiv registrering før den første randomisering
- offentlig protokol og analyseplan
- redegørelse for alle vigtige protokolændringer
- CONSORT-flowdiagram
- resultater for alle prædefinerede primære og sekundære udfald
- absolutte og relative effekter med konfidensintervaller
- gennemsigtig rapportering af skader
- finansiering og interessekonflikter
- information om adgang til afidentificerede data og analysekode
CONSORT 2025 erstatter CONSORT 2010. Ældre publikationer skal naturligvis vurderes ud fra den tilgængelige information, men ved planlægning, rapportering og vurdering af nye RCT bør 2025-versionen anvendes [1,2].
Kilder
- Hopewell S et al. CONSORT 2025 statement: updated guideline for reporting randomised trials. BMJ 2025. PMID: 40228833
- Hopewell S et al. CONSORT 2025 explanation and elaboration: updated guideline for reporting randomised trials. BMJ 2025. PMID: 40228832
- Sterne JAC et al. RoB 2: a revised tool for assessing risk of bias in randomised trials. BMJ 2019. PMID: 31462531
- Wang H et al. Trial-level characteristics associate with treatment effect estimates: a systematic review of meta-epidemiological studies. BMC Medical Research Methodology 2022. PMID: 35705904
- Chan AW et al. SPIRIT 2025 statement: updated guideline for protocols of randomised trials. BMJ 2025. PMID: 40294953
- Manyara AM et al. Reporting of surrogate endpoints in randomised controlled trial reports (CONSORT-Surrogate): extension checklist with explanation and elaboration. BMJ 2024. PMID: 38981645
- Cook JA et al. Choosing the target difference ('effect size') for a randomised controlled trial: DELTA2 guidance protocol. Trials 2017. PMID: 28606102
- Rutterford C et al. Reporting and methodological quality of sample size calculations in cluster randomized trials could be improved: a review. Journal of Clinical Epidemiology 2015. PMID: 25523375
- Eldridge S et al. Internal and external validity of cluster randomised trials: systematic review of recent trials. BMJ 2008. PMID: 18364360
- Campbell MK et al. Consort 2010 statement: extension to cluster randomised trials. BMJ 2012. PMID: 22951546
- McKenzie JE et al. Reporting of cluster randomised crossover trials: extension of the CONSORT 2010 statement with explanation and elaboration. BMJ 2025. PMID: 39761979
- Hohenschurz-Schmidt D et al. Pragmatic trials of pain therapies: a systematic review of methods. Pain 2022. PMID: 34490854
- Eldridge SM et al. CONSORT 2010 statement: extension to randomised pilot and feasibility trials. BMJ 2016. PMID: 27777223
- Medcalf E et al. Addressing missing outcome data in randomised controlled trials: A methodological scoping review. Contemporary Clinical Trials 2024. PMID: 38857674
- Rodríguez-Ramallo H et al. Subgroup Analysis in Pulmonary Hypertension-Specific Therapy Clinical Trials: A Systematic Review. Journal of Personalized Medicine 2022. PMID: 35743648
- Piaggio G et al. Reporting of noninferiority and equivalence randomized trials: extension of the CONSORT 2010 statement. JAMA 2012. PMID: 23268518
- Sengul A et al. Non-Inferiority Trials: A Systematic Review on Methodological Quality and Reporting Standards. Journal of General Internal Medicine 2024. PMID: 38954320
- Stubenrouch FE et al. Systematic review of reporting benefits and harms of surgical interventions in randomized clinical trials. BJS Open 2020. PMID: 32207574
- Junqueira DR et al. CONSORT Harms 2022 statement, explanation, and elaboration: updated guideline for the reporting of harms in randomised trials. BMJ 2023. PMID: 37094878
- Khan MS et al. Level and Prevalence of Spin in Published Cardiovascular Randomized Clinical Trial Reports With Statistically Nonsignificant Primary Outcomes: A Systematic Review. JAMA Network Open 2019. PMID: 31050775
- He J et al. Exclusion rates in randomized controlled trials of treatments for physical conditions: a systematic review. Trials 2020. PMID: 32102686