Sammenfatning
Fortolkning af studieresultater bør følge en fast rækkefølge. Begynd med spørgsmålet, studiedesignet og det primære endepunkt. Vurdér derefter risikoen for systematiske fejl, læs effektstørrelsen sammen med dens konfidensinterval, og omsæt relative effekter til absolutte konsekvenser ved en relevant baselinerisiko. Først derefter bør p-værdien tages i betragtning. Statistisk signifikans viser hverken, at effekten er klinisk vigtig, eller at resultatet er fri for bias. Et ikke-signifikant resultat viser ikke, at behandlingerne er ligeværdige.
Randomiserede studier giver som regel det bedste grundlag for behandlingseffekter, men randomisering beskytter ikke mod mangelfuld skjult allokering, frafald, selektiv rapportering eller uhensigtsmæssige analyser. Observationelle studier kan være nødvendige for prognose, sjældne bivirkninger og langtidseffekter, men associationer skal vurderes med særligt hensyn til confounding, selektion og tidsrelateret bias. Systematiske oversigter er ikke automatisk pålidelige. Deres værdi afhænger af søgning, inklusion af studier, risiko for bias, heterogenitet og publikationsbias.
Endelig skal resultatets anvendelighed vurderes i forhold til den aktuelle patients risiko, komorbiditet, behandlingsalternativer, værdier og opfølgningstid. En rimelig klinisk konklusion redegør derfor for effektens retning, størrelse, usikkerhed, evidensens pålidelighed samt forventet absolut gavn og skade.
En praktisk rækkefølge for fortolkning
Rapporteringsretningslinjer som CONSORT, STROBE og PRISMA forbedrer gennemsigtigheden i rapporter om henholdsvis randomiserede studier, observationelle studier og systematiske oversigter [1-3]. De er derimod ikke kvalitetsstempler. Et velskrevet studie kan være metodologisk svagt, mens et mangelfuldt rapporteret studie undertiden kan være velgennemført, men umuligt at vurdere.
Følgende arbejdsgang mindsker risikoen for, at konklusionen styres af artiklens titel, abstract eller p-værdi:
flowchart TD
A["Formulér det kliniske spørgsmål<br>og identificér studiedesignet"] --> B["Kontrollér population,<br>intervention, sammenligning og endepunkt"]
B --> C["Identificér primært endepunkt<br>og forhåndsregistreret analyse"]
C --> D["Vurdér risiko for systematiske fejl<br>og frafald"]
D --> E["Læs effektstørrelse og<br>konfidensinterval"]
E --> F["Beregn absolut effekt<br>ved relevant baselinerisiko"]
F --> G["Vurdér klinisk betydning,<br>skader og opfølgningstid"]
G --> H["Vurdér konsistens,<br>indirekthed og publikationsbias"]
H --> I["Afgør, om resultatet kan<br>anvendes på patienten"]GRADE skelner mellem enkeltstudiers metodologiske kvalitet og pålideligheden af et samlet evidensgrundlag. Evidensens pålidelighed graderes som høj, moderat, lav eller meget lav ud fra risiko for bias, inkonsistens, indirekthed, manglende præcision og publikationsbias. Graderingen af evidens skal holdes adskilt fra anbefalingens styrke, fordi også gavn, skade, ressourceforbrug og patientpræferencer påvirker en klinisk beslutning [4].
Begynd med det rette spørgsmål og det rette studiedesign
Strukturér spørgsmålet
Et behandlingsspørgsmål kan sædvanligvis beskrives med:
- Population: Hvilke patienter blev undersøgt?
- Intervention: Hvilken behandling, dosis, intensitet og behandlingsvarighed blev anvendt?
- Sammenligning: Placebo, ingen behandling, standardbehandling eller aktiv kontrol?
- Endepunkt: Hvilke patientvigtige endepunkter blev målt?
- Tid: Hvornår blev endepunktet målt?
Spørgsmålet skal svare til studiets estimand, altså den effekt, som analysen faktisk sigter mod at estimere. Effekten af at blive tildelt behandling, effekten af at påbegynde behandling og effekten af at følge behandlingen i henhold til protokollen er forskellige spørgsmål.
Vælg studiedesign efter spørgsmålet
| Klinisk spørgsmål | Sædvanligvis mest informative design | Vigtige begrænsninger |
|---|---|---|
| Effekt af behandling eller forebyggelse | Randomiseret kontrolleret studie | Frafald, overkrydsning, mangelfuld blinding, kort opfølgning |
| Sjældne eller sene bivirkninger | Stor kohorte, registerstudie, case-kontrol-studie | Confounding, fejlklassifikation, selektion |
| Diagnostisk nøjagtighed | Tværsnitsstudie eller prospektiv kohorte med relevant referencestandard | Spektrumbias, verifikationsbias, uhensigtsmæssig tærskelværdi |
| Prognose | Inceptionskohorte med tilstrækkelig opfølgning | Selektivt frafald, overtilpasning, konkurrerende hændelser |
| Prævalens | Repræsentativt tværsnitsstudie | Udvælgelses- og frafaldsbias |
| Samlet behandlingseffekt | Systematisk oversigt og metaanalyse | Mangler i søgning, primærstudier, syntese eller rapportering |
Studiedesignet bestemmer, hvilke konklusioner der er mulige. Et randomiseret studie kan understøtte en kausal behandlingseffekt. Et observationelt studie viser primært en association, også efter statistisk justering. Et diagnostisk studie viser, hvordan en test klassificerer patienter, ikke nødvendigvis om indførelsen af testen forbedrer helbredet.
Vurdér intern validitet før resultaternes størrelse
Randomiserede studier
Randomisering skaber sammenlignelige grupper i forventning, men kun hvis tildelingssekvensen er tilfældig og skjult indtil inklusion. Skjult allokering må ikke forveksles med blinding:
- Skjult allokering forhindrer den, der inkluderer patienter, i at forudse den næste tildeling.
- Blinding forhindrer deltagere, behandlere eller endepunktsbedømmere i at blive påvirket af kendskab til tildelingen.
Metaepidemiologiske data viser, at utilstrækkelig eller uklar sekvensgenerering og skjult allokering i gennemsnit er forbundet med overdrevne behandlingseffekter. Problemet er tydeligst for subjektivt bedømte endepunkter og ved manglende blinding af endepunktsbedømmere [5].
Gennemgå som minimum følgende:
- Var randomiseringsmetoden troværdig?
- Var tildelingen skjult indtil inklusion?
- Var blinding mulig, gennemført og sandsynligvis vellykket?
- Var det primære endepunkt defineret før indsigt i data?
- Blev grupperne analyseret i henhold til den oprindelige tildeling?
- Hvor stort var frafaldet, hvorfor opstod det, og var det forskelligt mellem grupperne?
- Var opfølgningen tilstrækkelig lang for både gavn og skade?
- Stemmer publikationen overens med protokol, register og statistisk analyseplan?
Statistiske signifikanstest af baselinevariabler bør ikke anvendes til at afgøre, om randomiseringen lykkedes. Tilfældige forskelle må forventes. Vigtigere er, om forskellene er prognostisk betydningsfulde, om de kan være opstået ved selektion efter randomisering, og om den planlagte analyse håndterede stærke prognostiske faktorer.
Intention-to-treat og per protokol
En intention-to-treat-analyse sammenligner deltagerne i henhold til randomiseret gruppe, uanset adhærens og overkrydsning. Den bevarer randomiseringens prognostiske balance og estimerer som regel effekten af en behandlingsstrategi eller behandlingstildeling.
En per-protokol-analyse begrænser eller omklassificerer deltagere efter adhærens. Den kan bedre tilnærme sig effekten af faktisk at følge behandlingen, men randomiseringens beskyttelse kan gå tabt, fordi adhærens ofte hænger sammen med prognose.
Begrebet modificeret intention-to-treat har ingen ensartet betydning. Læs præcist, hvilke deltagere der er blevet udelukket. Eksklusion efter randomisering, for eksempel af patienter, der aldrig tog en dosis eller manglede en bestemt prøve, kan skabe selektionsbias.
Frafald og manglende data
Frafaldsandelen alene afgør ikke risikoen for bias. Fem procents frafald kan være alvorligt, hvis det er relateret til behandling og endepunkt, mens et større tilfældigt frafald undertiden har mindre betydning. Vurdér:
- absolut antal og andel i hver gruppe
- årsager og tidspunkt
- om endepunktet kunne være indtruffet efter seneste kontakt
- antagelser ved imputering
- sensitivitetsanalyser under alternative antagelser
En analyse af positive kardiovaskulære studier fandt en medianværdi for fragilitetsindekset på 13. I omkring 30 procent af studierne oversteg antallet af patienter tabt til opfølgning fragilitetsindekset [6]. Fragilitetsindekset angiver, hvor få hændelser der skal ændres, for at et signifikant binært resultat bliver ikke-signifikant. Målet kan illustrere statistisk skrøbelighed, men erstatter ikke effektstørrelse, konfidensinterval eller risiko for bias.
Finansiering og interessekonflikter
Finansiering er ikke i sig selv bevis for, at et studie er forkert, men skal indgå i den samlede vurdering. I et metodologisk Cochrane-review var industrisponsorerede lægemiddel- og medicoudstyrsstudier oftere gunstige for sponsorens produkt, både hvad angår effektresultater og konklusioner. Forskellen blev ikke fuldt forklaret af de sædvanlige risiko for bias-domæner [7].
Kontrollér derfor sponsorens rolle i design, datahåndtering, analyse, manuskript og beslutning om publicering. Læs forfatternes økonomiske relationer, og om uafhængige forskere havde adgang til de fuldstændige data.
Forstå effektmålene
Et studieresultat bør beskrives med tre komponenter:
- Punktestimatet, det estimat der er mest foreneligt med de observerede data.
- Usikkerheden, sædvanligvis et 95-procents konfidensinterval.
- Den kliniske skala, for eksempel absolut risiko, symptomscore eller overlevelsestid.
Binære endepunkter
Antag hypotetisk, at en hændelse indtræffer hos 20 procent i kontrolgruppen og 15 procent i behandlingsgruppen.
| Mål | Beregning | Resultat | Fortolkning |
|---|---|---|---|
| Risiko i kontrolgruppen | 20 af 100 | 20 procent | Baselinerisiko |
| Risiko i behandlingsgruppen | 15 af 100 | 15 procent | Risiko under behandling |
| Risikoratio, RR | 0,15 / 0,20 | 0,75 | Den relative risiko er 25 procent lavere |
| Relativ risikoreduktion | 1 minus 0,75 | 25 procent | Relativ reduktion |
| Absolut risikoreduktion | 0,20 minus 0,15 | 5 procentpoint | 5 færre hændelser pr. 100 |
| Number needed to treat, NNT | 1 / 0,05 | 20 | 20 skal behandles i den angivne periode for at forebygge én hændelse |
NNT skal altid knyttes til population, behandling, endepunkt og tid. Et NNT på 20 efter fem år er ikke sammenligneligt med et NNT på 20 efter 30 dage. NNT afrundes sædvanligvis opad til nærmeste heltal, når det beskriver gavn. Ved skade anvendes ofte number needed to harm, NNH.
Den absolutte effekt afhænger af baselinerisikoen. Hvis RR 0,75 kan overføres til en population med 4 procents risiko, bliver risikoen under behandling ca. 3 procent, den absolutte risikoreduktion 1 procentpoint og NNT ca. 100. Den samme relative effekt kan derfor være klinisk betydningsfuld hos højrisikopatienter, men marginal hos lavrisikopatienter.
Oddsratio
Oddsratioen, OR, sammenligner odds frem for risici. Hvis hændelsen er sjælden, ligger OR tæt på RR. Ved hyppige endepunkter kan OR give et stærkere indtryk af effekten og bør ikke beskrives som en risikoratio.
I case-kontrol-studier kan den absolutte risiko normalt ikke beregnes direkte ud fra stikprøven, fordi antallet af cases og kontroller bestemmes af studiedesignet. OR er her et naturligt associationsmål.
Kontinuerte endepunkter
En gennemsnitsforskel bevarer den oprindelige enhed, eksempelvis 4 mm Hg lavere systolisk blodtryk eller 1,5 point lavere smerte. Spørg, om forskellen er større end målefejlen og klinisk vigtig.
Standardiseret gennemsnitsforskel anvendes, når studier måler det samme fænomen med forskellige skalaer. Resultatet udtrykkes i standardafvigelser og er mindre intuitivt. Dets kliniske betydning afhænger af skalaernes validitet og variationen i de undersøgte populationer.
En mindste klinisk vigtig forskel er ikke en universel naturkonstant. Den kan afhænge af udgangsværdi, sygdomsgrad, patientperspektiv, metode, og om ændringen gælder individ eller gruppe. Sammenlign derfor konfidensintervallet både med nul og med en på forhånd begrundet klinisk grænse.
Tidsafhængige endepunkter
En hazard ratio, HR, sammenligner den øjeblikkelige hændelsesintensitet mellem grupperne. HR 0,75 betyder ikke automatisk, at 25 procent af hændelserne forebygges, at overlevelsen forlænges med 25 procent, eller at risikoen på et givet tidspunkt er 25 procent lavere.
Fortolk HR sammen med:
- Kaplan-Meier-kurver eller kumulative incidenskurver
- antal patienter i risiko over tid
- absolutte hændelsesrisici på klinisk relevante tidspunkter
- median opfølgning
- vurdering af antagelsen om proportionale hazarder
Hvis kurverne krydser hinanden, kan en enkelt HR være misvisende. Alternativer som begrænset gennemsnitlig overlevelsestid kan da være mere informative.
Ved konkurrerende risici, eksempelvis anden død før nyresvigt, kan den sædvanlige Kaplan-Meier-metode overestimere sandsynligheden for det aktuelle endepunkt. I en gennemgang af randomiserede studier med tidsafhængige endepunkter var 31 af 40 potentielt udsat for konkurrerende risici, men kun fem rapporterede kumulativ incidensfunktion [8]. Konkurrerende hændelser bør ikke ukritisk håndteres som almindelig censurering.
Konfidensintervaller, p-værdier og klinisk betydning
Konfidensintervallet
Et 95-procents konfidensinterval beskriver, hvilke effektstørrelser der er forenelige med data og modellens antagelser. I gentagne studier med samme metode ville 95 procent af de beregnede intervaller dække den sande parameterværdi.
Nulværdien er:
- RR, OR eller HR = 1
- risikoforskel eller gennemsnitsforskel = 0
Et smalt interval viser højere præcision end et bredt interval, men præcision garanterer ikke korrekthed. Et meget stort observationelt studie kan give et ekstremt smalt interval omkring et skævt estimat.
Fire hyppige mønstre er:
| Resultat | Konfidensinterval | Rimelig fortolkning |
|---|---|---|
| Klinisk vigtig effekt | Udelukker nul og triviel effekt | Støtte for relevant effekt, hvis lav risiko for bias |
| Statistisk signifikant, men triviel effekt | Udelukker nul, men ligger tæt på den kliniske grænse | Sandsynligvis lille klinisk gavn |
| Ikke-signifikant og præcist | Udelukker klinisk vigtig effekt | Støtte imod en meningsfuld effekt |
| Ikke-signifikant og upræcist | Omfatter både vigtig gavn og skade | Utilstrækkelig information, ikke bevis for manglende effekt |
P-værdien
P-værdien er sandsynligheden, givet nulhypotesen og analysemodellens antagelser, for at observere et resultat mindst lige så ekstremt som det opnåede. Den er ikke:
- sandsynligheden for, at nulhypotesen er sand
- sandsynligheden for, at resultatet skyldes tilfældigheder
- effektens størrelse
- sandsynligheden for, at resultatet kan replikeres
- et mål for klinisk betydning
Grænsen 0,05 er en konvention, ikke en biologisk skillelinje. Resultater med p = 0,049 og p = 0,051 bør ikke behandles som kvalitativt modsatte. Rapportér og fortolk den eksakte p-værdi sammen med effektstørrelse og konfidensinterval.
Multiple analyser
Hvis 20 uafhængige hypoteser testes med signifikansniveauet 0,05, er sandsynligheden for mindst ét falsk positivt resultat ca. 64 procent, når alle nulhypoteser er sande. Risikoen øges ved mange:
- endepunkter
- tidspunkter
- doser
- subgrupper
- statistiske modeller
- alternative definitioner
Afgør derfor, om analysen var prædefineret, hierarkisk testet eller korrigeret for multiplicitet. Et signifikant sekundært endepunkt vejer let, hvis det primære endepunkt var negativt, og der ikke fandtes nogen multiplicitetsstrategi.
Misvisende fremstilling, ofte kaldet spin, indebærer, at forfatterne fremhæver sekundære endepunkter, subgrupper eller gunstige formuleringer, selv om det primære endepunkt ikke understøtter konklusionen. I en systematisk gennemgang af negative non-inferiority-studier inden for onkologi blev der identificeret spin i 75 procent af rapporterne [9]. Læs derfor resultatafsnittet før diskussionens konklusion.
Endepunkternes relevans
Primære, sekundære og eksplorative endepunkter
Det primære endepunkt styrer sædvanligvis stikprøvestørrelsesberegningen og den overordnede hypotesetestning. Sekundære endepunkter kan give vigtig supplerende information, men har ofte lavere statistisk sikkerhed. Post hoc-analyser er hypotesegenererende.
Kontrollér, at:
- det primære endepunkt er det samme i register, protokol, analyseplan og publikation
- tidspunktet ikke er blevet ændret
- endepunktsdefinitionen ikke er blevet modificeret efter indsigt i data
- alle prædefinerede vigtige endepunkter rapporteres
Patientvigtige endepunkter og surrogater
Mortalitet, funktion, symptomer, livskvalitet, hospitalsindlæggelse og alvorlige komplikationer er sædvanligvis mere direkte relevante end laboratorieværdier eller billeddiagnostiske mål. Et surrogatendepunkt kan være anvendeligt, hvis det er velvalideret for den aktuelle sygdom, behandlingsmekanismen og patientgruppen. En sammenhæng mellem surrogat og klinisk endepunkt er ikke tilstrækkelig. Der skal også være belæg for, at behandlingens effekt på surrogatet pålideligt forudsiger effekten på det patientvigtige endepunkt.
Sammensatte endepunkter
Sammensatte endepunkter øger antallet af hændelser og den statistiske præcision, men kan skjule, hvilken komponent der driver resultatet. Vurdér komponenterne hver for sig med hensyn til:
- betydning for patienten
- hyppighed
- effektens retning og størrelse
- følsomhed over for bedømmerens beslutninger
Jo større forskel i klinisk betydning og hyppighed mellem komponenterne, desto mindre informativt er det sammensatte endepunkt. En reduktion af kombinationen død, infarkt eller kontakt med sundhedsvæsenet kan helt være drevet af flere kontakter med sundhedsvæsenet uden påvist effekt på død eller infarkt [10].
Bivirkninger
Fravær af statistisk signifikant forskel i bivirkninger viser sjældent, at behandlingerne er lige sikre. Studier dimensioneres sædvanligvis efter effekt, ikke efter sjældne skader. Gennemgå aktiv kontra passiv indsamling, definitioner, eksponeringstid, antal behandlede, og om behandlingsophør er medregnet.
Publicerede artikler kan indeholde betydeligt mindre information om skader end kliniske studierapporter. I en sammenligning af fem orlistatstudier var metoder og fuldstændige bivirkningsdata mere udførligt beskrevet i studierapporterne end i tidsskriftspublikationerne [11]. Til sikkerhedsvurdering kræves derfor ofte registerdata, regulatoriske rapporter og længerevarende observationelle studier ud over randomiserede studier.
Særlige studiedesign
Non-inferiority og ækvivalens
Et non-inferiority-studie skal vise, at den nye behandling ikke er dårligere end kontrollen med mere end en prædefineret margin. Det viser ikke, at behandlingerne er identiske. Marginen skal være klinisk og metodologisk begrundet.
Fortolkningen bør baseres på konfidensintervallets relation til både nulforskellen og marginen. Både intention-to-treat- og per-protokol-analyse er vigtige, fordi manglende adhærens kan få behandlinger til at fremstå mere ens og dermed favorisere konklusionen non-inferiority.
I en gennemgang af 209 non-inferiority- og ækvivalensstudier var marginen defineret i 94 procent, men begrundet i kun omkring en fjerdedel. Både intention-to-treat- og per-protokol-analyse blev rapporteret i mindre end halvdelen, og 21 procent af konklusionerne blev vurderet som forkerte eller uforståelige [12].
Et ikke-signifikant resultat i et almindeligt superiority-studie beviser ikke non-inferiority eller ækvivalens. Sådanne konklusioner kræver et særligt designet studie med prædefineret margin og tilstrækkelig præcision.
Subgrupper
Et resultat, der er signifikant i én undergruppe, men ikke i en anden, viser ikke, at behandlingseffekten er forskellig mellem grupperne. Det kræver en interaktionstest.
En troværdig subgruppeeffekt bør:
- være prædefineret
- bygge på en biologisk eller klinisk plausibel hypotese
- omfatte få testede subgrupper
- vise en statistisk understøttet interaktion
- være konsistent på tværs af beslægtede endepunkter
- helst være bekræftet i andre studier
Subgrupper baseret på variabler målt efter randomisering, eksempelvis adhærens eller tidligt behandlingsrespons, er særligt følsomme for bias.
Diagnostiske studier
Fra sensitivitet til klinisk beslutning
Sensitivitet er andelen af syge, der tester positivt. Specificitet er andelen af ikke-syge, der tester negativt. Disse mål påvirkes mindre direkte af prævalensen end prædiktive værdier, men varierer med sygdomsspektrum, tærskelværdi, forudgående testning og klinisk setting [13].
Positiv prædiktiv værdi angiver sandsynligheden for sygdom efter en positiv test i den undersøgte population. Negativ prædiktiv værdi angiver sandsynligheden for fravær af sygdom efter en negativ test. Begge ændres, når prævalensen eller patientselektionen ændres.
Likelihood ratioer er ofte mere overførbare:
- Positiv likelihood ratio: sensitivitet / (1 minus specificitet)
- Negativ likelihood ratio: (1 minus sensitivitet) / specificitet
Posttestodds beregnes som prætestodds ganget med likelihood ratioen. Sandsynlighed omregnes til odds med formlen .
En test med positiv likelihood ratio 10 giver en betydeligt større stigning i sygdomssandsynligheden end en test med positiv likelihood ratio 2. Den kliniske nytte afhænger alligevel af, om posttestsandsynligheden passerer en tærskel for behandling, yderligere testning eller exspektans.
Risiko for bias i diagnostiske studier
STARD anbefaler gennemsigtig rapportering af blandt andet patientselektion, indekstest, referencestandard, tærskelværdier, blinding, ubestemte resultater og patientflow [14]. QUADAS-2 strukturerer vurderingen i fire domæner: patientselektion, indekstest, referencestandard samt flow og timing [15].
Vær særligt opmærksom på:
- case-kontrol-design med svært syge cases og raske kontroller
- eksklusion af patienter, der er vanskelige at klassificere
- at kun testpositive får referencestandarden
- forskellige referencestandarder i forskellige grupper
- kendskab til indekstesten ved fortolkning af referencestandarden
- datadrevet valg af optimal tærskelværdi
- lang eller varierende tid mellem testene
AUC for en ROC-kurve sammenfatter diskrimination over mange mulige tærskler, men afgør ikke, hvilken tærskelværdi der er klinisk hensigtsmæssig, og tager ikke direkte højde for konsekvenserne af falsk positive og falsk negative resultater.
Prognosemodeller og risikoprædiktion
En prognosemodel skal ikke vurderes alene ud fra statistisk signifikante prædiktorer. Vigtigere er:
- diskrimination, modellens evne til at rangordne risiko
- kalibrering, overensstemmelsen mellem prædikteret og observeret risiko
- klinisk nytte ved relevante beslutningstærskler
- intern og ekstern validering
- håndtering af manglende data
- risiko for overtilpasning
Et højt C-indeks kan sameksistere med dårlig kalibrering. En model kan altså rangordne patienter godt, men systematisk overestimere eller underestimere deres absolutte risiko. TRIPOD angiver rapporteringskrav for udvikling, validering og opdatering af diagnostiske og prognostiske modeller [16].
Resultater fra udviklingsdata alene er ofte optimistiske. Tilfældig opdeling af et lille datasæt i trænings- og testdel er sædvanligvis mindre effektiv end at anvende hele datasættet med bootstrap eller krydsvalidering til intern validering. Klinisk anvendelse kræver desuden ekstern validering i en anden tidsperiode, setting eller population.
Observationelle studier
Association er ikke automatisk kausalitet
Confounding opstår, når en faktor påvirker både eksponeringen og endepunktet. Ved confounding by indication får eksempelvis mere syge patienter oftere en behandling, hvilket kan få behandlingen til at se skadelig ud. Omvendt kan selektion af raskere behandlede patienter skabe en tilsyneladende gavn.
Statistisk justering eliminerer kun confounding fra variabler, der er målt tilstrækkeligt godt og modelleret korrekt. Propensity score, matchning og regressionsanalyse gør ikke et observationelt studie randomiseret.
Vurdér særligt:
- hvordan behandlede og ubehandlede blev udvalgt
- om vigtige prognostiske faktorer blev målt før behandling
- balance før og efter justering
- overlap i behandlingssandsynlighed
- fejlklassifikation af eksponering og endepunkt
- negativ kontrol eller andre sensitivitetsanalyser
- om resultaterne er robuste over for ukendt confounding
Tidsrelateret bias
Immortal time bias opstår, når en patient skal overleve en vis periode for at blive klassificeret som eksponeret, samtidig med at denne periode fejlagtigt tilskrives den eksponerede gruppe. Det kan skabe en kunstig overlevelsesfordel.
En nyttig måde at gennemgå et observationelt studie af behandling på er at formulere det hypotetiske randomiserede målstudie, som analysen forsøger at efterligne. Egnethed, behandlingstildeling og start af opfølgning skal falde sammen. Manglende synkronisering kan skabe immortal time bias og selektionsbias, selv om confounding i øvrigt er håndteret godt [17].
Systematiske oversigter og metaanalyser
Er oversigten virkelig systematisk?
PRISMA 2020 kræver blandt andet redegørelse for søgestrategier, udvælgelse, risiko for bias, syntesemetoder, heterogenitet, sensitivitetsanalyser og evidensens pålidelighed [3]. PRISMA vurderer rapportering, ikke metodologisk kvalitet.
AMSTAR 2 kan anvendes til kritisk vurdering af systematiske oversigter. Særligt vigtige domæner er forhåndsregistreret protokol, tilstrækkelig søgning, begrundelse for ekskluderede studier, vurdering af risiko for bias, hensigtsmæssig metaanalyse og hensyntagen til publikationsbias. AMSTAR 2 bør ikke reduceres til en simpel samlet score, fordi en kritisk mangel kan skjules af mange mindre velgennemførte elementer [18].
Fortolk forest plot
Hvert studies punktestimat og konfidensinterval skal læses før det samlede resultat. Spørg:
- Peger effekterne i samme retning?
- Overlapper intervallerne?
- Dominerer et enkelt stort studie?
- Er små studier mere gunstige?
- Er interventioner, populationer og endepunkter tilstrækkeligt ens?
- Er den samlede effekt klinisk forståelig?
En fixed effect-model antager en fælles underliggende effekt for alle studier. En random effects-model tillader, at den sande effekt varierer mellem studier. Random effects løser ikke klinisk forskellighed og kan give relativt større vægt til små studier.
Heterogenitet
Cochrans Q tester, om variationen er større end forventet ved tilfældigheder, men har lav styrke ved få studier. estimerer den andel af den observerede variation, der tilskrives forskelle mellem studier snarere end stikprøvevariation. Værdien skal ikke fortolkes mekanisk. Den kliniske betydning afhænger af effektmål, præcision, antal studier og variationens retning.
Tau i anden beskriver variansen mellem de sande studieeffekter på analysens skala. Et prædiktionsinterval estimerer, inden for hvilket interval effekten i et nyt sammenligneligt studie kan ligge. Ved betydelig heterogenitet er prædiktionsintervallet ofte mere klinisk informativt end konfidensintervallet omkring middeleffekten.
Småstudieeffekter og publikationsbias
Asymmetri i funnel plot kan skyldes publikationsbias, metodologiske mangler, klinisk heterogenitet eller tilfældigheder. Fravær af asymmetri udelukker ikke publikationsbias, især når få studier indgår. AMSTAR 2 angiver, at funnel plot normalt kræver mindst omkring ti studier for en meningsfuld vurdering [18].
I en metaepidemiologisk analyse af intensivstudier rapporterede små studier større gunstige effekter end store studier. Små studier havde også dårligere rapporteret sekvensgenerering, skjult allokering, blinding og intention-to-treat-analyse [19]. Et samlet positivt resultat, der helt er drevet af små studier, bør derfor betragtes som usikkert, indtil det er bekræftet i større velgennemførte studier.
Fra studie til patient
Intern validitet kommer før ekstern validitet. Et stærkt skævt resultat bliver ikke klinisk anvendeligt, blot fordi patienterne ligner den aktuelle patient. Når den interne validitet er acceptabel, bør følgende sammenlignes:
| Studiekarakteristik | Klinisk spørgsmål |
|---|---|
| Alder og skrøbelighed | Er patienten ældre, mere skrøbelig eller mere multisyg? |
| Sygdomsgrad | Er baselinerisikoen sammenlignelig? |
| Komorbiditet | Blev hyppige samtidige sygdomme ekskluderet? |
| Samtidig behandling | Svarer kontrolgruppen til nutidens standardbehandling? |
| Behandlingsintensitet | Kan dosis, monitorering og adhærens opnås? |
| Endepunkt | Er det vigtigt for patienten? |
| Opfølgning | Er den tilstrækkelig for forventet gavn og skade? |
| Behandlingsmiljø | Kan resultaterne overføres til svensk sundhedsvæsen? |
Nationale behandlingsbegrænsninger, tilskud og organisatoriske forudsætninger kan afvige fra internationale studier. Sådanne forskelle skal kontrolleres mod aktuelle svenske anbefalinger og produktinformation, før resultatet omsættes i klinisk praksis.
En klinisk anvendelig konklusion kan formuleres således:
Hos patienter, der ligner den undersøgte population, reducerede behandlingen det primære patientvigtige endepunkt relativt, men den absolutte effekt afhang af baselinerisikoen. Konfidensintervallet var foreneligt med mellem X og Y færre hændelser pr. 1 000 behandlede over Z år. Risikoen for bias var lav eller moderat, men anvendeligheden var begrænset af kort opfølgning og få skrøbelige patienter.
En sådan formulering er mere informativ end at sige, at behandlingen var effektiv, positiv eller statistisk signifikant.
Tjekliste til journal club eller klinisk beslutning
- Er spørgsmålet relevant og klart defineret?
- Er studiedesignet egnet til spørgsmålet?
- Hvad var det prædefinerede primære endepunkt?
- Er endepunktet patientvigtigt?
- Var randomisering, skjult allokering og blinding adækvate?
- Hvordan blev frafald, overkrydsning og manglende data håndteret?
- Stemmer artikel, protokol, register og analyseplan overens?
- Hvor stor er effekten relativt og absolut?
- Hvor bredt er konfidensintervallet?
- Udelukker intervallet både ingen effekt og klinisk vigtig effekt?
- Er multiple endepunkter, subgrupper eller tidspunkter blevet analyseret?
- Drives et sammensat endepunkt af mindre vigtige komponenter?
- Er sikkerhedsdata tilstrækkelige?
- Er resultatet i overensstemmelse med andre studier?
- Er der heterogenitet, småstudieeffekter eller publikationsbias?
- Er finansiering og forfatternes interesser gennemsigtige?
- Ligner studiepopulationen den aktuelle patient?
- Hvordan ændres den absolutte gavn ved patientens baselinerisiko?
- Er behandlingens byrde og risiko for skade acceptabel?
- Hvor høj er den samlede evidens' pålidelighed?
Kilder
- Moher D et al. CONSORT 2010 explanation and elaboration: updated guidelines for reporting parallel group randomised trials. International Journal of Surgery 2012. PMID: 22036893
- Vandenbroucke JP et al. Strengthening the Reporting of Observational Studies in Epidemiology (STROBE): explanation and elaboration. PLoS Medicine 2007. PMID: 17941715
- Page MJ et al. The PRISMA 2020 statement: an updated guideline for reporting systematic reviews. BMJ 2021. PMID: 33782057
- Balshem H et al. GRADE guidelines: 3. Rating the quality of evidence. Journal of Clinical Epidemiology 2011. PMID: 21208779
- Page MJ et al. Empirical Evidence of Study Design Biases in Randomized Trials: Systematic Review of Meta-Epidemiological Studies. PLoS One 2016. PMID: 27398997
- Khan MS et al. Fragility Index in Cardiovascular Randomized Controlled Trials. Circulation: Cardiovascular Quality and Outcomes 2019. PMID: 31822121
- Lundh A et al. Industry sponsorship and research outcome. Cochrane Database of Systematic Reviews 2017. PMID: 28207928
- Austin PC, Fine JP. Accounting for competing risks in randomized controlled trials: a review and recommendations for improvement. Statistics in Medicine 2017. PMID: 28102550
- Ito C et al. Misleading Reporting (Spin) in Noninferiority Randomized Clinical Trials in Oncology With Statistically Not Significant Results: A Systematic Review. JAMA Network Open 2021. PMID: 34874407
- McCoy CE. Understanding the Use of Composite Endpoints in Clinical Trials. Western Journal of Emergency Medicine 2018. PMID: 30013696
- Hodkinson A et al. Reporting of harms outcomes: a comparison of journal publications with unpublished clinical study reports of orlistat trials. Trials 2016. PMID: 27103582
- Schiller P et al. Quality of reporting of clinical non-inferiority and equivalence randomised trials: update and extension. Trials 2012. PMID: 23157733
- Fischer JE et al. A readers' guide to the interpretation of diagnostic test properties: clinical example of sepsis. Intensive Care Medicine 2003. PMID: 12734652
- Cohen JF et al. STARD 2015 guidelines for reporting diagnostic accuracy studies: explanation and elaboration. BMJ Open 2016. PMID: 28137831
- Whiting PF et al. QUADAS-2: a revised tool for the quality assessment of diagnostic accuracy studies. Annals of Internal Medicine 2011. PMID: 22007046
- Collins GS et al. Transparent reporting of a multivariable prediction model for individual prognosis or diagnosis (TRIPOD): the TRIPOD statement. BMJ 2015. PMID: 25569120
- Hernán MA et al. Specifying a target trial prevents immortal time bias and other self-inflicted injuries in observational analyses. Journal of Clinical Epidemiology 2016. PMID: 27237061
- Shea BJ et al. AMSTAR 2: a critical appraisal tool for systematic reviews that include randomised or non-randomised studies of healthcare interventions, or both. BMJ 2017. PMID: 28935701
- Zhang Z et al. Small studies may overestimate the effect sizes in critical care meta-analyses: a meta-epidemiological study. Critical Care 2013. PMID: 23302257