Resumé
Kritisk vurdering indebærer at bedømme, om et studie besvarer et klinisk relevant spørgsmål, om resultatet kan være systematisk skævt, hvor stor og præcis effekten er, og om resultatet kan overføres til den aktuelle patient. Begynd ikke med konklusionen eller p-værdien. Identificér først problemstilling, studiedesign, population, intervention eller eksponering, sammenligning, udfald og opfølgningstid. Vurdér derefter den interne validitet, effektmål og præcision, efterfulgt af ekstern validitet og samlet evidens.
For randomiserede studier er de centrale spørgsmål, om randomiseringssekvensen var korrekt, om allokeringen var skjult, om der opstod afvigelser fra den tildelte behandling, hvordan frafald blev håndteret, om udfaldsmålingen var pålidelig, og om de rapporterede analyser var præspecificerede. For observationelle studier kommer især selektionsbias, confounding, fejlklassifikation og tidsrelateret bias til. Diagnostiske studier skal vurderes ud fra patientudvælgelse, indekstest og referencetest, blinding, tærskelværdier og patientflow. Systematiske oversigter kræver en reproducerbar søgning, transparent studieudvælgelse, en passende vurdering af risiko for bias og en rimelig syntese.
Statistisk signifikans er ikke det samme som klinisk betydning. Fortolk altid punktestimater sammen med konfidensintervaller og absolutte effekter. Et ikke-signifikant resultat viser ikke automatisk ækvivalens. Et stort materiale kan give et præcist, men skævt resultat, mens et lille materiale kan give et usikkert resultat trods godt studiedesign. Endelig skal studiets resultater vejes sammen med den øvrige evidens, patientens baselinerisiko, præferencer, behandlingsbyrde, bivirkninger, ressourcer og den svenske sundhedskontekst.
Fra klinisk spørgsmål til vurderingsplan
Formulér spørgsmålet, før artiklen vurderes
En brugbar vurdering begynder med et spørgsmål, der kan besvares. For behandlingseffekter anvendes sædvanligvis PICO:
| Komponent | Spørgsmål |
|---|---|
| Population | Hvilke patienter drejer spørgsmålet sig om? |
| Intervention | Hvilken behandling, strategi eller indsats vurderes? |
| Comparator | Hvad sammenlignes interventionen med? |
| Outcome | Hvilke patientrelevante effekter og skader er vigtige? |
| Tid | Hvor lang behandling og opfølgning kræves, for at udfaldet er meningsfuldt? |
For diagnostik skal spørgsmålet også angive indekstest, referencestandard, tilsigtet klinisk rolle, og hvor i forløbet testen skal anvendes. For prognose angives population, prognostisk faktor eller model, udfald og tidshorisont. For ætiologi eller skade specificeres eksponering, relevant sammenligning og mulige confoundere.
Den samme artikel kan være relevant for ét spørgsmål, men uegnet til et andet. Et placebokontrolleret effektstudie kan vise, at en behandling har biologisk effekt, men behøver ikke vise, om den er bedre end svensk standardbehandling. Et studie af diagnostisk nøjagtighed kan vise, hvor godt en test klassificerer sygdom, men ikke om testen forbedrer patientudfald.
Identificér studiedesignet ud fra, hvad der faktisk blev gjort
Stol ikke udelukkende på forfatternes betegnelse. Vurdér, hvordan deltagerne blev udvalgt, hvordan sammenligningsgrupperne blev dannet, hvornår eksponering og udfald blev målt, og hvordan opfølgningen blev gennemført.
| Spørgsmålstype | Ofte egnet design | Væsentligste trusler mod validiteten |
|---|---|---|
| Behandlingseffekt | Randomiseret kontrolleret forsøg | Mangler i randomiseringen, afvigelser, frafald, selektiv rapportering |
| Sjælden eller langsigtet skade | Kohorte, case-kontrol-studie, registerstudie | Confounding, selektion, fejlklassifikation, tidsrelateret bias |
| Diagnostisk nøjagtighed | Tværsnitsstudie eller kohorte, hvor de samme patienter gennemgår indekstest og referencetest | Spektrumbias, verifikationsbias, uegnet referencestandard |
| Prognose | Inceptionskohorte med relevant opfølgning | Selektiv inklusion, frafald, overtilpasning |
| Prævalens | Repræsentativt tværsnitsstudie | Udvælgelsesfejl, frafald, målefejl |
| Samlet behandlingsevidens | Systematisk oversigt, når det er relevant med metaanalyse | Ufuldstændig søgning, bias i primærstudier, uhensigtsmæssig sammenvejning |
Rapporteringsretningslinjer hjælper læseren med at finde de nødvendige oplysninger. CONSORT 2025 omfatter 30 rapporteringspunkter for randomiserede forsøg og lægger bl.a. vægt på registrering, protokol, statistisk analyseplan, datahåndtering, frafald og bivirkninger [1]. STROBE omfatter kohorte-, case-kontrol- og tværsnitsstudier og understreger, at population, dataindsamling, variable, mulige bias og analyse skal beskrives tydeligt [2]. STARD har den tilsvarende funktion for diagnostiske studier [3], mens PRISMA 2020 indeholder 27 rapporteringspunkter for systematiske oversigter [4].
Disse retningslinjer er ikke kvalitetsinstrumenter. Fuldstændig rapportering gør det muligt at vurdere et studie, men garanterer ikke, at metoden er korrekt. Mangelfuld rapportering betyder derimod, at risiko for bias ofte ikke kan udelukkes.
flowchart TD
A["Formulér det kliniske spørgsmål<br>og vigtige udfald"] --> B["Identificér hvad forskerne<br>faktisk sammenlignede"]
B --> C["Vurdér intern validitet<br>og risiko for bias"]
C --> D["Fortolk effektstørrelse<br>og præcision"]
D --> E["Gennemgå alternative analyser<br>og rapporteringsselektion"]
E --> F["Vurdér anvendelighed<br>for patient og sundhedskontekst"]
F --> G["Vej sammen med øvrig evidens<br>gavn, skade og ressourcer"]Fælles vurdering af alle studier
Forskningsspørgsmål, protokol og forhåndsregistrering
Kontrollér, om hypotese, primært endepunkt, opfølgningstid og analyse var defineret, før data blev analyseret. For randomiserede forsøg bør registreringen være sket, før den første deltager blev inkluderet. Sammenlign publikationen med studieprotokol, registerindførsel og statistisk analyseplan. Undersøg, om:
- det primære endepunkt er blevet udskiftet
- tidspunktet for primæranalysen er ændret
- udfald er tilføjet eller fjernet
- subgrupper eller justeringsvariable er valgt, efter at resultaterne blev kendt
- studiet blev afsluttet før tid uden tydeligt præspecificerede regler
- analysen afviger fra den planlagte uden overbevisende forklaring
En afvigelse er ikke nødvendigvis uhensigtsmæssig. Klinisk udvikling eller uventede dataproblemer kan begrunde en ændring. Problemet er en udokumenteret, resultatstyret ændring, der øger risikoen for, at et tilfældigt fund fremstilles som bekræftende evidens.
Population og rekruttering
Beskriv kildepopulationen, før du vurderer studiepopulationen. Spørg, hvilke patienter der kunne være inkluderet, hvilke der faktisk blev vurderet for deltagelse, og hvilke der endeligt blev analyseret. Rekruttering fra højt specialiserede centre kan give høj behandlingskvalitet, men begrænset generaliserbarhed. Rekruttering via annoncer eller frivillig deltagelse kan selektere særligt motiverede og sundhedsbevidste personer.
Kontrollér:
- inklusions- og eksklusionskriterier
- rekrutteringsland, behandlingsniveau og tidsperiode
- andelen af de adspurgte, der blev inkluderet
- komorbiditet, alder, kønsfordeling og sygdommens sværhedsgrad
- tidligere og samtidig behandling
- om ældre, skrøbelige, gravide eller andre vigtige grupper blev udelukket
- om de diagnostiske kriterier svarer til klinisk praksis
En behandling kan have samme relative effekt ved forskellig baselinerisiko, men meget forskellig absolut gavn. Derfor er patientens baselinerisiko central for anvendelsen.
Intervention, sammenligning og samtidig behandling
Interventionen skal være tilstrækkeligt beskrevet til at kunne reproduceres. For lægemidler kræves dosis, administrationsvej, behandlingsvarighed, dosisjustering og adhærens. For kirurgi, fysioterapi eller komplekse behandlingsprogrammer kræves oplysninger om udførende, uddannelse, komponenter og faktisk levering. TIDieR blev udviklet for at forbedre beskrivelsen og reproducerbarheden af sådanne interventioner [5].
Sammenligningsbehandlingen er lige så vigtig som interventionen. Placebo kan være rimeligt, når effektiv standardbehandling mangler, men er utilstrækkeligt, hvis spørgsmålet gælder valget mellem etablerede behandlinger. En for lav dosis eller en forkert administreret aktiv kontrol kan overdrive den nye behandlings relative gavn.
Vurdér også samtidig behandling. Hvis grupperne får forskellig rescue-behandling, rehabilitering, opfølgning eller diagnostik, kan forskellen i udfald ikke med sikkerhed tilskrives den tilsigtede intervention.
Udfald og opfølgningstid
Prioritér patientrelevante udfald som overlevelse, symptomer, funktion, livskvalitet, hospitalsindlæggelse og alvorlige komplikationer. Biomarkører og radiologiske mål kan være nyttige, men et surrogatendepunkt skal være valideret for den aktuelle sygdom, behandlingsmekanisme og patientpopulation. En behandling kan forbedre en laboratorieværdi uden at forbedre patienternes helbred.
Gennemgå, hvordan udfaldet blev defineret og målt:
- Var definitionen klinisk meningsfuld?
- Var målemetoden valideret?
- Var udfaldet selvrapporteret eller afhængigt af bedømmeren?
- Var bedømmerne blindede?
- Blev udfaldet målt lige hyppigt og på samme måde i grupperne?
- Var opfølgningen lang nok til at vurdere gavn og skade?
- Indgik der komponenter med meget forskellig klinisk betydning i et sammensat endepunkt?
Et sammensat endepunkt kan domineres af den hyppigste, men mindst alvorlige komponent. Rapporten bør derfor vise både det sammensatte endepunkt og hver komponent for sig.
Randomiserede behandlingsstudier
Randomisering mindsker i forventning både kendt og ukendt confounding, men kun hvis sekvensen er reelt tilfældig, og allokeringen ikke kan forudsiges. RoB 2 vurderer fem domæner: randomiseringsprocessen, afvigelser fra de tilsigtede interventioner, manglende udfaldsdata, måling af udfald og selektion af det rapporterede resultat [6].
Randomiseringsproces og skjult allokering
Kontrollér, hvordan sekvensen blev genereret. Computergenererede tilfældige tal og central randomisering er sædvanligvis passende. Alternering, fødselsdato, journalnummer eller ugedag er forudsigelige og udgør ikke sikker randomisering.
Skjult allokering betyder, at den, der inkluderer deltageren, ikke kan kende den næste tildeling. Dette er adskilt fra blinding efter randomiseringen. Central webbaseret eller telefonbaseret tildeling giver ofte bedre beskyttelse end lokalt opbevarede kuverter. Hvis allokeringen kunne forudsiges, kan den rekrutterende påvirke, hvilke patienter der havner i hvilken gruppe.
Gennemse baselinetabellen, men brug ikke udelukkende signifikanstest til at vurdere randomiseringen. Tilfældige ubalancer kan opstå. Store eller usandsynlige forskelle i flere prognostisk vigtige variable kan derimod begrunde en nærmere gennemgang af processen.
Blinding og afvigelser fra behandlingen
Blinding mindsker risikoen for, at forventninger påvirker behandling, samtidig behandling, frafald eller udfaldsmåling. Betydningen afhænger af udfaldet. Totalmortalitet er mindre følsom over for bedømmerpåvirkning end smerte, funktionsscoring eller beslutning om hospitalsindlæggelse.
Hvis blinding ikke er mulig, så spørg, om:
- grupperne fik forskellig pleje eller samtidig behandling
- adhærensen blev påvirket af kendskab til behandlingen
- afvigelserne var balancerede
- udfaldet blev vurderet af en uafhængig blindet komité
- analysen estimerede effekten af tildeling eller effekten af faktisk behandling
Intention-to-treat og per protokol
En intention-to-treat-analyse beholder deltagerne i den gruppe, de blev randomiseret til. Den bevarer randomiseringens sammenlignelighed og estimerer sædvanligvis effekten af en behandlingsstrategi under studiets betingelser. En analyse efter faktisk modtaget behandling bryder randomiseringen og kan genindføre confounding.
Per protokol-analyse inkluderer kun deltagere, der fulgte protokollen efter præspecificerede kriterier. Den kan være informativ, men er følsom over for selektion, fordi adhærens ofte hænger sammen med prognose. I superioritetsstudier er intention-to-treat sædvanligvis den primære analyse. I non-inferiority-studier er både intention-to-treat og per protokol vigtige, fordi afvigelser og cross-over mellem behandlingerne kan gøre grupperne mere ens og dermed favorisere konklusionen om non-inferiority.
Non-inferiority og ækvivalens
Non-inferiority indebærer, at den nye behandling ikke er uacceptabelt meget dårligere end kontrollen. Det er ikke det samme, som at der ikke er påvist nogen statistisk signifikant forskel. Kontrollér:
- At non-inferiority-marginen blev defineret før studiet.
- At marginen har klinisk og empirisk begrundelse.
- At den aktive kontrol tidligere er vist at være effektiv i en lignende population.
- At behandling, adhærens og udfaldsmåling har været gode nok til, at forskelle ville kunne opdages.
- At konfidensintervallet i sin helhed ligger på den rigtige side af marginen.
- At både gavn og mulige fordele, eksempelvis færre bivirkninger eller enklere administration, vurderes.
Ækvivalens kræver, at hele konfidensintervallet ligger inden for to præspecificerede grænser. Fravær af signifikant forskel er ikke tilstrækkeligt.
Frafald og manglende data
Frafald skal opgøres separat for hver gruppe og for hvert centralt udfald. Vurdér både andelen og årsagerne. Et frafald på fem procent kan være alvorligt, hvis der er indtruffet få hændelser, og frafaldet er relateret til prognose. Et større frafald kan være mindre skævvridende, hvis årsagerne er uafhængige af behandling og udfald.
Complete case-analyse er kun sikker under restriktive antagelser. Moderne metoder omfatter bl.a. multipel imputation, likelihood-baserede modeller og vægtning. Ingen metode genskaber information, der aldrig er blevet indsamlet. Antagelserne skal være klinisk rimelige, og følsomhedsanalyser bør vise, hvordan konklusionen påvirkes, hvis de manglende udfald er dårligere i den ene gruppe. En metodeoversigt fra 2024 fandt, at mange forsøg fortsat anvender metoder, der i praksis kræver den stærke antagelse, at data mangler helt tilfældigt [7].
Selektiv rapportering og subgrupper
Et primært endepunkt bør være præspecificeret. Mange sekundære udfald, tidspunkter, subgrupper og modelvarianter øger sandsynligheden for tilfældigt positive resultater.
En troværdig subgruppeeffekt bør helst:
- være præspecificeret og begrænset til få hypoteser
- have biologisk eller klinisk plausibilitet
- være påvist med en formel interaktionstest
- være konsistent inden for og mellem studier
- bygge på tilstrækkeligt mange deltagere og hændelser
- ikke udelukkende være baseret på signifikans i én gruppe og ikke-signifikans i en anden
Forskellen mellem et signifikant og et ikke-signifikant resultat er ikke nødvendigvis signifikant. I en analyse af 928 Cochrane-oversigter var aldersrelaterede subgruppeanalyser planlagt i 20,4 procent, men blev kun gennemført i et lille mindretal. Flere analyser manglede en formel interaktionstest, og de observerede interaktioner havde svag støtte [8].
Skader og bivirkninger
Effektstudier har ofte utilstrækkelig statistisk styrke og for kort opfølgning til sjældne eller sene skader. Gennemgå, hvordan bivirkninger blev efterspurgt, defineret, kodet og tilskrevet. Aktiv, systematisk overvågning opfanger flere hændelser end spontane indberetninger.
Rapporten bør angive antal deltagere med mindst én hændelse, antal hændelser, sværhedsgrad, behandlingsophør, alvorlige hændelser og dødsfald i hver gruppe. CONSORT Harms anbefaler en integreret og præspecificeret rapportering af gavn og skade [9]. I en systematisk gennemgang af 61 randomiserede vaccineforsøg rapporterede samtlige dødsfald og alvorlige bivirkninger, men kun seks beskrev, hvordan tilbagevendende bivirkninger blev håndteret [10].
Observationelle studier
Observationelle studier er nødvendige for mange spørgsmål om prognose, ætiologi, sjældne skader og behandling i klinisk rutine. De kan være meget store og præcise, men præcision eliminerer ikke systematiske fejl.
Selektion og sammenlignelighed
I et kohortestudie skal eksponerede og ikke-eksponerede repræsentere sammenlignelige personer ved et tydeligt defineret startpunkt. I et case-kontrol-studie skal kontrollerne repræsentere den population, som casene opstod i. I tværsnitsstudier er den tidsmæssige rækkefølge mellem eksponering og sygdom ofte uklar.
Gennemgå, om inklusion, behandling eller fortsat opfølgning afhænger af prognose. Eksempler er selektion af personer, der har overlevet frem til studieinklusion, eksklusion af alvorligt syge patienter eller informativt tab til opfølgning.
Confounding
En confounder er associeret med både eksponeringen og udfaldet uden at være en følge af eksponeringen. Confounding by indication er særlig vigtig, når de mest syge patienter oftere får en bestemt behandling. Et statistisk justeret observationelt studie er ikke automatisk kausalt. Justering kan kun håndtere variable, der er målt tilstrækkeligt godt og modelleret korrekt.
Kontrollér:
- om vigtige confoundere blev identificeret ud fra klinisk viden
- hvornår og hvordan de blev målt
- om variable efter behandlingsstart fejlagtigt blev justeret bort
- om grupperne havde overlappende sandsynlighed for at få behandling
- om balancen efter matchning eller vægtning blev rapporteret
- om der blev udført følsomhedsanalyser for ukendt confounding
En kortlæggende oversigt af 117 metodeartikler om sekundære sundhedsdatabaser identificerede confounding, selektion og målefejl som de hyppigste problemområder. Confounding by indication, residual confounding, fejlklassifikation af udfald og immortal time bias var særligt fremtrædende [11].
Propensity score kan anvendes til matchning, stratificering, vægtning eller justering, men gør ikke ukendte confoundere sammenlignelige. I en oversigt over 127 sammenligninger mellem propensity score-analyser og randomiserede forsøg var forskellen mellem designene stor i 54 procent af sammenligningerne [12].
Målefejl og fejlklassifikation
Diagnoser, lægemiddeleksponeringer og udfald i administrative registre er ofte skabt til behandling eller afregning, ikke til forskning. Kontrollér kodernes positive og negative prædiktive værdi i det relevante miljø. En recept betyder ikke, at lægemidlet er blevet afhentet, og udlevering betyder ikke, at det er blevet taget.
Ikke-differentiel fejlklassifikation trækker ikke altid mod nul, især ikke ved flere kategorier, afhængige målefejl eller justerede modeller. Differentiel fejlklassifikation kan skævvride resultatet i en hvilken som helst retning.
Tidsrelateret bias
Starten for eksponering, sammenligning og opfølgning skal ligge på et fælles, klinisk meningsfuldt tidspunkt. Ved immortal time bias klassificeres en periode, hvor udfaldet ikke kunne indtræffe, som eksponeret tid, hvilket ofte giver en tilsyneladende beskyttende effekt.
Et robust lægemiddelstudie anvender ofte:
- nye brugere i stedet for personer, der allerede har tålt behandlingen
- en aktiv sammenligningsbehandling med lignende indikation
- samme definition af indeksdato i grupperne
- en tidsafhængig eksponeringsmodel, når eksponeringen ændrer sig
- tydelig håndtering af behandlingsskift, ophør og konkurrerende hændelser
Diagnostiske studier
Diagnostisk nøjagtighed er ikke en uforanderlig egenskab ved en test. Den varierer med sygdomsspektrum, prævalens, behandlingsniveau, tidligere testning og den måde, testen udføres på [3]. QUADAS-2 vurderer patientudvælgelse, indekstest, referencestandard samt patientflow og timing. De tre første domæner vurderes også med hensyn til anvendelighed [13].
Patientudvælgelse og klinisk rolle
Studiet bør helst inkludere en konsekutiv eller tilfældig serie af patienter, hvor testen faktisk ville blive anvendt. Sammenligning mellem tydeligt syge cases og raske kontroller giver ofte overvurderet nøjagtighed. Angiv, om testen skal anvendes til screening, triage, diagnostisk bekræftelse, erstatning af en eksisterende test eller som tillægstest.
Indekstest og referencestandard
Indekstesten og referencestandarden skal beskrives, så de kan reproduceres. Referencestandarden skal klassificere måltilstanden tilstrækkeligt korrekt. Hvis bedømmeren af referencetesten kender indeksresultatet, kan overensstemmelsen blive kunstigt høj.
Tærskelværdier bør være præspecificerede. En cut-off-værdi, der vælges, efter at alle resultater er analyseret, har tendens til at præstere for optimistisk og kræver ekstern validering.
Alle deltagere bør principielt gennemgå den samme referencestandard inden for et klinisk rimeligt tidsinterval. Hvis kun indekspositive patienter får definitiv diagnostik, opstår partiel verifikationsbias.
Effektmål
| Mål | Definition | Klinisk anvendelse |
|---|---|---|
| Sensitivitet | Andel syge med positiv test | Vurderer falsk negative resultater |
| Specificitet | Andel ikke-syge med negativ test | Vurderer falsk positive resultater |
| Positiv likelihood ratio | Sensitivitet divideret med 1 minus specificitet | Øger sandsynligheden for sygdom |
| Negativ likelihood ratio | 1 minus sensitivitet divideret med specificitet | Mindsker sandsynligheden for sygdom |
| Positiv prædiktiv værdi | Andel testpositive, der er syge | Afhænger af prævalens og patientudvælgelse |
| Negativ prædiktiv værdi | Andel testnegative, der ikke er syge | Afhænger af prævalens og patientudvælgelse |
Sensitivitet og specificitet skal rapporteres med konfidensintervaller. En enkelt AUC-værdi kan skjule klinisk vigtige forskelle ved den cut-off-værdi, der faktisk skal anvendes. Det afgørende spørgsmål er ofte, om testresultatet ændrer sandsynligheden tilstrækkeligt til at ændre behandling, videre udredning eller behov for opfølgning.
Systematiske oversigter og metaanalyser
En systematisk oversigt er et studie af studier. Den kan ikke kompensere for alvorlig bias i primærstudierne. PRISMA understøtter transparent rapportering [4], mens AMSTAR 2 er et vurderingsinstrument for oversigter over randomiserede og ikke-randomiserede interventionsstudier [14].
Søgning og studieudvælgelse
Kontrollér, at spørgsmålet og inklusionskriterierne blev defineret i en protokol før søgning og analyse. Søgningen bør omfatte flere relevante databaser, forsøgsregistre, referencelister og om nødvendigt upublicerede eller regulatoriske kilder. Fuldstændige søgestrategier og sidste søgedato skal rapporteres.
Studieudvælgelse og dataekstraktion bør udføres af mindst to personer eller kontrolleres uafhængigt. En liste over studier, der er ekskluderet efter fuldtekstgennemgang, med årsager, gør det muligt at opdage selektiv eksklusion.
Risiko for bias og sammenvejning
Forfatterne skal anvende et designtilpasset instrument og integrere vurderingen i syntesen. Udelukkende at præsentere en samlet score er uhensigtsmæssigt, fordi en enkelt kritisk mangel kan være vigtigere end flere mindre mangler. AMSTAR 2 fraråder udtrykkeligt at summere instrumentets 16 punkter til én samlet kvalitetsscore [14].
Metaanalyse er kun rimelig, når studierne er tilstrækkeligt sammenlignelige med hensyn til population, intervention, kontrol, udfald og tid. En random effects-model løser ikke klinisk inkompatibilitet. Når randomiserede og observationelle resultater kombineres, kan meget store observationelle studier dominere og skabe et præcist, men skævt samlet estimat.
Heterogenitet
Heterogenitet skal forstås klinisk og metodologisk, ikke udelukkende gennem I². I² angiver omtrent, hvor stor en andel af den observerede variation der ikke forklares af stikprøvefejl, men påvirkes af studiernes præcision. En lav I² udelukker ikke klinisk vigtig variation, og en høj I² behøver ikke at indebære store absolutte forskelle.
Ved random effects-metaanalyse er prædiktionsintervallet ofte mere klinisk informativt end konfidensintervallet omkring den gennemsnitlige effekt. Det estimerer, hvilket interval af sande effekter der kan forventes i en lignende fremtidig setting. I en analyse af statistisk signifikante Cochrane-metaanalyser med heterogenitet inkluderede 72,4 procent af prædiktionsintervallerne nul-effekt, og 20,3 procent inkluderede en effekt modsat det samlede estimat [15].
Publikationsbias
Små positive studier publiceres ofte lettere end små negative studier. Funnel plot og asymmetritest kan understøtte mistanke om small study-effekter, men er vanskelige at fortolke ved heterogenitet og har lav styrke ved få studier. AMSTAR 2 angiver, at der sædvanligvis kræves mindst omkring ti studier for at vurdere funnel plot-asymmetri meningsfuldt [14]. Et symmetrisk funnel plot beviser ikke, at publikationsbias er fraværende.
Fortolkning af statistiske resultater
Punktestimat og konfidensinterval
Punktestimatet er studiets bedste enkeltstående estimat. Konfidensintervallet beskriver den statistiske usikkerhed under modellens antagelser, men opfanger ikke systematisk bias. Et snævert interval omkring et skævt estimat giver ikke et troværdigt resultat.
Vurdér, om intervallet inkluderer:
- ingen effekt
- en klinisk betydningsfuld gavn
- en klinisk betydningsfuld skade
- både gavn og skade
Et resultat kan være statistisk signifikant, men klinisk trivielt. Det kan også være ikke-signifikant, men foreneligt med en vigtig effekt, fordi intervallet er bredt.
Relative og absolutte effekter
Antag, at risikoen for et udfald er 20 procent i kontrolgruppen og 15 procent i behandlingsgruppen.
- Relativ risiko: 0,15 / 0,20 = 0,75.
- Relativ risikoreduktion: 1 minus 0,75 = 25 procent.
- Absolut risikoreduktion: 20 minus 15 procentpoint = 5 procentpoint.
- Number needed to treat: 1 / 0,05 = 20 i den undersøgte periode.
NNT skal altid knyttes til population, sammenligning og tidsperiode. Da den absolutte effekt afhænger af kontrolrisikoen, kan NNT ikke uden videre sammenlignes mellem studier. NNT bør beregnes ud fra en passende absolut risikoforskel og rapporteres med usikkerhed. For tidsafhængige udfald ændrer NNT sig med det valgte tidspunkt [16].
Odds ratio og hazard ratio
Odds ratio ligger tæt på den relative risiko, når udfaldet er sjældent, men kan fremstå større, når udfaldet er hyppigt. Hvis kontrolrisikoen er kendt, bør resultatet også udtrykkes som absolut risiko.
En hazard ratio sammenligner øjeblikkelige hændelsesrater under opfølgningen og er ikke direkte en relativ risiko eller en forskel i overlevelsestid. Fortolkningen forudsætter ofte proportionale hazards. Ved krydsende eller sent separerende overlevelseskurver kan en enkelt hazard ratio-værdi være misvisende. Restricted mean survival time (begrænset gennemsnitlig overlevelsestid) frem til et præspecificeret tidspunkt kan da være lettere at fortolke [17].
P-værdier og multiple analyser
P-værdien angiver, hvor uforenelige data er med en specificeret statistisk model, ofte nulhypotesen. Den angiver ikke sandsynligheden for, at hypotesen er sand, effektens størrelse, klinisk betydning eller risikoen for bias.
Grænsen 0,05 er en konvention, ikke en biologisk skillelinje. Resultaterne p = 0,049 og p = 0,051 udgør normalt ikke kvalitativt forskellig evidens. Fortolk effektstørrelse, konfidensinterval, forhåndsplanlægning, antal analyser og studiets validitet.
Hvis 20 uafhængige hypoteser testes på signifikansniveauet 0,05, forventes der i gennemsnit ét positivt resultat på grund af tilfældigheder, når alle nulhypoteser er sande. Derfor kræves et præspecificeret analysehierarki eller passende kontrol af multiplicitetsproblemet.
Robusthed og følsomhedsanalyser
Følsomhedsanalyser bør afprøve rimelige alternative antagelser, eksempelvis:
- forskellige antagelser om manglende data
- justerede og ujusterede analyser
- eksklusion af studier med høj risiko for bias
- forskellige modeller for heterogenitet
- alternativ definition af eksponering eller udfald
- håndtering af konkurrerende hændelser
- per protokol ud over intention-to-treat, når det er relevant
Hvis konklusionen ændrer sig ved små, rimelige modelændringer, er evidensen skrøbelig. Fragility index, dvs. det antal hændelser, der skal ændres, for at et dikotomt signifikant resultat bliver ikke-signifikant, kan illustrere en vis statistisk ustabilitet, men erstatter ikke konfidensintervaller eller vurdering af risiko for bias. Kritiske oversigter har vist, at fragility index i mange randomiserede forsøg har været meget lavt og undertiden mindre end antallet af deltagere, der var tabt til opfølgning [18].
Anvendelighed og klinisk betydning
Intern validitet skal vurderes før generaliserbarhed. Et resultat med høj risiko for bias bliver ikke brugbart, blot fordi studiepopulationen ligner patienten. Når den interne validitet er acceptabel, vurderes:
- lighed i alder, komorbiditet, sygdomsgrad og tidligere behandling
- baselinerisiko og forventet absolut gavn
- behandlingsniveau, kompetencer og tilgængelige ressourcer
- interventionens gennemførlighed og behandlingsbyrde
- opfølgningens længde
- patientens præferencer og mål
- relevante bivirkninger og interaktioner
- om kontrolbehandlingen svarer til svensk praksis
Svenske anbefalinger, godkendte indikationer, tilskudsbegrænsninger og sundhedsvæsenets struktur kan afvige fra internationale studier. Et metodologisk godt studie fastlægger derfor ikke alene, hvad der bør gøres i det svenske sundhedsvæsen.
Fra enkeltstudie til samlet evidens
En klinisk beslutning bør sjældent bygge på et enkelt studie. GRADE vurderer evidensens sikkerhed per udfald ud fra bl.a. studiedesign, risiko for bias, inkonsistens, indirekthed, manglende præcision og publikationsbias. Anbefalingens styrke påvirkes desuden af balancen mellem gavn og skade, patientpræferencer og andre konsekvenser [19].
| Domæne | Spørgsmål ved den endelige vurdering |
|---|---|
| Risiko for bias | Kan studiernes resultater være systematisk skæve? |
| Inkonsistens | Peger studierne i samme retning, og er variationen forståelig? |
| Indirekthed | Svarer population, intervention, kontrol og udfald til det kliniske spørgsmål? |
| Manglende præcision | Udelukker konfidensintervallet vigtige alternative konklusioner? |
| Publikationsbias | Kan negative eller ufordelagtige resultater mangle? |
| Effektstørrelse | Er effekten stor og klinisk relevant? |
| Absolut effekt | Hvor mange hændelser påvirkes ved patientens baselinerisiko? |
| Gavn og skade | Er den samlede balance gunstig for denne patient? |
Praktisk konklusion efter vurderingen
Afslut vurderingen med en struktureret konklusion, ikke med en generel bedømmelse som ”godt studie” eller ”lav evidens”. Angiv:
- Hvilket spørgsmål studiet faktisk besvarer.
- De vigtigste styrker.
- De vigtigste risici for bias.
- Punktestimat, konfidensinterval og absolut effekt.
- Om resultaterne er robuste og præspecificerede.
- Hvilke patienter og behandlingsmiljøer resultaterne gælder for.
- Hvordan studiet forholder sig til den øvrige evidens.
- Hvad resultatet rimeligvis betyder for klinisk praksis.
- Hvilken usikkerhed der fortsat består.
Kritisk vurdering er ikke en jagt på fejl, der automatisk diskvalificerer et studie. Formålet er at afgøre, hvor meget vægt resultatet fortjener. Et lille, men veludført studie kan give værdifuld, om end usikker, information. Et meget stort studie kan give høj præcision, men alligevel være ubrugeligt, hvis sammenligningsgrupperne er dannet på en systematisk skæv måde. Den klinisk relevante konklusion ligger i kombinationen af validitet, effektstørrelse, præcision, anvendelighed og overensstemmelse med den samlede evidens.
Kilder
- Hopewell S et al. CONSORT 2025 explanation and elaboration: updated guideline for reporting randomised trials. BMJ 2025. PMID: 40228832
- Vandenbroucke JP et al. Strengthening the Reporting of Observational Studies in Epidemiology (STROBE): explanation and elaboration. PLoS Medicine 2007. PMID: 17941715
- Cohen JF et al. STARD 2015 guidelines for reporting diagnostic accuracy studies: explanation and elaboration. BMJ Open 2016. PMID: 28137831
- Page MJ et al. PRISMA 2020 explanation and elaboration: updated guidance and exemplars for reporting systematic reviews. BMJ 2021. PMID: 33781993
- Hoffmann TC et al. Better reporting of interventions: template for intervention description and replication (TIDieR) checklist and guide. BMJ 2014. PMID: 24609605
- Sterne JAC et al. RoB 2: a revised tool for assessing risk of bias in randomised trials. BMJ 2019. PMID: 31462531
- Medcalf E et al. Addressing missing outcome data in randomised controlled trials: A methodological scoping review. Contemporary Clinical Trials 2024. PMID: 38857674
- Liu P et al. Age-treatment subgroup analyses in Cochrane intervention reviews: a meta-epidemiological study. BMC Medicine 2019. PMID: 31639007
- Junqueira DR et al. CONSORT Harms 2022 statement, explanation, and elaboration: updated guideline for the reporting of harms in randomized trials. Journal of Clinical Epidemiology 2023. PMID: 37100738
- Yuniar CT et al. Adverse Events Reporting Quality of Randomized Controlled Trials of COVID-19 Vaccine Using the CONSORT Criteria for Reporting Harms: A Systematic Review. Vaccines 2022. PMID: 35214773
- Prada-Ramallal G et al. Bias in pharmacoepidemiologic studies using secondary health care databases: a scoping review. BMC Medical Research Methodology 2019. PMID: 30871502
- Forbes SP, Dahabreh IJ. Benchmarking Observational Analyses Against Randomized Trials: a Review of Studies Assessing Propensity Score Methods. Journal of General Internal Medicine 2020. PMID: 32193818
- Whiting PF et al. QUADAS-2: a revised tool for the quality assessment of diagnostic accuracy studies. Annals of Internal Medicine 2011. PMID: 22007046
- Shea BJ et al. AMSTAR 2: a critical appraisal tool for systematic reviews that include randomised or non-randomised studies of healthcare interventions, or both. BMJ 2017. PMID: 28935701
- IntHout J et al. Plea for routinely presenting prediction intervals in meta-analysis. BMJ Open 2016. PMID: 27406637
- Okwuokenye M et al. Number Needed to Treat in Multiple Sclerosis Clinical Trials. Neurology and Therapy 2017. PMID: 28176189
- Jiménez JL. Quantifying treatment differences in confirmatory trials under non-proportional hazards. Journal of Applied Statistics 2022. PMID: 35707213
- Mielke D, Rohde V. Randomized controlled trials, a critical re-appraisal. Neurosurgical Review 2021. PMID: 33025186
- Guyatt G et al. GRADE guidelines: 1. Introduction, GRADE evidence profiles and summary of findings tables. Journal of Clinical Epidemiology 2011. PMID: 21195583