Evidensbaseret medicin: systematiske oversigter og metaanalyser

Sammenfatning

En systematisk oversigt anvender forudbestemte, transparente og reproducerbare metoder til at identificere, udvælge, vurdere og sammenfatte forskning, der besvarer et afgrænset spørgsmål. En metaanalyse er den statistiske sammenvejning af resultater fra mindst to studier. Begreberne er derfor ikke synonyme. En systematisk oversigt kan mangle en metaanalyse, og en statistisk sammenvejning er ikke automatisk systematisk.

Ved klinisk anvendelse bør oversigten vurderes i følgende rækkefølge: Er spørgsmålet relevant for den aktuelle patient? Er søgningen tilstrækkelig bred og aktuel? Er studier udvalgt og data ekstraheret på en pålidelig måde? Er risikoen for bias i primærstudierne vurderet? Er studierne tilstrækkeligt ensartede til at blive sammenvejet? Hvor store er de relative og absolutte effekter? Hvor præcist er estimatet? Er der klinisk betydningsfuld heterogenitet, small study-effekter eller selektiv rapportering? Endelig skal evidensens sikkerhed vurderes for hvert vigtigt udfald.

PRISMA 2020 er en rapporteringsstandard med 27 hovedpunkter. Den gør rapporteringen mere transparent, men er ikke et instrument til vurdering af metodologisk kvalitet [1,2]. Til kritisk vurdering af interventionsoversigter kan AMSTAR 2 anvendes, mens ROBIS fokuserer på risikoen for bias i selve oversigten [3,4]. Evidensens sikkerhed bør ikke sidestilles med statistisk signifikans. GRADE skelner mellem høj, moderat, lav og meget lav sikkerhed og tager højde for risiko for bias, inkonsistens, indirekthed, manglende præcision og publikationsbias [5,6].

En klinisk anbefaling følger ikke direkte af en metaanalyse. Beslutningen må også tage højde for absolut gavn, skadevirkninger, patientens værdier, gennemførlighed, omkostninger og hvor godt studiepopulationen svarer til den aktuelle patient.

Grundlæggende begreber

Systematisk oversigt

En systematisk oversigt sammenfatter forskning, der besvarer et klart formuleret spørgsmål, ved hjælp af eksplicitte metoder. Centrale komponenter er:

  1. Et forudbestemt forskningsspørgsmål og inklusionskriterier.
  2. En protokol, der fastlægges, inden resultaterne kendes.
  3. En bred og reproducerbar litteratursøgning.
  4. Systematisk udvælgelse af studier.
  5. Struktureret dataekstraktion.
  6. Vurdering af risiko for bias i de inkluderede studier.
  7. En planlagt kvalitativ eller statistisk syntese.
  8. Vurdering af evidensens sikkerhed.
  9. Transparent redegørelse for metoder, afvigelser og resultater.

PRISMA 2020 definerer en systematisk oversigt ud fra de eksplicitte og systematiske metoder, ikke ud fra om der er foretaget en statistisk sammenvejning [1]. At en artikel kaldes en systematisk oversigt er derfor ikke i sig selv et kvalitetsbevis.

Metaanalyse

En metaanalyse kombinerer effektmål og deres usikkerhed fra mindst to studier til et sammenvejet estimat. Studier med højere statistisk præcision får sædvanligvis større vægt. Metaanalysen kan øge præcisionen, synliggøre variation mellem studier og muliggøre analyse af effektmodifikatorer.

Samtidig kan en metaanalyse give en misvisende præcision, hvis den kombinerer studier, der adskiller sig væsentligt med hensyn til population, intervention, sammenligning, udfald, opfølgning eller risiko for bias. Et præcist sammenvejet estimat kan være systematisk forkert, hvis de indgående studier er systematisk forkerte.

Beslægtede oversigtstyper

Oversigtstype Primært formål Vigtig begrænsning
Systematisk oversigt Besvare et afgrænset spørgsmål med systematiske metoder Kvaliteten afhænger af søgning, udvælgelse, primærstudier og syntese
Systematisk oversigt med parvis metaanalyse Sammenveje to alternativer, eksempelvis behandling mod placebo Kræver tilstrækkelig klinisk og metodologisk sammenlignelighed
Netværksmetaanalyse Sammenligne flere behandlinger med direkte og indirekte evidens Kræver transitivitet og rimelig overensstemmelse mellem direkte og indirekte evidens
Metaanalyse af individuelle patientdata Analysere data for hver enkelt deltager Ressourcekrævende og følsom for, hvilke forskergrupper der udleverer data
Levende systematisk oversigt Opdateres løbende, når ny evidens publiceres Kræver langsigtet organisering, opdateringsregler og versionskontrol
Hurtig oversigt (rapid review) Besvare et spørgsmål på kort tid med forenklede metoder Genveje kan øge risikoen for, at relevante studier overses
Scoping review Kortlægge omfang, begreber og videnshuller Er sædvanligvis ikke designet til at give et sikkert effektestimat
Oversigt over oversigter Sammenfatte flere systematiske oversigter Overlappende primærstudier kan tælles flere gange

Fra klinisk spørgsmål til protokol

Formulér spørgsmålet før søgningen

Ved interventionsspørgsmål anvendes sædvanligvis PICO:

  • P, population eller klinisk tilstand
  • I, intervention
  • C, sammenligning
  • O, udfald

Spørgsmålet bør også præcisere studiedesign, behandlingskontekst og relevant opfølgningstid. Et spørgsmål om effekten af et lægemiddel hos voksne med en bestemt diagnose er utilstrækkeligt afgrænset, hvis dosis, sammenligningsbehandling, sygdomsgrad og tidspunkt for udfald er afgørende for fortolkningen.

Udfaldsvariabler bør prioriteres efter patientrelevans. Mortalitet, symptomer, funktionsevne, livskvalitet og alvorlige skadevirkninger er ofte vigtigere end laboratoriemål eller andre surrogatudfald. Et statistisk følsomt surrogatudfald kan give et mere imponerende resultat end et patientrelevant udfald uden at vise, at patienten lever længere eller har det bedre.

Ved diagnostiske spørgsmål skal man specificere målpopulation, indekstest, referencestandard, tærskelværdi og tilsigtet klinisk rolle, eksempelvis triage, tillægstest eller erstatningstest. Prognostiske spørgsmål kræver blandt andet et klart startpunkt, en prognostisk faktor, udfald og tidshorisont.

Protokol og registrering

Protokollen bør angive:

  • forskningsspørgsmål og inklusionskriterier
  • informationskilder og overordnet søgestrategi
  • primære og sekundære udfald
  • hvordan flere måletidspunkter og måleskalaer skal prioriteres
  • proces for udvælgelse af studier og dataekstraktion
  • instrument til vurdering af risiko for bias
  • planlagte effektmål og metaanalytiske modeller
  • håndtering af manglende data og nul-hændelser
  • planlagte subgruppe-, følsomheds- og metaregressionsanalyser
  • metode til vurdering af evidensens sikkerhed

Prospektiv registrering i eksempelvis PROSPERO skaber en dateret redegørelse for planlagte metoder og kan synliggøre efterfølgende ændringer. Registrering kan også mindske uplanlagt duplikering af oversigter [7]. Registrering betyder derimod ikke, at protokollen har gennemgået en fuldstændig metodologisk vurdering.

Legitime protokolændringer kan være nødvendige. De skal dateres, begrundes og redegøres for. Ændringer, efter at forskerne har set resultaterne, er særligt følsomme, eksempelvis skift af primært udfald, ændret opfølgningstid eller nye subgrupper.

flowchart TD
A["Afgræns klinisk spørgsmål<br>og patientrelevante udfald"] --> B["Skriv protokol<br>og analyseplan"]
B --> C["Registrér protokollen<br>før udvælgelse af studier"]
C --> D["Gennemfør bred<br>reproducerbar søgning"]
D --> E["Udvælg studier og ekstrahér data<br>med uafhængig kontrol"]
E --> F["Vurdér risiko for bias<br>for hvert vigtigt udfald"]
F --> G["Vurdér klinisk og<br>metodologisk sammenlignelighed"]
G -->|"Tilstrækkelig"| H["Gennemfør planlagt<br>statistisk syntese"]
G -->|"Utilstrækkelig"| I["Struktureret syntese<br>uden metaanalyse"]
H --> J["Vurdér heterogenitet<br>præcision og rapporteringsbias"]
I --> J
J --> K["Gradér evidensens<br>sikkerhed"]
K --> L["Fortolk absolutte effekter<br>og klinisk anvendelighed"]

Litteratursøgning og udvælgelse af studier

Informationskilder

Ingen enkelt database indeholder al relevant medicinsk forskning. En søgning kan derfor have behov for at omfatte:

  • MEDLINE eller PubMed
  • Embase
  • Cochrane Central Register of Controlled Trials
  • emnespecifikke databaser
  • regionale databaser
  • ClinicalTrials.gov og WHO's forsøgsregister
  • regulatoriske dokumenter
  • afhandlinger og konferenceabstracts
  • referencelister og citationssøgning
  • kontakt med forskere eller producenter

PRISMA-S indeholder 16 punkter for reproducerbar rapportering af litteratursøgninger. Database, søgeplatform, dato, fuldstændig søgestreng, filtre, begrænsninger og supplerende søgemetoder bør angives [8]. En søgning i MEDLINE via Ovid er ikke teknisk identisk med en søgning i MEDLINE via en anden platform.

Søgestrategien bør kombinere indekstermer og fritekstord. Unødvendige sprog-, dato- og publikationsbegrænsninger kan udelukke relevant evidens. Hvis der anvendes begrænsninger, skal de begrundes ud fra forskningsspørgsmålet og ikke alene ud fra bekvemmelighed.

En informationsspecialist kan bidrage til at forbedre både sensitivitet og reproducerbarhed. PRESS er en særlig retningslinje for kollegial vurdering (peer review) af elektroniske søgestrategier [9].

Publiceret og upubliceret evidens

Tidsskriftsartikler alene giver ikke altid et fuldstændigt billede. Studier med statistisk signifikante eller kommercielt gunstige resultater kan have større sandsynlighed for at blive publiceret. Resultaterne kan også blive rapporteret mere fuldstændigt end negative eller inkonklusive udfald.

Forsøgsregistre, regulatoriske dokumenter og kontakt med forsøgsansvarlige kan identificere:

  • afsluttede, men upublicerede studier
  • forhåndsregistrerede primære udfald
  • udfald, der er udeladt i tidsskriftsartiklen
  • længere opfølgning
  • yderligere skadevirkninger
  • flere publikationer fra samme studie

En almindelig fejl er at tælle flere publikationer fra samme studie som separate studier. Protokol, hovedrapport, sekundær analyse og langtidsopfølgning skal knyttes til et fælles studie-ID.

Udvælgelse af studier og dataekstraktion

Udvælgelsen foregår sædvanligvis i to trin:

  1. Gennemgang af titel og resumé.
  2. Fuldtekstgennemgang af potentielt relevante rapporter.

Mindst to personer bør uafhængigt af hinanden vurdere fuldtekster. En tilsvarende dobbeltproces, eller ekstraktion efterfulgt af omhyggelig uafhængig kontrol, bør anvendes for centrale data. Årsagerne til eksklusion på fuldtekstniveau skal dokumenteres.

Dataekstraktionen skal omfatte mere end deltagerantal og effektmål. Vigtige variabler er blandt andet:

  • rekrutteringsmiljø og tidsperiode
  • inklusions- og eksklusionskriterier
  • sygdomsgrad og komorbiditet
  • interventionsdosis og behandlingsvarighed
  • sammenligningsbehandling
  • adhærens og behandlingsskift
  • definition og målemetode for hvert udfald
  • opfølgningstid
  • frafald og analyseprincip
  • finansiering og interessekonflikter
  • oplysninger, der kræves til vurdering af risiko for bias

Vurdering af risiko for bias

Risiko for bias er ikke det samme som rapporteringskvalitet

Et velskrevet studie kan have høj risiko for bias, og et mangelfuldt rapporteret studie kan i visse henseender være gennemført korrekt. Hvis nødvendige oplysninger mangler, er det dog ofte ikke muligt at foretage en sikker vurdering.

For randomiserede studier vurderer RoB 2 fem hoveddomæner: randomiseringsprocessen, afvigelser fra den tilsigtede intervention, manglende udfaldsdata, måling af udfald og selektion af det rapporterede resultat [10]. Vurderingen er udfaldsspecifik. Et ublindet studie kan eksempelvis have lavere risiko for bias for total mortalitet end for selvrapporteret smerte.

For diagnostiske nøjagtighedsstudier omfatter QUADAS-2 patientudvælgelse, indekstest, referencestandard samt flow og timing. De tre første domæner vurderes også med hensyn til anvendelighed [11]. For ikke-randomiserede interventionsstudier kræves særlig opmærksomhed på confounding, selektion og klassifikation af interventioner.

Instrumenter på forskellige niveauer

Vurderingsobjekt Egnet instrument Hvad instrumentet besvarer
Randomiseret studie RoB 2 Kan studiets estimat være systematisk skævt?
Diagnostisk studie QUADAS-2 Er der risiko for bias eller problemer med anvendelighed?
Systematisk interventionsoversigt AMSTAR 2 Er oversigten gennemført med metodologisk pålidelige metoder?
Systematisk oversigt ROBIS Er der risiko for bias i oversigtens proces, resultater eller konklusioner?
Samlet evidensgrundlag for et udfald GRADE Hvor stor tiltro bør vi have til effektestimatet?
Rapportering af systematisk oversigt PRISMA 2020 Er metoder og resultater redegjort for fuldstændigt og transparent?

AMSTAR 2 indeholder 16 punkter og er beregnet til interventionsoversigter med randomiserede eller ikke-randomiserede studier. Værktøjet lægger vægt på syv kritiske domæner: protokol, litteratursøgning, begrundelse for eksklusioner, risiko for bias i primærstudier, statistiske metoder, hensyntagen til bias ved fortolkning samt publikationsbias. Punkterne skal ikke summeres til en simpel numerisk kvalitetsscore [3].

ROBIS vurderer fire domæner i oversigtsprocessen: inklusionskriterier, identifikation og udvælgelse af studier, dataindsamling og vurdering af studier samt syntese og resultater. Derefter foretages en samlet vurdering af risikoen for bias i oversigtens konklusioner [4].

Statistisk syntese

Vælg effektmål efter udfald og spørgsmål

Almindelige effektmål er:

Udfaldstype Effektmål Klinisk fortolkning
Dikotomt udfald Relativ risiko, RR Risiko i interventionsgruppen divideret med risiko i kontrolgruppen
Dikotomt udfald Oddsratio, OR Forholdet mellem odds, kan fejlfortolkes som RR, når udfaldet er hyppigt
Dikotomt udfald Risikodifference, RD Absolut forskel i risiko
Tid til hændelse Hazard ratio, HR Relativ øjeblikkelig hændelsesrate under opfølgningen
Kontinuert udfald, samme skala Middelværdiforskel, MD Forskel i skalaens oprindelige enhed
Kontinuert udfald, forskellige skalaer Standardiseret middelværdiforskel, SMD Forskel udtrykt i standardafvigelser
Diagnostisk udfald Sensitivitet og specificitet Testens evne til at identificere henholdsvis syge og ikke-syge

Relative effektmål skal suppleres med absolutte effekter. Hvis RR er 0,75, bliver den absolutte risikoreduktion 2,5 procentpoint, når baselinerisikoen er 10 procent, men kun 0,25 procentpoint, når baselinerisikoen er 1 procent. Den samme relative effekt kan derfor have helt forskellig klinisk betydning.

Number needed to treat, NNT, kan beregnes som den inverse værdi af den absolutte risikoreduktion, når tidsperiode, population og sammenligning er klart angivet. NNT er ikke en uforanderlig egenskab ved behandlingen. Det varierer med baselinerisiko, opfølgningstid og effektmål.

Fixed effect og random effects

En fixed effect-model antager, at studierne estimerer den samme fælles sande effekt, og at observerede forskelle hovedsageligt skyldes tilfældig usikkerhed. En random effects-model antager, at de sande effekter varierer mellem studierne, og estimerer gennemsnittet af en fordeling af effekter.

Valget må ikke alene træffes ved først at teste for heterogenitet. Klinisk viden om populationer, behandlinger og kontekster skal styre modelvalget. Random effects løser ikke problemet med en uhensigtsmæssig sammenvejning. Modellen kan desuden give relativt større vægt til små studier, hvilket er problematisk, hvis små studier i højere grad er selektivt publiceret eller har højere risiko for bias.

Med få studier bliver estimatet af variationen mellem studier usikkert. Konfidensintervallet omkring den sammenvejede effekt kan da blive for snævert med visse standardmetoder. Derfor bør metodevalg og følsomhedsanalyser redegøres tydeligt for.

Heterogenitet

Heterogenitet kan være:

  • klinisk, eksempelvis forskellig sygdomsgrad, alder eller intervention
  • metodologisk, eksempelvis forskelligt design, risiko for bias eller målemetode
  • statistisk, det observerede mønster af varierende effektestimater

I² estimerer, hvor stor en andel af den observerede variation der er forenelig med variation mellem studier snarere end alene stikprøveusikkerhed [12]. Ofte anvendes følgende omtrentlige fortolkningsramme:

I² Mulig fortolkning
0 til 40 procent Kan være uvæsentlig
30 til 60 procent Kan være moderat
50 til 90 procent Kan være betydelig
75 til 100 procent Kan være betragtelig

Intervallerne overlapper bevidst. I² skal ikke fortolkes mekanisk. En høj I² kan opstå, når store, præcise studier viser små, men konsistente forskelle. En lav I² kan forekomme, når få små studier er for upræcise til at afsløre reel variation.

Tau² beskriver variansen mellem sande studieeffekter, men ligger på en skala, der kan være vanskelig at fortolke klinisk. Et prædiktionsinterval viser i stedet, inden for hvilket interval den sande effekt i et nyt sammenligneligt studie kan forventes at ligge. I et metodestudie af signifikante random effects-metaanalyser med heterogenitet krydsede 72,4 procent af prædiktionsintervallerne nul-effekten, selv om konfidensintervallet for middeleffekten ikke gjorde det [13]. Prædiktionsintervaller er særligt værdifulde, når resultatet skal overføres til et nyt behandlingsmiljø, men bliver usikre, når der indgår få studier.

Subgruppeanalyser og metaregression

Subgruppeanalyser bør være få, klinisk begrundede og helst prædefinerede. Det er forkert at konkludere, at behandlingseffekten er forskellig mellem to grupper, alene fordi resultatet er statistisk signifikant i den ene gruppe, men ikke i den anden. Forskellen mellem grupperne skal analyseres med en interaktionstest.

Troværdigheden øges, hvis:

  • hypotesen blev fastlagt i protokollen
  • der er biologisk eller klinisk plausibilitet
  • forskellen er stor
  • den er konsistent mellem studier
  • interaktionstesten understøtter effektmodifikation
  • analysen bygger på forskelle mellem deltagere inden for studier og ikke alene på gennemsnitlige forskelle mellem studier

Metaregression er en observationel analyse på studieniveau. Den kan generere hypoteser, men er følsom for få studier, multipel testning, confounding og økologiske fejlslutninger.

Følsomhedsanalyser

Robustheden bør afprøves med analyser, der eksempelvis:

  • udelukker studier med høj risiko for bias
  • anvender alternative statistiske modeller
  • anvender alternative antagelser om manglende data
  • adskiller justerede og ujusterede observationelle data
  • udelukker upublicerede studier eller studier, der kun er rapporteret som abstract
  • håndterer kluster-, crossover- og flerarmede studier på alternative måder
  • afprøver betydningen af enkelte indflydelsesrige studier

Hvis hovedkonklusionen ændres markant, bør dette fremgå tydeligt og påvirke evidensgraderingen.

Rapporteringsbias og small study-effekter

Et funnel plot viser studiernes effektestimater mod et mål for præcision eller standardfejl. Ved fravær af selektion og andre small study-effekter forventes en omtrent symmetrisk tragt. Asymmetri kan skyldes:

  • selektiv publikation
  • selektiv udfaldsrapportering
  • ringere metodologisk kvalitet i små studier
  • reelle kliniske forskelle mellem små og store studier
  • tilfældigheder
  • uhensigtsmæssigt effektmål eller statistisk metode

Funnel plot og regressionsbaserede test har lav styrke, når der indgår få studier. En almindelig praktisk grænse er, at sådanne analyser sjældent er meningsfulde med færre end ti studier [3,14]. En ikke-signifikant test udelukker ikke publikationsbias.

Metoder som trim and fill kan anvendes som eksplorative følsomhedsanalyser, men kan ikke bevise, hvor mange studier der mangler, eller genskabe den sande effekt. Vurderingen bør også tage højde for forsøgsregistre, protokoller, finansiering, forekomst af små positive studier og forskelle mellem registrerede og publicerede udfald.

Syntese uden metaanalyse

Man bør afstå fra metaanalyse, når studierne er for forskellige, eller når data ikke kan udtrykkes på sammenlignelige måder. Fravær af metaanalyse berettiger dog ikke en usystematisk narrativ sammenfatning.

SWiM angiver ni rapporteringsområder for syntese uden metaanalyse. Disse omfatter gruppering af studier, standardiserede effektmål, valgt syntesemetode, prioritering af resultater, håndtering af heterogenitet, evidensens sikkerhed, præsentation i tabeller og figurer, sammenfatning af resultater samt syntesens begrænsninger [15].

En struktureret syntese bør:

  • gruppere studier efter klinisk relevante sammenligninger
  • angive, hvilke studier der bidrager til hver konklusion
  • redegøre for retning, størrelse og præcision, ikke kun P-værdier
  • tage højde for risiko for bias
  • undgå at tillægge små og store studier samme betydning
  • redegøre for modstridende resultater
  • forklare, hvorfor metaanalyse ikke blev gennemført

Stemmeoptælling (vote counting) ud fra antallet af statistisk signifikante studier bør undgås. Et lille studie og et stort studie kan da tælle lige meget, samtidig med at statistisk signifikans forveksles med effektens størrelse.

Netværksmetaanalyse

Netværksmetaanalyse kan sammenligne flere interventioner i et sammenhængende netværk. Hvis studier sammenligner A med B og B med C, kan en indirekte sammenligning mellem A og C beregnes. Metoden kan også kombinere det indirekte estimat med direkte sammenlignende studier.

Ud over de sædvanlige metaanalytiske krav kræves:

  • transitivitet, studier i forskellige sammenligninger skal være tilstrækkeligt ensartede med hensyn til effektmodifikatorer
  • konsistens, direkte og indirekte evidens skal være forenelige
  • et forbundet evidensnetværk
  • hensigtsmæssig håndtering af studier med flere behandlingsarme
  • tydelig redegørelse for usikkerheden i hver sammenligning

PRISMA's netværksudvidelse omfatter særlige krav til blandt andet netværksgeometri, indirekte sammenligninger og vurdering af inkonsistens [16]. Rangordninger af behandlinger skal fortolkes med forsigtighed. En høj placering kan bygge på få studier, indirekte sammenligninger eller lav sikkerhed i evidensen.

En stor netværksmetaanalyse af antidepressiva illustrerer både mulighederne og begrænsningerne. Analysen omfattede 522 studier og 116 477 deltagere, men 73 procent af studierne blev vurderet at have moderat risiko for bias, og evidensens sikkerhed varierede fra moderat til meget lav [17]. Et omfattende netværk og snævre intervaller gør således ikke alle sammenligninger lige pålidelige.

Skadevirkninger

Systematiske oversigter er ofte bedre designet til gavn end til skade. Randomiserede studier kan være for små eller for korte til at opdage sjældne, forsinkede eller kumulative skadevirkninger. Observationelle studier og registerdata kan derfor være nødvendige som supplement, selv om de indebærer større risiko for confounding og andre systematiske fejl.

For hvert skadesudfald bør oversigten angive:

  • hvordan skadevirkningen blev defineret
  • om der aktivt blev spurgt til den, eller om den blev rapporteret spontant
  • tidsperioden for monitorering
  • antallet af deltagere med hændelsen og antallet analyserede
  • håndtering af studier med nul hændelser
  • sværhedsgrad og behandlingsophør
  • mulig kausalitet
  • frafald og selektiv rapportering

PRISMA Harms blev udviklet, fordi mangelfuld rapportering i primærstudier ofte forstærkes, når skadevirkninger sammenfattes i oversigter [18]. Formuleringen om, at ingen alvorlige skadevirkninger blev rapporteret, betyder ikke nødvendigvis, at der aktivt blev søgt efter dem, eller at de ikke forekom.

Vurdering af evidensens sikkerhed

GRADE vurderer et samlet evidensgrundlag for hvert udfald, ikke et studie eller en artikel som helhed. Der anvendes fire niveauer [5]:

Niveau Praktisk betydning
Høj Stor tiltro til, at den sande effekt ligger tæt på estimatet
Moderat Den sande effekt ligger sandsynligvis tæt på estimatet, men kan afvige betydeligt
Lav Begrænset tiltro, den sande effekt kan afvige betydeligt
Meget lav Meget lille tiltro til effektestimatet

Randomiserede studier starter normalt på høj sikkerhed og kan nedgraderes for:

  1. Risiko for bias.
  2. Inkonsistens.
  3. Indirekthed.
  4. Manglende præcision.
  5. Publikationsbias.

Observationelle studier starter normalt på lavt niveau, men kan i visse situationer opgraderes, eksempelvis ved meget stor effekt, dosis-respons-sammenhæng, eller når plausibel residual confounding sandsynligvis ville mindske den observerede effekt [5].

GRADE adskiller evidensens sikkerhed fra anbefalingens styrke. En anbefaling kræver desuden vurdering af balancen mellem gavn og skade, patientpræferencer, ressourceforbrug, lighed, accept og gennemførlighed [6].

En summary of findings-tabel bør angive:

  • udfald og opfølgningstid
  • antal studier og deltagere
  • risiko uden intervention
  • risiko med intervention
  • relativ effekt
  • absolut effekt
  • evidensens sikkerhed
  • begrundelse for nedgradering eller opgradering

Absolutte effekter er centrale. I en metaanalyse af PSA-screening svarede en mulig relativ reduktion af prostatacancerspecifik mortalitet kun til omkring ét færre dødsfald pr. 1 000 screenede mænd over ti år, samtidig med at screening førte til yderligere diagnostik og behandlingsrelaterede komplikationer [19]. Den relative effekt alene ville have givet et ufuldstændigt billede.

Kritisk vurdering ved klinisk anvendelse

En praktisk vurderingsrækkefølge

Spørgsmål Tegn, der styrker tilliden Advarselstegn
Er oversigten relevant? PICO og opfølgning svarer til det kliniske spørgsmål Bred eller afvigende population, surrogatudfald
Er den aktuel? Nylig afsluttende søgning eller levende opdatering Hurtigt udviklende forskningsfelt og flere år gammel søgning
Var der en protokol? Prospektiv protokol og forklarede ændringer Registrering efter dataekstraktion eller manglende analyseplan
Var søgningen tilstrækkelig? Flere relevante databaser, registre og fuldstændige søgestrenge Én database, sprogbegrænsning uden begrundelse, kun publicerede artikler
Var udvælgelsen robust? Uafhængig dobbeltvurdering og angivne eksklusionsårsager Én enkelt bedømmer eller uklar udvælgelse på fuldtekstniveau
Blev risiko for bias vurderet? Designspecifikt instrument og udfaldsspecifik vurdering Numerisk kvalitetsscore uden domænevurdering
Var metaanalysen rimelig? Klinisk sammenlignelige studier og prædefineret model Sammenvejning trods åbenlyst forskellige interventioner eller udfald
Er effekten klinisk forståelig? Relative og absolutte effekter med tidshorisont Kun OR, SMD eller P-værdi
Er heterogeniteten håndteret? Klinisk forklaring, tau², I² og gerne prædiktionsinterval Heterogenitet ignoreres eller forklares med mange post hoc-analyser
Er der rapporteringsbias? Kontrol af registre og forsigtig fortolkning Mange små positive studier og ingen upublicerede data
Er konklusionen afbalanceret? Gavn, skade, præcision og anvendelighed vejes sammen Konklusion baseret alene på statistisk signifikans

Læs forest plot systematisk

Ved vurdering af et forest plot bør læseren kontrollere:

  1. Hvilket effektmål der anvendes, og hvilken retning der indebærer gavn.
  2. Hvor mange studier og deltagere der reelt bidrager.
  3. Om store og små studier giver lignende resultater.
  4. Om konfidensintervallerne overlapper.
  5. Om et eller to studier dominerer vægten.
  6. Om den sammenvejede effekt krydser nul-effekten.
  7. Om intervallet udelukker både klinisk vigtig gavn og skade.
  8. Om I² og tau² er angivet.
  9. Om prædiktionsintervallet krydser nul-effekten eller en klinisk beslutningstærskel.
  10. Om studier med høj risiko for bias påvirker konklusionen.

Et konfidensinterval, der krydser nul-effekten, betyder ikke, at behandlingerne er ligeværdige. Intervallet kan samtidig rumme både betydelig gavn og betydelig skade. Den korrekte vurdering er da, at estimatet er upræcist.

Statistisk og klinisk betydning

Statistisk signifikans påvirkes af stikprøvestørrelsen. En meget lille effekt kan blive statistisk signifikant i en stor metaanalyse, mens en klinisk vigtig effekt kan være ikke-signifikant i et lille datagrundlag.

I en Cochrane-oversigt over vandbaseret træning ved knæ- eller hofteartrose var den standardiserede effekt på smerte minus 0,31. Når resultatet blev udtrykt på en skala fra 0 til 100, svarede dette til en forbedring på omkring fem point [20]. Omregning til en klinisk velkendt skala gør resultatet mere anvendeligt, men den mindste klinisk betydningsfulde forskel skal fortsat tages i betragtning.

En omfattende metaanalyse kan også skjule usikkerhed gennem heterogenitet. En oversigt over TENS inkluderede 381 randomiserede studier, men kun 26 blev vurderet at have lav samlet risiko for bias. For sammenligningen med placebo var I² 88 procent, hvilket viser, at et stort deltagerantal ikke eliminerer problemer med varierende studieresultater [21].

Opdatering og vedligeholdelse af oversigter

En systematisk oversigt er aktuel frem til sin seneste søgedato, ikke sin publiceringsdato. Manuskriptbedømmelse og publicering kan betyde, at søgningen allerede er gammel, når artiklen bliver tilgængelig.

Levende systematiske oversigter bygger på tilbagevendende søgninger og løbende opdatering. De egner sig bedst, når:

  • spørgsmålet har høj klinisk prioritet
  • der fortsat er betydelig usikkerhed
  • nye studier publiceres regelmæssigt
  • ny evidens kan ændre konklusion eller anbefaling

Metodologisk vejledning for levende oversigter er mere udviklet for gennemførelse og publicering end for rapportering og kvalitetsvurdering. En kortlægning identificerede vejledning om gennemførelse i 17 publikationer, men om kvalitetsvurdering i kun to [22]. Opdateringshyppighed, søgeintervaller, udløsende kriterier for ny analyse og tidspunkt for ophør af levende status bør derfor angives eksplicit.

For klinikeren betyder dette, at en ældre, men veludført oversigt ikke automatisk skal forkastes. Først bør man undersøge, om nye studier sandsynligvis ændrer effektestimatet, skadesprofilen eller evidensens sikkerhed.

Kilder

  1. Page MJ et al. The PRISMA 2020 statement: an updated guideline for reporting systematic reviews. BMJ 2021. PMID: 33782057
  2. Page MJ et al. PRISMA 2020 explanation and elaboration: updated guidance and exemplars for reporting systematic reviews. BMJ 2021. PMID: 33781993
  3. Shea BJ et al. AMSTAR 2: a critical appraisal tool for systematic reviews that include randomised or non-randomised studies of healthcare interventions, or both. BMJ 2017. PMID: 28935701
  4. Whiting P et al. ROBIS: A new tool to assess risk of bias in systematic reviews was developed. Journal of Clinical Epidemiology 2016. PMID: 26092286
  5. Balshem H et al. GRADE guidelines: 3. Rating the quality of evidence. Journal of Clinical Epidemiology 2011. PMID: 21208779
  6. Guyatt G et al. GRADE guidelines: 1. Introduction, GRADE evidence profiles and summary of findings tables. Journal of Clinical Epidemiology 2011. PMID: 21195583
  7. Booth A et al. The nuts and bolts of PROSPERO: an international prospective register of systematic reviews. Systematic Reviews 2012. PMID: 22587842
  8. Rethlefsen ML et al. PRISMA-S: an extension to the PRISMA Statement for Reporting Literature Searches in Systematic Reviews. Systematic Reviews 2021. PMID: 33499930
  9. McGowan J et al. PRESS Peer Review of Electronic Search Strategies: 2015 Guideline Statement. Journal of Clinical Epidemiology 2016. PMID: 27005575
  10. Sterne JAC et al. RoB 2: a revised tool for assessing risk of bias in randomised trials. BMJ 2019. PMID: 31462531
  11. Whiting PF et al. QUADAS-2: a revised tool for the quality assessment of diagnostic accuracy studies. Annals of Internal Medicine 2011. PMID: 22007046
  12. Higgins JPT et al. Measuring inconsistency in meta-analyses. BMJ 2003. PMID: 12958120
  13. IntHout J et al. Plea for routinely presenting prediction intervals in meta-analysis. BMJ Open 2016. PMID: 27406637
  14. Sterne JA et al. Recommendations for examining and interpreting funnel plot asymmetry in meta-analyses of randomised controlled trials. BMJ 2011. PMID: 21784880
  15. Campbell M et al. Synthesis without meta-analysis in systematic reviews: reporting guideline. BMJ 2020. PMID: 31948937
  16. Hutton B et al. The PRISMA extension statement for reporting of systematic reviews incorporating network meta-analyses of health care interventions: checklist and explanations. Annals of Internal Medicine 2015. PMID: 26030634
  17. Cipriani A et al. Comparative efficacy and acceptability of 21 antidepressant drugs for the acute treatment of adults with major depressive disorder: a systematic review and network meta-analysis. Lancet 2018. PMID: 29477251
  18. Zorzela L et al. PRISMA harms checklist: improving harms reporting in systematic reviews. BMJ 2016. PMID: 26830668
  19. Ilic D et al. Prostate cancer screening with prostate-specific antigen test: a systematic review and meta-analysis. BMJ 2018. PMID: 30185521
  20. Bartels EM et al. Aquatic exercise for the treatment of knee and hip osteoarthritis. Cochrane Database of Systematic Reviews 2016. PMID: 27007113
  21. Johnson MI et al. Efficacy and safety of transcutaneous electrical nerve stimulation for acute and chronic pain in adults: a systematic review and meta-analysis of 381 studies. BMJ Open 2022. PMID: 35144946
  22. Iannizzi C et al. Methods and guidance on conducting, reporting, publishing, and appraising living systematic reviews: a scoping review. Systematic Reviews 2023. PMID: 38098023

Opdateret 29. september 2026