Sammenfatning
Evidensbaseret medicin indebærer, at den bedste tilgængelige videnskabelige evidens forenes med klinisk ekspertise og patientens værdier, mål og forudsætninger. Det er ikke ensbetydende med mekanisk at følge en artikel, en metaanalyse eller en klinisk retningslinje. Videnskabelige resultater skal først vurderes med hensyn til validitet, effektens størrelse, præcision, relevans og anvendelighed for den aktuelle patient [1].
Arbejdsgangen kan sammenfattes i fem trin: formulér et besvarbart spørgsmål, søg efter den bedste tilgængelige viden, vurdér evidensen kritisk, anvend resultatet sammen med patienten, og evaluér beslutningens konsekvenser [2]. Spørgsmålet bør struktureres efter klinisk spørgsmålstype, sædvanligvis med PICO: population, intervention eller eksponering, sammenligning og udfald. Søg i første omgang efter aktuelle og metodologisk pålidelige retningslinjer eller systematiske oversigter. Gå videre til primærstudier, hvis oversigter mangler, er for gamle eller ikke svarer til spørgsmålet.
Kritisk vurdering skal skelne mellem tre spørgsmål:
- Er resultatet tilstrækkeligt troværdigt?
- Hvor stor og præcis er effekten?
- Er resultatet relevant for denne patient og denne beslutning?
Relative effekter bør suppleres med absolutte tal, eksempelvis absolut risikoreduktion og number needed to treat, NNT. En lav p-værdi beviser hverken, at effekten er stor, klinisk vigtig eller fri for systematiske fejl. For diagnostiske test skal testresultatet fortolkes ud fra sandsynligheden før testen. For retningslinjer skal anbefalingens styrke adskilles fra evidensens pålidelighed. Endelig skal beslutningen følges op med patientrelevante udfald og revurderes, når patientens tilstand, mål eller vidensgrundlaget ændrer sig.
Grundprincipper
Hvad evidensbaseret medicin er
Evidensbaseret medicin blev udviklet som en måde at gøre kliniske beslutninger mere eksplicitte, reproducerbare og gennemsigtige. Den klassiske definition fremhæver omhyggelig og velovervejet brug af den bedste aktuelle evidens i beslutninger om den enkelte patient. Klinisk erfaring er nødvendig for at identificere problemet, estimere baselinerisikoen, fortolke usikkerhed og afgøre, om resultaterne kan anvendes. Patientens præferencer er nødvendige, fordi samme mulige gavn og skade kan vurderes forskelligt af forskellige personer [1].
Begrebet omfatter både individuelle patientbeslutninger og beslutninger på gruppeniveau, eksempelvis forløbsprogrammer, prioriteringer og udfasning af tiltag med lav nytte. Den individuelle proces kan beskrives med fem elementer:
| Element | Praktisk betydning | Almindelig fejl |
|---|---|---|
| Spørg | Omsæt usikkerheden til et struktureret klinisk spørgsmål | Spørgsmålet bliver for bredt eller udfaldet for vagt |
| Søg | Identificér den bedste tilgængelige vidensressource | Man vælger det første hit eller søger kun i én database |
| Vurdér | Vurdér risiko for bias, effektstørrelse, præcision og anvendelighed | Man vurderer tidsskriftets omdømme i stedet for studiets metode |
| Anvend | Integrér evidens med klinisk vurdering og patientens mål | En anbefaling bruges som en regel uden individualisering |
| Evaluér | Følg op på proces, gavn, skade og beslutningskvalitet | Effekten af beslutningen kontrolleres ikke |
Den femdelte model anvendes også i undervisning i og vurdering af evidensbaseret medicin. En systematisk oversigt over validerede vurderingsinstrumenter viste, at kritisk vurdering ofte måles, mens evnen til at anvende og derefter evaluere beslutningen vurderes betydeligt sjældnere [2]. Dette afspejler et almindeligt klinisk problem: der rettes stor opmærksomhed mod artikellæsning, men mindre mod, hvordan viden faktisk ændrer beslutninger og patientudfald.
Hvad evidensbaseret medicin ikke er
Evidensbaseret medicin er ikke:
- en kogebog, hvor samme tiltag anvendes for alle
- en metode til at erstatte klinisk erfaring med statistik
- et krav om, at enhver beslutning skal understøttes af et randomiseret studie
- det samme som omkostningsminimering
- det samme som at følge en klinisk retningslinje
- en antagelse om, at alle publicerede studier er pålidelige
- en antagelse om, at en systematisk oversigt altid er af høj kvalitet
- en flertalsbeslutning blandt eksperter
Fravær af evidens af høj kvalitet er ikke evidens for fravær af effekt. Ved sjældne sygdomme, akutte livstruende tilstande, kirurgiske interventioner, langtidsskader og etisk vanskeligt undersøgte spørgsmål kan randomiserede studier være umulige eller uhensigtsmæssige. Så må beslutningen baseres på det bedste tilgængelige grundlag, samtidig med at der tydeligt redegøres for usikkerheden.
Evidenshierarkiet afhænger af spørgsmålet
En enkelt generel evidenspyramide er utilstrækkelig. Det hensigtsmæssige studiedesign afhænger af, hvilket spørgsmål der skal besvares. Et randomiseret studie er sædvanligvis bedst til at estimere den kausale effekt af en intervention, men ikke til at estimere prævalens, sjældne sene bivirkninger eller en diagnostisk tests nøjagtighed.
| Klinisk spørgsmål | Sædvanligvis mest informative studiedesign | Centrale vurderingsspørgsmål |
|---|---|---|
| Behandling eller forebyggelse | Systematisk oversigt over randomiserede studier, dernæst enkelt randomiseret studie | Randomisering, skjult allokering, frafald, blinding, adhærens |
| Diagnostik | Tværsnitsstudie eller prospektiv kohorte med relevant referencemetode | Patientudvælgelse, blindet fortolkning, verifikationsbias, tærskelværdi |
| Prognose | Prospektiv kohorte, helst med ekstern validering | Repræsentativt startpunkt, frafald, udfaldsvurdering, kalibrering |
| Ætiologi eller skade | Kohorte- eller case-kontrol-studie, undertiden randomiseret studie | Confounding, dosis-respons, tidsfølge, selektion, fejlklassifikation |
| Prævalens | Repræsentativt tværsnitsstudie | Udvælgelsesramme, deltagelse, definition og måling |
| Patienters erfaringer | Kvalitativt studie eller kvalitativ evidenssyntese | Formålsbestemt udvælgelse, datamætning, refleksivitet og analyse |
| Implementering | Pragmatisk randomiseret studie, klyngerandomiseret studie eller kontrolleret tidsserie | Kontekst, implementeringsgrad, kontaminering og bæredygtighed |
Også oversigter har forskellige formål. En systematisk oversigt besvarer et afgrænset spørgsmål med forudbestemte metoder. Et scoping review kortlægger et bredere område og behøver ikke at vurdere effekter. En narrativ oversigt kan give klinisk forståelse, men er mere afhængig af forfatterens udvælgelse. Et umbrella review sammenstiller eksisterende systematiske oversigter. Disse publikationstyper er derfor ikke indbyrdes udskiftelige [3].
Arbejdsgang
flowchart TD
A["Identificér klinisk usikkerhed"] --> B["Formulér spørgsmålet<br>med PICO eller tilsvarende"]
B --> C["Fastlæg spørgsmålstype<br>og relevant studiedesign"]
C --> D["Søg først efter aktuel<br>retningslinje eller systematisk oversigt"]
D --> E["Vurdér aktualitet,<br>metode og relevans"]
E -->|"Tilstrækkeligt grundlag"| F["Kvantificér gavn,<br>skade og usikkerhed"]
E -->|"Utilstrækkeligt grundlag"| G["Søg relevante<br>primærstudier"]
G --> H["Vurdér kritisk<br>risiko for bias og præcision"]
H --> F
F --> I["Vurdér anvendelighed,<br>baselinerisiko og gennemførlighed"]
I --> J["Drøft alternativer<br>med patienten"]
J --> K["Træf og dokumentér<br>en fælles beslutning"]
K --> L["Følg op på udfald,<br>bivirkninger og beslutning"]
L --> M["Revurdér ved ny evidens<br>eller ændrede forudsætninger"]Trin 1: Identificér beslutningen og formulér spørgsmålet
Tag udgangspunkt i en reel beslutning, ikke i et generelt vidensområde. Spørgsmålet "Hvilken behandling er bedst ved atrieflimren?" er for bredt. Et mere anvendeligt spørgsmål definerer patientgruppen, alternativerne og de udfald, der kan ændre beslutningen.
Til behandlingsspørgsmål anvendes sædvanligvis PICO:
- P, population: diagnose, sygdomsgrad, alder, komorbiditet og behandlingsmiljø
- I, intervention: behandling, diagnostisk strategi eller andet tiltag
- C, comparison: placebo, sædvanlig behandling, anden aktiv behandling eller intet tiltag
- O, outcome: patientrelevante effekter og skader
- T, time: relevant tidshorisont kan tilføjes, når udfaldet er tidsafhængigt
Eksempel:
Hos personer over 75 år med non-valvulær atrieflimren og høj blødningsrisiko, reducerer direkte orale antikoagulantia sammenlignet med warfarin risikoen for iskæmisk apopleksi uden uacceptabel stigning i alvorlig blødning over to år?
Ved diagnostiske spørgsmål erstattes interventionen af indekstesten og sammenligningen af referencemetoden. Ved prognostiske spørgsmål defineres startpunkt, prognostisk faktor eller model, udfald og tidsperiode. Ved spørgsmål om skade defineres eksponering og en relevant ueksponeret sammenligningsgruppe.
Udfaldet bør være vigtigt for patienten. Mortalitet, symptomer, funktion, livskvalitet, hospitalsindlæggelse og alvorlige bivirkninger er oftest mere direkte relevante end laboratorieværdier eller radiologiske surrogatmål. Et surrogatudfald kan være anvendeligt, hvis sammenhængen med patientgavn er velvalideret, men en forbedring af en biomarkørværdi skal ikke automatisk fortolkes som forbedret helbred.
Trin 2: Søg effektivt og reproducerbart
Søgningen bør tilpasses tidsrammen og beslutningens betydning. Ved et akut patientspørgsmål kan en valideret vidensopsamling være rimelig. Ved udarbejdelse af en retningslinje eller et forløbsprogram kræves en dokumenteret, reproducerbar og bredere søgning.
En praktisk søgerækkefølge er:
- Aktuel national eller international retningslinje.
- Systematisk oversigt eller metaanalyse.
- Nyere randomiserede eller velgennemførte observationsstudier, der er publiceret efter oversigtens seneste søgedato.
- Enkelte primærstudier, hvis synteser mangler.
- Ekspertkonsensus, når det empiriske grundlag er utilstrækkeligt.
Kontrollér altid:
- hvornår litteratursøgningen blev afsluttet
- om population, intervention og udfald svarer til spørgsmålet
- om dokumentet er blevet erstattet eller opdateret
- om anbefalingen er tilpasset et andet sundhedssystem
- om lægemidler, diagnostik eller opfølgning er tilgængelige i Sverige
Retningslinjer skal ikke accepteres alene på grund af afsenderen. I en systematisk gennemgang af 40 retningslinjer for atopisk dermatitis varierede den metodologiske kvalitet betydeligt. Anvendelighed og metodologisk stringens var de svageste områder, og håndteringen af interessekonflikter var ofte mangelfuld [4]. Svenske regulatoriske vilkår, tilskudsbegrænsninger og organisatoriske forudsætninger kan desuden afvige fra internationale anbefalinger.
Praktisk PubMed-søgning
Begynd med kernebegreberne fra PICO. Brug både emneord og fritekst, når søgningen skal være fuldstændig. Undgå at medtage alle tænkelige patientkarakteristika med det samme, da relevante studier ellers kan blive overset.
En forenklet struktur for et behandlingsspørgsmål er:
(population OR synonym) AND (intervention OR synonym) AND
(randomized controlled trial OR systematic review)Søg ikke rutinemæssigt på et forventet udfald som "mortality", hvis dette risikerer at udelukke studier, hvor udfaldet kun forekommer i fuldteksten. Dokumentér database, dato, fuldstændig søgestreng og eventuelle filtre, når søgningen skal kunne efterprøves eller gentages.
Trin 3: Vælg den rette vidensressource
En velgennemført systematisk oversigt er ofte mest effektiv, fordi den sammenstiller hele forskningsfeltet. Den er imidlertid kun så pålidelig som dens metoder og de inkluderede studier. En metaanalyse er en statistisk metode, ikke et kvalitetsstempel.
GRADE anvendes til at vurdere pålideligheden af det samlede evidensgrundlag for hvert vigtigt udfald. Vurderingen omfatter blandt andet risiko for bias, inkonsistens, indirekthed, manglende præcision og publikationsbias. Evidensen klassificeres som høj, moderat, lav eller meget lav pålidelighed [5].
Systematiske oversigter bør redegøre for spørgsmål, protokol, søgning, udvælgelse, risiko for bias, syntese og evidensvurdering. PRISMA 2020 indeholder 27 rapporteringspunkter og et flowdiagram til dette formål [6]. PRISMA beskriver rapportering, ikke metodologisk kvalitet. En komplet tjekliste garanterer derfor ikke, at oversigten er velgennemført. Til metodevurdering af interventionsoversigter kan AMSTAR 2 anvendes. Værktøjet omfatter oversigter over både randomiserede og ikke-randomiserede studier [7].
Kritisk vurdering
Begynd med metoden, ikke resultaterne
Læsningen bør foregå i følgende rækkefølge:
- Forskningsspørgsmål og studiedesign.
- Population, inklusionskriterier og behandlingsmiljø.
- Intervention eller eksponering og sammenligning.
- Udfald og opfølgningstid.
- Metoder, der begrænser systematiske fejl.
- Frafald og manglende data.
- Effektstørrelse og konfidensinterval.
- Finansiering, protokol, registrering og interessekonflikter.
- Først derefter forfatternes konklusion.
Abstract og diskussionsafsnit er utilstrækkelige til en fuldstændig kvalitetsvurdering. Kontrollér tabeller, figurer, supplerende materiale, studieprotokol og statistisk analyseplan, når beslutningen er vigtig.
Rapporteringsretningslinjer letter læsningen. CONSORT gælder randomiserede parallelgruppestudier [8], STROBE observationsstudier [9], STARD studier af diagnostisk nøjagtighed [10] og TRIPOD diagnostiske eller prognostiske prædiktionsmodeller [11]. Disse retningslinjer forbedrer gennemsigtigheden, men erstatter ikke en vurdering af risiko for bias.
Randomiserede interventionsstudier
Randomisering reducerer confounding ved at fordele både kendte og ukendte prognostiske faktorer mellem grupperne. Fordelen kan gå tabt ved mangelfuld allokering, selektivt frafald, crossover mellem grupperne eller uhensigtsmæssig analyse.
Vurdér særligt:
- Var randomiseringssekvensen reelt tilfældig?
- Var tildelingen skjult indtil inklusion?
- Var deltagere, behandlere og udfaldsbedømmere blindede, når det var muligt?
- Blev grupperne behandlet ens bortset fra interventionen?
- Var udfaldet prædefineret, relevant og målt på samme måde?
- Var frafaldet lille og ligeligt fordelt?
- Blev deltagerne primært analyseret efter den oprindelige gruppetildeling?
- Blev alle prædefinerede udfald rapporteret?
- Blev studiet stoppet før tid efter en uventet stor effekt?
- Var studiet dimensioneret til både gavn og vigtige skader?
Intention-to-treat-analyse estimerer effekten af at blive tildelt en strategi og bevarer som regel randomiseringens sammenlignelighed. Per-protokol-analyse estimerer effekten blandt dem, der fulgte protokollen, men kan genindføre confounding. Begge kan være relevante, men de besvarer forskellige spørgsmål.
Klyngestudier kræver særlig analyse, fordi patienter inden for samme behandlingsenhed ikke er statistisk uafhængige. Ved crossover-studier skal en mulig vedvarende behandlingseffekt og en tilstrækkelig washout-periode vurderes.
Observationsstudier
Observationsstudier er centrale for prognose, prævalens, diagnostik, sjældne skader og langtidseffekter. De kan også give værdifuld information om behandlingseffekt, når randomisering ikke er gennemførlig. Deres resultater er imidlertid mere sårbare over for selektionsbias, informationsbias og confounding [12].
Almindelige problemer er:
| Problem | Eksempel | Konsekvens |
|---|---|---|
| Confounding by indication | Sværere syge får en bestemt behandling | Behandlingen kan fejlagtigt fremstå som skadelig |
| Selektionsbias | Deltagelse eller opfølgning afhænger af prognosen | Sammenligningsgrupperne bliver systematisk forskellige |
| Fejlklassifikation | Diagnose eller lægemiddeleksponering registreres forkert | Sammenhængen svækkes eller forvrides |
| Immortal time bias | Eksponeret status kræver overlevelse frem til en senere dato | Behandlingen kan fejlagtigt fremstå som beskyttende |
| Healthy user bias | Behandlede personer har også anden sund adfærd | Effekten overvurderes |
| Informativ censurering | Frafald hænger sammen med prognose eller behandlingseffekt | De tilbageværende deltagere er ikke repræsentative |
| Residual confounding | En vigtig variabel mangler eller måles groft | Den justerede analyse er stadig skævvredet |
I en kortlægning af metodeproblemer i studier baseret på sundhedsdatabaser var confounding den hyppigste hovedkategori. Confounding by indication, residual confounding, fejlklassifikation af udfald og immortal time bias var særligt fremtrædende [13].
Regressionsjustering, matchning og propensity score-metoder kan balancere målte faktorer, men kan ikke sikkert eliminere umålte confoundere. Propensity score bør derfor ikke betragtes som en statistisk erstatning for randomisering. Metoden kan supplere randomiserede data og forbedre sammenligneligheden i observationsdata, men resultatet afhænger af, hvilke variable der er målt, hvordan modellen er specificeret, og om behandlingsgrupperne har tilstrækkeligt overlap [14].
En stor database eller et meget smalt konfidensinterval løser ikke systematiske fejl. Tværtimod kan et snævert konfidensinterval give en falsk følelse af sikkerhed omkring et skævvredet estimat.
Diagnostiske studier
En diagnostisk test bør evalueres i den population og kliniske situation, hvor den skal anvendes. Case-kontrol-lignende studier med tydeligt syge patienter og helt raske kontroller har en tendens til at overvurdere testens nøjagtighed.
De grundlæggende mål er:
- Sensitivitet: andelen af syge, der har en positiv test.
- Specificitet: andelen af ikke-syge, der har en negativ test.
- Positiv likelihood ratio: sensitivitet / (1 - specificitet).
- Negativ likelihood ratio: (1 - sensitivitet) / specificitet.
- Positiv prædiktiv værdi: sandsynligheden for sygdom ved positiv test.
- Negativ prædiktiv værdi: sandsynligheden for fravær af sygdom ved negativ test.
Prædiktive værdier påvirkes kraftigt af sygdomsprævalensen og kan ikke ukritisk overføres mellem almen praksis, akutmodtagelse og specialafdeling. Likelihood ratios kan bruges til at opdatere odds:
Odds før test = sandsynlighed før test / (1 - sandsynlighed før test)
Odds efter test = odds før test × likelihood ratio
Sandsynlighed efter test = odds efter test / (1 + odds efter test)Testning er mest værdifuld, når resultatet kan flytte sandsynligheden over en klinisk beslutningstærskel. En test er mindre anvendelig, hvis der skal gives behandling uanset resultatet, eller hvis intet muligt resultat ville begrunde behandling. Sensitivitet og specificitet ændrer sig desuden, når tærskelværdien ændres. ROC-kurven viser testens diskriminationsevne over flere tærskler, men angiver ikke alene, hvilken tærskelværdi der er klinisk hensigtsmæssig [15].
Systematiske oversigter og metaanalyser
Kontrollér, om oversigten har:
- en forhåndsregistreret eller dateret protokol
- eksplicitte inklusionskriterier
- en tilstrækkeligt bred og aktuel søgning
- uafhængig vurdering af mindst to personer
- redegørelse for ekskluderede fuldtekstartikler
- vurdering af risiko for bias for hvert relevant udfald
- en begrundet syntesemetode
- analyse af klinisk og statistisk heterogenitet
- vurdering af publikationsbias, når det er muligt
- angivelse af absolutte effekter og evidensens pålidelighed
Statistisk heterogenitet skal ikke vurderes alene med I². Også forskelle i population, dosis, intervention, opfølgning, definitioner og risiko for bias skal analyseres. Et samlet estimat kan være misvisende, hvis studierne ikke omhandler det samme kliniske spørgsmål.
Netværksmetaanalyse kan sammenligne flere behandlinger ved hjælp af både direkte og indirekte evidens. Metoden forudsætter rimelig transitivitet, hvilket indebærer, at studiernes effektmodifikatorer er tilstrækkeligt sammenlignelige til indirekte sammenligninger. Rangordning af behandlinger bør ikke læses uden effektstørrelser, konfidensintervaller, inkonsistensanalyse og vurdering af evidensens pålidelighed [16].
Fortolkning af effektmål
Relative og absolutte effekter
For et dikotomt udfald gælder:
Risiko i kontrolgruppen = hændelser i kontrolgruppen / antal i kontrolgruppen
Risiko i interventionsgruppen = hændelser i interventionsgruppen / antal i interventionsgruppen
Relativ risiko, RR = interventionsrisiko / kontrolrisiko
Relativ risikoreduktion = 1 - RR
Absolut risikoreduktion, ARR = kontrolrisiko - interventionsrisiko
NNT = 1 / ARRHvis risikoen falder fra 10 procent til 8 procent, er RR 0,80, den relative risikoreduktion 20 procent, ARR 2 procentpoint og NNT 50 i den undersøgte periode. Hvis samme RR gælder, når baselinerisikoen er 1 procent, bliver ARR 0,2 procentpoint og NNT 500. Den relative effekt er den samme, men den kliniske gavn er meget forskellig.
NNT skal altid angives sammen med:
- udfald
- tidsperiode
- sammenligning
- patientgruppe eller baselinerisiko
- konfidensinterval, når det foreligger
For skade anvendes tilsvarende absolut risikoøgning og number needed to harm, NNH. NNT og NNH bør ikke sammenlignes mekanisk, hvis udfaldene er forskellige i alvorlighed.
Odds ratio kan tilnærme relativ risiko, når hændelsen er sjælden, men overvurderer ofte den relative effekt, når udfaldet er hyppigt. Hazard ratio beskriver relative hændelsesrater over tid og kan ikke direkte omsættes til en risk ratio uden yderligere information.
Kontinuerlige udfald
Middelforskel er lettest at fortolke, når alle studier anvender samme skala. Standardiseret middelforskel anvendes, når forskellige skalaer måler samme konstrukt, men udtrykkes i standardafvigelser og er mindre klinisk intuitiv.
Statistisk signifikans skal adskilles fra klinisk betydning. Et meget stort studie kan påvise en lille forskel, som patienten ikke mærker. Den mindste klinisk vigtige forskel kan være til hjælp, men værdien afhænger af population, måleinstrument, udgangsniveau og metode. En tærskelværdi fra en anden sygdomsgrad eller intervention bør ikke anvendes uden afprøvning af relevansen [17].
Konfidensintervaller og p-værdier
P-værdien angiver, hvor uforenelige de observerede data er med en specificeret statistisk nulhypotese, givet modellens antagelser. Den angiver ikke sandsynligheden for, at hypotesen er sand, sandsynligheden for, at resultatet skyldes tilfældigheder, eller effektens kliniske betydning.
Konfidensintervallet viser både retning og præcision. Spørg:
- Inkluderer intervallet ingen effekt?
- Inkluderer det en klinisk vigtig gavn?
- Inkluderer det en klinisk vigtig skade?
- Er intervallet så bredt, at flere forskellige beslutninger fortsat er rimelige?
Et ikke-signifikant resultat kan skyldes utilstrækkelig præcision og er ikke automatisk ensbetydende med påvist fravær af effekt. Ækvivalens og non-inferiority kræver særlige prædefinerede marginer og analyseprincipper.
Et klinisk eksempel på absolut effekt
I en metaanalyse af PSA-baseret prostatacancerscreening svarede en mulig relativ reduktion af prostatacancerspecifik dødelighed i det metodologisk stærkeste studie til omtrent ét dødsfald færre per 1 000 screenede mænd over ti år. Samtidig øgedes diagnostik og behandlingsrelaterede komplikationer. Eksemplet viser, hvorfor relative effektmål, absolutte tal, tidshorisont og skader skal præsenteres samlet [18].
Vurdering af evidensens pålidelighed
GRADE vurderer evidens per udfald, ikke per artikel. Et studie kan derfor give et mere pålideligt grundlag for mortalitet end for livskvalitet eller bivirkninger.
| GRADE-domæne | Spørgsmål ved vurderingen |
|---|---|
| Risiko for bias | Kan studiernes gennemførelse systematisk have forvredet resultatet? |
| Inkonsistens | Varierer effektens størrelse eller retning mellem studier uden rimelig forklaring? |
| Indirekthed | Afviger population, intervention, sammenligning eller udfald fra beslutningen? |
| Manglende præcision | Er konfidensintervallet så bredt, at forskellige kliniske beslutninger er mulige? |
| Publikationsbias | Kan negative eller små studier mangle? |
Randomiserede studier begynder sædvanligvis som evidens med høj pålidelighed og kan nedgraderes. Observationsstudier begynder sædvanligvis lavere, men kan i visse situationer opgraderes, eksempelvis ved meget stor effekt, dosis-respons, eller når resterende confounding sandsynligvis ville reducere den observerede effekt [5].
En stærk anbefaling kan undertiden gives trods lav evidenspålidelighed, eksempelvis når en livstruende skade er plausibel, og alternativet er enkelt og sikkert. Omvendt kan en betinget anbefaling være rimelig trods høj evidenspålidelighed, når gavn og skade ligger tæt på hinanden, eller patienternes værdier varierer.
Fra evidens til patientbeslutning
Anvendelighed
Efter den kritiske vurdering skal følgende vurderes:
- Ligner patienten studiedeltagerne med hensyn til sygdomsgrad, alder og komorbiditet?
- Er patientens baselinerisiko højere eller lavere?
- Er interventionens dosis, intensitet og opfølgning gennemførlige?
- Har patienten kontraindikationer eller særlig sårbarhed over for skade?
- Blev der målt udfald, som patienten tillægger værdi?
- Er tidshorisonten relevant for forventet levetid og behandlingsmål?
- Foreligger der konkurrerende risici?
- Hvilke praktiske omkostninger, kontroller og behandlingsbyrder kommer til?
- Svarer sammenligningsbehandlingen til aktuel svensk behandlingspraksis?
Multisygdom kan gøre separate retningslinjer modstridende. En kombination af flere evidensbaserede anbefalinger er ikke automatisk evidensbaseret, hvis den fører til polyfarmaci, urimelig behandlingsbyrde eller samvirkende bivirkninger. Prioritér da de udfald, der er vigtigst for patienten, og tag hensyn til tiden indtil forventet gavn.
Fælles beslutningstagning
Når der findes flere rimelige alternativer, bør klinikeren redegøre for:
- at der skal træffes en beslutning
- hvilke alternativer der findes, herunder at afstå
- forventet absolut gavn og skade
- usikkerheden i estimaterne
- praktiske konsekvenser
- hvilke udfald patienten tillægger størst værdi
Beslutningsstøtteværktøjer til patienter kan forbedre viden, risikoopfattelse og deltagelse. Et Cochrane-review med 209 studier og 107 698 deltagere viste, at beslutningsstøtte sandsynligvis øgede overensstemmelsen mellem informerede værdier og valg. De forbedrede også viden og korrekt risikoopfattelse uden påvist øgning af beslutningskonflikt [19].
Risici bør helst udtrykkes som naturlige frekvenser med samme nævner, eksempelvis "8 ud af 100 sammenlignet med 10 ud af 100 over fem år". Undgå at præsentere gavnen som relativ risikoreduktion og skaden som absolut risikoøgning. Brug samme tidshorisont og visuelle format for begge.
Dokumentér gerne:
- hvilken beslutning der blev truffet
- hvilke alternativer der blev drøftet
- estimeret gavn og skade
- patientens vigtigste mål
- resterende usikkerhed
- planlagt opfølgning og kriterier for revurdering
Opfølgning, implementering og revurdering
Evidensbaseret medicin slutter ikke, når beslutningen er truffet. Evaluér, om interventionen blev gennemført, om den havde den tilsigtede effekt, og om der opstod uønskede konsekvenser.
På individniveau bør opfølgningen omfatte:
- patientrelevant effekt
- bivirkninger og behandlingsbyrde
- adhærens og gennemførlighed
- ændrede præferencer
- nye kontraindikationer eller konkurrerende risici
- behov for dosisændring, seponering eller alternativ strategi
På organisationsniveau kan man måle adhærens til en anbefalet proces, uønsket variation, patientudfald, lighed i sundhed, ressourceforbrug og forekomst af overdiagnostik eller behandling med lav værdi.
Undervisning alene giver ofte begrænset ændring. Et Cochrane-review af 215 studier fandt, at undervisningsmøder sandsynligvis gav en lille forbedring af klinisk praksis og en mindre forbedring af patientudfald. Effekten varierede og så ud til at kunne styrkes af flere samvirkende strategier [20]. Implementering kan derfor kræve kombinationer af lokale behandlingsforløb, feedback, påmindelser, ansvarsfordeling og adgang til beslutningsstøtte.
Elektroniske påmindelser er ikke en universalløsning. En systematisk oversigt over 54 randomiserede studier i almen praksis fandt forbedringer primært i dokumentation og visse patientcentrerede procesmål, mens effekterne på sikkerhed, effektivitet og kliniske udfald var mindre konsistente [21]. Beslutningsstøtte bør udformes, så den passer til arbejdsgangen, kan tilsidesættes, når patienten afviger fra standardsituationen, og ikke bidrager til alarmtræthed.
Vidensgrundlaget bør revurderes, når:
- en ny behandling eller diagnostisk metode indføres
- nye sikkerhedssignaler opstår
- et vigtigt randomiseret studie publiceres
- en systematisk oversigt eller retningslinje opdateres
- patientens baselinerisiko eller mål ændrer sig
- interventionen ikke giver den forventede effekt
- behandlingsbyrden overstiger gavnen
En velfungerende evidensbaseret kultur kræver derfor både individuelle færdigheder og organisatoriske systemer for søgning, kritisk vurdering, fælles beslutningstagning, opfølgning og afvikling af ineffektive arbejdsgange.
Kilder
- Sackett DL et al. Evidence based medicine: what it is and what it isn't. BMJ 1996. PMID: 8555924
- Kumaravel B et al. A systematic review and taxonomy of tools for evaluating evidence-based medicine teaching in medical education. Systematic Reviews 2020. PMID: 32331530
- Grant MJ, Booth A. A typology of reviews: an analysis of 14 review types and associated methodologies. Health Information and Libraries Journal 2009. PMID: 19490148
- Arents BWM et al. Global Guidelines in Dermatology Mapping Project, a systematic review of atopic dermatitis clinical practice guidelines: are they clear, unbiased, trustworthy and evidence based? British Journal of Dermatology 2022. PMID: 34984668
- Guyatt G et al. GRADE guidelines: 1. Introduction, GRADE evidence profiles and summary of findings tables. Journal of Clinical Epidemiology 2011. PMID: 21195583
- Page MJ et al. The PRISMA 2020 statement: an updated guideline for reporting systematic reviews. BMJ 2021. PMID: 33782057
- Shea BJ et al. AMSTAR 2: a critical appraisal tool for systematic reviews that include randomised or non-randomised studies of healthcare interventions, or both. BMJ 2017. PMID: 28935701
- Schulz KF et al. CONSORT 2010 statement: updated guidelines for reporting parallel group randomised trials. BMJ 2010. PMID: 20332509
- von Elm E et al. The Strengthening the Reporting of Observational Studies in Epidemiology statement: guidelines for reporting observational studies. Journal of Clinical Epidemiology 2008. PMID: 18313558
- Bossuyt PM et al. STARD 2015: an updated list of essential items for reporting diagnostic accuracy studies. BMJ 2015. PMID: 26511519
- Collins GS et al. Transparent reporting of a multivariable prediction model for individual prognosis or diagnosis: the TRIPOD statement. BMJ 2015. PMID: 25569120
- Hammer GP et al. Avoiding bias in observational studies: part 8 in a series of articles on evaluation of scientific publications. Deutsches Ärzteblatt International 2009. PMID: 19946431
- Prada-Ramallal G et al. Bias in pharmacoepidemiologic studies using secondary health care databases: a scoping review. BMC Medical Research Methodology 2019. PMID: 30871502
- Liau MYQ et al. Can propensity score matching replace randomized controlled trials? World Journal of Methodology 2024. PMID: 38577204
- Kallner A. Bayes' theorem, the ROC diagram and reference values: definition and use in clinical diagnosis. Biochemia Medica 2018. PMID: 29209139
- Christofilos SI et al. Network meta-analyses: methodological prerequisites and clinical usefulness. World Journal of Methodology 2022. PMID: 35721244
- Draak THP et al. The minimum clinically important difference: which direction to take. European Journal of Neurology 2019. PMID: 30793428
- Ilic D et al. Prostate cancer screening with prostate-specific antigen test: a systematic review and meta-analysis. BMJ 2018. PMID: 30185521
- Stacey D et al. Decision aids for people facing health treatment or screening decisions. Cochrane Database of Systematic Reviews 2024. PMID: 38284415
- Forsetlund L et al. Continuing education meetings and workshops: effects on professional practice and healthcare outcomes. Cochrane Database of Systematic Reviews 2021. PMID: 34523128
- Nguyen OT et al. Electronic health record nudges and health care quality and outcomes in primary care: a systematic review. JAMA Network Open 2024. PMID: 39287947