Diagnostiske test: sensitivitet, specificitet og prædiktive værdier

Sammenfatning

Sensitivitet angiver sandsynligheden for et positivt test hos personer, der har måltilstanden, mens specificitet angiver sandsynligheden for et negativt test hos personer, der ikke har den. Positiv og negativ prædiktiv værdi besvarer det kliniske spørgsmål: hvor sandsynligt er det, at patienten har, henholdsvis ikke har, tilstanden efter et positivt eller negativt test? Prædiktive værdier påvirkes stærkt af prætestsandsynligheden. Et positivt test kan derfor have lav prædiktiv værdi ved testning af en lavrisikopopulation, selv om sensitivitet og specificitet er høje [1,2].

Likelihood ratios er ofte mest anvendelige til at overføre et testresultat til den enkelte patient. Prætestodds ganges med testresultatets likelihood ratio og giver posttestodds. Resultatet omregnes derefter til posttestsandsynlighed efter Bayes' sætning [3,4]. Et test bør kun bestilles, hvis resultatet kan bringe sandsynligheden over en tærskel for behandling eller yderligere udredning, eller under en tærskel, hvor tilstanden kan afskrives.

Sensitivitet og specificitet er ikke uforanderlige laboratorieegenskaber. De varierer med den valgte beslutningsgrænse, sygdommens sværhedsgrad, patientudvælgelse, klinisk setting, testudførelse og referencestandard. Resultater fra diagnostiske studier skal derfor vurderes ud fra både risiko for bias og anvendelighed i ens egen population. Sikker diagnostisk anvendelse kræver, at man vurderer hele parret af sensitivitet og specificitet, konfidensintervallerne, patientpopulationen, referencestandarden, håndteringen af inkonklusive resultater og testets tilsigtede rolle.

Grundlæggende begreber

Måltilstand, indekstest og referencestandard

Et diagnostisk nøjagtighedsstudie sammenligner et indekstest, det test der evalueres, med en referencestandard, den metode der bruges til at afgøre, om måltilstanden faktisk foreligger. Måltilstanden kan være en sygdom, et stadium, en anatomisk forandring eller en anden klinisk relevant tilstand.

Begrebet diagnostisk test omfatter mere end laboratorieanalyser. Symptomer, objektive fund, billeddiagnostik, histopatologi, mikrobiologi, fysiologiske undersøgelser, kliniske scoringssystemer og algoritmer kan alle evalueres som indekstest.

Testets tilsigtede rolle skal defineres, før nøjagtigheden fortolkes:

  • Screeningstest: anvendes hos personer uden kendt sygdom.
  • Triagetest: afgør, hvem der har brug for et mere ressourcekrævende eller invasivt test.
  • Tillægstest: anvendes efter eksisterende udredning for at forbedre klassifikationen.
  • Erstatningstest: er tænkt til at erstatte et etableret test.
  • Bekræftende test: anvendes primært til at bekræfte en mistænkt diagnose.
  • Udelukkende test: anvendes primært til at sænke sandsynligheden til et acceptabelt niveau.

Den kliniske rolle afgør, hvilke fejl der er alvorligst. Et triagetest, der skal udelukke en farlig tilstand, kræver som regel meget høj sensitivitet, mens et test, der fører til risikofyldt behandling eller kirurgi, ofte kræver høj specificitet [5].

Firefeltstabellen

Når både indekstest og referencestandard klassificeres som positive eller negative, opstår fire mulige udfald.

Måltilstand til stede Måltilstand fraværende
Test positivt Sandt positivt, SP Falsk positivt, FP
Test negativt Falsk negativt, FN Sandt negativt, SN

Sensitivitet og specificitet beregnes lodret i tabellen, inden for grupperne med henholdsvis uden måltilstanden. Prædiktive værdier beregnes vandret, inden for grupperne med henholdsvis positivt og negativt test.

Centrale mål og formler

Mål Formel Klinisk fortolkning
Sensitivitet SP / (SP + FN) Andel af dem med tilstanden, der tester positivt
Specificitet SN / (SN + FP) Andel af dem uden tilstanden, der tester negativt
Falsk negativ andel FN / (SP + FN) 1 minus sensitivitet
Falsk positiv andel FP / (SN + FP) 1 minus specificitet
Positiv prædiktiv værdi, PPV SP / (SP + FP) Sandsynlighed for tilstanden efter positivt test
Negativ prædiktiv værdi, NPV SN / (SN + FN) Sandsynlighed for fravær af tilstanden efter negativt test
Positiv likelihood ratio, LR+ Sensitivitet / (1 minus specificitet) Hvor meget et positivt test øger oddsene
Negativ likelihood ratio, LR− (1 minus sensitivitet) / specificitet Hvor meget et negativt test mindsker oddsene
Samlet korrekt klassifikation (SP + SN) / samtlige Andel korrekt klassificerede i den undersøgte population
Diagnostisk odds ratio LR+ / LR− Samlet diskriminationsmål, men skjuler balancen mellem sensitivitet og specificitet

Samlet korrekt klassifikation kan være misvisende. Hvis en tilstand forekommer hos 1 procent af populationen, giver strategien at erklære alle raske 99 procents korrekt klassifikation, selv om ikke et eneste sygdomstilfælde identificeres. Målet bør derfor ikke erstatte rapportering af sensitivitet og specificitet.

Sensitivitet og specificitet

Sensitivitet

Sensitiviteten er sandsynligheden for et positivt test givet, at måltilstanden foreligger:

Sensitivitet = P(test positivt | måltilstand til stede)

Et test med 95 procents sensitivitet giver, i den undersøgte population og ved den aktuelle beslutningsgrænse, negativt resultat hos 5 procent af personerne med måltilstanden.

Høj sensitivitet er særlig vigtig, når:

  • en overset tilstand kan medføre alvorlig skade
  • effektiv tidlig behandling findes
  • testet anvendes som første triage før definitiv diagnostik
  • et negativt resultat skal kunne afslutte eller forenkle udredningen.

Den kliniske konsekvens af et negativt test afhænger dog ikke alene af sensitiviteten. Specificiteten og prætestsandsynligheden påvirker LR− og dermed den resterende posttestsandsynlighed. Huskereglen om, at et negativt højsensitivt test udelukker sygdom, gælder kun, når sensitiviteten er tilstrækkelig høj i den aktuelle population, og når posttestsandsynligheden faktisk havner under den kliniske udelukkelsestærskel [1,4].

Specificitet

Specificiteten er sandsynligheden for et negativt test givet, at måltilstanden er fraværende:

Specificitet = P(test negativt | måltilstand fraværende)

Et test med 90 procents specificitet giver positivt resultat hos 10 procent af personerne uden måltilstanden.

Høj specificitet er særlig vigtig, når:

  • et positivt resultat fører til risikofyldt eller bekostelig behandling
  • diagnosen har store psykologiske, sociale eller forsikringsmæssige konsekvenser
  • testet anvendes til at bekræfte en diagnose efter et sensitivt triagetest
  • falsk positive resultater fører til invasiv videre udredning.

Et positivt højspecifikt test kan give stærk støtte til diagnosen, men kun hvis den positive likelihood ratio er tilstrækkelig stor, og testet anvendes i den rette kliniske sammenhæng.

Sensitivitet og specificitet skal rapporteres sammen

Sensitivitet og specificitet er et par. Et test kan ikke vurderes ved kun at angive det ene mål. Et laboratorietest med lav beslutningsgrænse kan eksempelvis have høj sensitivitet, men lav specificitet. Hvis beslutningsgrænsen hæves, falder sensitiviteten som regel, samtidig med at specificiteten stiger.

Det er derfor utilstrækkeligt at beskrive et test som eksempelvis 95 procent korrekt uden at angive:

  • valgt beslutningsgrænse
  • sensitivitet
  • specificitet
  • konfidensintervaller
  • patientpopulation
  • referencestandard
  • andel inkonklusive eller manglende resultater.

Diagnostiske mål er desuden følsomme for studiedesignet. Studier, der sammenligner tydeligt syge patienter med raske kontroller, giver ofte højere nøjagtighed end studier af konsekutive patienter med realistisk diagnostisk usikkerhed [2,6].

Prædiktive værdier og prætestsandsynlighed

Positiv prædiktiv værdi

PPV er sandsynligheden for, at måltilstanden foreligger efter et positivt test:

PPV = P(måltilstand til stede | test positivt)

Dette må ikke forveksles med sensitivitet. Sensitiviteten tager udgangspunkt i personer, der allerede er klassificeret som syge. PPV tager udgangspunkt i personer med et positivt test og spørger, hvor mange af dem der faktisk har tilstanden.

Negativ prædiktiv værdi

NPV er sandsynligheden for, at måltilstanden er fraværende efter et negativt test:

NPV = P(måltilstand fraværende | test negativt)

Også dette er en omvendt betinget sandsynlighed sammenlignet med specificiteten. Høj specificitet indebærer ikke automatisk høj NPV.

Prævalens og klinisk sandsynlighed

Prædiktive værdier afhænger af andelen af personer med måltilstanden i den testede population. Når prætestsandsynligheden stiger:

  • stiger PPV
  • falder NPV.

Når prætestsandsynligheden falder:

  • falder PPV
  • stiger NPV.

Prævalensen i et diagnostisk studie kan kun bruges som prætestsandsynlighed, hvis studiepopulationen svarer til den population, hvor testet skal anvendes. For den enkelte patient bør prætestsandsynligheden baseres på relevant klinisk information, såsom symptomer, objektive fund, risikofaktorer, tidligere testresultater og behandlingsniveau [3].

Regneeksempel

Antag et test med:

  • sensitivitet 90 procent
  • specificitet 90 procent
  • prætestsandsynlighed 10 procent
  • 1 000 testede personer.
Udfald Antal
Sandt positive 90
Falsk negative 10
Sandt negative 810
Falsk positive 90

PPV bliver:

90 / (90 + 90) = 50 procent

NPV bliver:

810 / (810 + 10) = 98,8 procent

Trods 90 procents sensitivitet og 90 procents specificitet har kun halvdelen af personerne med positivt test måltilstanden.

Hvis det samme test anvendes i en population med 1 procents prætestsandsynlighed, bliver der blandt 10 000 personer:

  • 90 sandt positive
  • 10 falsk negative
  • 990 falsk positive
  • 8 910 sandt negative.

PPV bliver da:

90 / (90 + 990) = 8,3 procent

Det positive resultat er altså oftere falsk end sandt. Eksemplet viser, hvorfor bred testning af lavrisikopersoner kan skabe mange falsk positive fund, selv når testets specificitet forekommer høj.

Likelihood ratios og Bayes' sætning

Likelihood ratios

Likelihood ratioen angiver, hvor meget mere sandsynligt et givet testresultat er hos en person med måltilstanden end hos en person uden den.

For et binært test gælder:

LR+ = sensitivitet / (1 minus specificitet)

LR− = (1 minus sensitivitet) / specificitet

LR+ skal være så stor som muligt. LR− skal være så tæt på nul som muligt.

Likelihood ratio Typisk påvirkning af sandsynligheden
LR+ over 10 Stor stigning
LR+ 5 til 10 Moderat stigning
LR+ 2 til 5 Lille stigning
LR+ nær 1 Minimal diagnostisk information
LR− 0,5 til 1 Minimalt eller lille fald
LR− 0,2 til 0,5 Lille fald
LR− 0,1 til 0,2 Moderat fald
LR− under 0,1 Stort fald

Grænserne er pædagogiske tommelfingerregler, ikke universelle kliniske kriterier. Hvor stor en ændring der er brug for, afhænger af udgangssandsynligheden og af, hvilke beslutninger testet skal styre.

Fra prætest til posttest

Bayes' sætning kan anvendes i tre trin:

  1. Omregn prætestsandsynlighed til prætestodds.
  2. Gang prætestodds med den relevante likelihood ratio.
  3. Omregn posttestodds til posttestsandsynlighed.

Formler:

Prætestodds = prætestsandsynlighed / (1 minus prætestsandsynlighed)

Posttestodds = prætestodds × likelihood ratio

Posttestsandsynlighed = posttestodds / (1 + posttestodds)

For testet i det foregående eksempel:

  • sensitivitet 0,90
  • specificitet 0,90
  • LR+ = 0,90 / 0,10 = 9
  • LR− = 0,10 / 0,90 = 0,11.

Ved 10 procents prætestsandsynlighed er prætestodds 0,10 / 0,90 = 0,111.

Efter positivt test:

  • posttestodds = 0,111 × 9 = 1
  • posttestsandsynlighed = 1 / 2 = 50 procent.

Efter negativt test:

  • posttestodds = 0,111 × 0,11 = 0,0123
  • posttestsandsynligheden bliver cirka 1,2 procent.

Resultaterne svarer til PPV og komplementet til NPV i firefeltstabellen. Likelihood ratios er særligt praktiske, fordi de samme testegenskaber kan kombineres med forskellige prætestsandsynligheder [3,4].

Test med flere niveauer og intervalspecifikke likelihood ratios

At dikotomisere kontinuerlige testresultater til positivt eller negativt medfører tab af information. En værdi langt over beslutningsgrænsen giver ofte en større stigning i sandsynligheden end en grænsenær værdi. Tilsvarende kan en meget lav værdi mindske sandsynligheden mere end et knapt negativt resultat.

Når data foreligger, bør kontinuerlige eller ordinale test inddeles i klinisk relevante intervaller med en likelihood ratio for hvert interval. Dette er ofte mere informativt end en enkelt beslutningsgrænse og anbefales ved kritisk rapportering af diagnostiske test [4].

Flere test i rækkefølge

Ved sekventiel testning bliver posttestsandsynligheden efter det første test prætestsandsynlighed for det næste. Likelihood ratios kan kun ganges med hinanden, hvis testresultaterne er tilstrækkeligt uafhængige givet sygdomsstatus. Hvis to test måler det samme biologiske fænomen, kan deres fejl være korrelerede. En simpel multiplikation risikerer da at overdrive evidensen.

I praksis bør man:

  • opdatere sandsynligheden efter hvert betydningsfuldt resultat
  • overveje, om testene måler det samme eller forskellige fænomener
  • undgå at behandle flere nært beslægtede fund som uafhængig evidens
  • anvende validerede diagnostiske algoritmer, når sådanne findes.

Beslutningsgrænser og ROC-kurver

Valg af beslutningsgrænse

For et kontinuerligt test skal der vælges en grænse for, hvad der skal betragtes som positivt. Hvis højere værdier taler for måltilstanden, fører en sænket grænse som regel til:

  • højere sensitivitet
  • lavere specificitet
  • flere falsk positive resultater
  • færre falsk negative resultater.

En hævet grænse giver den modsatte effekt.

Den diagnostiske beslutningsgrænse er ikke nødvendigvis det samme som laboratoriets referenceinterval. Et referenceinterval beskriver som regel fordelingen i en referencepopulation. En klinisk beslutningsgrænse vælges for at skelne mellem handlemuligheder og skal valideres til dette formål [1].

ROC-kurven

En ROC-kurve viser sensitivitet på den lodrette akse mod falsk positiv andel, det vil sige 1 minus specificitet, på den vandrette akse for alle mulige beslutningsgrænser [5].

Kurven kan bruges til at:

  • beskrive afvejningen mellem sensitivitet og specificitet
  • sammenligne testets diskrimination ved forskellige grænser
  • identificere mulige beslutningsgrænser
  • sammenligne test, forudsat at sammenligningen er korrekt udformet.

Arealet under ROC-kurven

AUC kan fortolkes som sandsynligheden for, at en tilfældigt valgt person med måltilstanden får en mere afvigende testværdi end en tilfældigt valgt person uden tilstanden. En AUC på 0,5 svarer til ingen diskrimination, mens 1,0 svarer til perfekt rangordning [5].

AUC har vigtige begrænsninger:

  • Den angiver ikke sensitivitet eller specificitet ved den klinisk anvendte grænse.
  • Den vægter dele af ROC-kurven, som kan være klinisk irrelevante.
  • To test kan have samme AUC, men helt forskellig ydeevne i det relevante område.
  • AUC siger intet direkte om kalibrering, prædiktive værdier eller klinisk nytte.
  • En høj AUC garanterer ikke, at der findes en anvendelig beslutningstærskel.

Undersøgelser af ROC-analyser har vist hyppige problemer med manglende konfidensintervaller, utilstrækkelige sammenligninger mellem test og fejlagtig analyse af parrede data [6]. Beslutningsgrænsen bør helst være foruddefineret ud fra kliniske konsekvenser eller ekstern evidens. Hvis den vælges i det samme datamateriale for at maksimere eksempelvis summen af sensitivitet og specificitet, bliver resultatet optimistisk og kræver ekstern validering [7].

Fra testegenskaber til klinisk beslutning

Testtærskel og behandlingstærskel

Diagnostisk håndtering kan ses som tre sandsynlighedsområder:

  1. Under testtærsklen er måltilstanden så usandsynlig, at videre testning ikke er begrundet.
  2. Mellem testtærsklen og behandlingstærsklen kan et test ændre håndteringen.
  3. Over behandlingstærsklen er sandsynligheden så høj, at behandling eller anden målrettet indsats kan være begrundet uden yderligere test, forudsat at risiciene ved indsatsen er acceptable.

Et test er mest værdifuldt, når prætestsandsynligheden ligger mellem tærsklerne, og når et positivt eller negativt resultat kan flytte patienten over en af dem.

flowchart TD
A["Vurder klinisk<br>prætestsandsynlighed"] --> B["Ligger sandsynligheden i<br>et område, hvor testet<br>kan ændre håndteringen?"]
B -->|"Nej, meget lav"| C["Undlad test<br>og overvej anden forklaring"]
B -->|"Nej, meget høj"| D["Overvej behandling eller<br>definitiv diagnostik"]
B -->|"Ja"| E["Vælg test ud fra klinisk rolle,<br>LR, risiko og tilgængelighed"]
E --> F["Fortolk resultatet med<br>Bayes' sætning"]
F --> G["Posttestsandsynlighed under<br>udelukkelsestærsklen"]
F --> H["Posttestsandsynlighed mellem<br>tærsklerne"]
F --> I["Posttestsandsynlighed over<br>handlingstærsklen"]
G --> J["Afslut eller omdiriger<br>udredningen"]
H --> K["Suppler med uafhængigt<br>test eller opfølgning"]
I --> L["Bekræft om nødvendigt og<br>indled målrettet indsats"]

Diagnostisk nøjagtighed er ikke det samme som klinisk nytte

Et nøjagtigt test forbedrer ikke automatisk patientudfald. Nytten afhænger af:

  • om resultatet ændrer kliniske beslutninger
  • om efterfølgende behandling er effektiv
  • hvor hurtigt svaret foreligger
  • omkostninger og ressourcebehov
  • komplikationer ved prøvetagning eller videre udredning
  • konsekvenser af falsk positive og falsk negative resultater
  • patientens værdier.

STARD 2015 fremhæver, at diagnostiske studier skal angive testets tilsigtede anvendelse, kliniske rolle og mulige konsekvenser for patienterne [7,8]. Et konkret eksempel er hurtigtest ved ondt i halsen. Randomiserede studier viste, at teststyret håndtering reducerede andelen af antibiotikaordinationer med cirka 25 procentpoint, men evidensen for komplikationer og andre patientnære udfald var usikker [20]. Nøjagtighedsdata skal altså suppleres med studier af, hvordan testet påvirker behandlingsforløb og helbred.

Beslutningskurveanalyse kan estimere nettogevinsten ved en teststrategi ved forskellige kliniske sandsynlighedstærskler. Metoden vejer sandt positive resultater mod falsk positive ud fra konsekvenserne ved den valgte tærskel. Den kan vise, at en model med højere AUC alligevel har lavere klinisk nytte på grund af mangelfuld kalibrering eller uhensigtsmæssige beslutninger [19].

Fortolkning i forskellige kliniske situationer

Screening og lav prætestsandsynlighed

Ved screening er de fleste testede raske. Selv en lille falsk positiv andel kan derfor give flere falsk positive end sandt positive resultater. Kravene til specificitet, bekræftende testning og klare opfølgningsalgoritmer er høje.

Et screeningsprogram bør ikke vurderes alene ud fra sensitivitet. Man skal også tage hensyn til:

  • absolut antal falsk positive
  • overdiagnostik
  • invasive opfølgende undersøgelser
  • bekymring og sygeliggørelse
  • ressourceforbrug
  • om tidligere diagnostik forbedrer patientrelevante udfald.

Akut farlig tilstand

Ved mistanke om en akut og farlig tilstand er omkostningen ved et falsk negativt resultat ofte høj. Teststrategien bør derfor prioritere lav LR−. Hvis prætestsandsynligheden er høj, kan et negativt test med moderat LR− være utilstrækkeligt til at udelukke tilstanden.

Et negativt test må ikke fortolkes isoleret, hvis:

  • prøven blev taget for tidligt eller for sent i sygdomsforløbet
  • prøvekvaliteten var mangelfuld
  • behandlingen kan have påvirket testet
  • patienten tilhører en gruppe, hvor sensitiviteten er lavere
  • testet ikke er valideret til den aktuelle kliniske præsentation.

Bekræftende diagnostik

Når et positivt test fører til betydelig behandling, kirurgi eller en langvarig diagnose, kræves ofte høj LR+. Undertiden er der brug for et andet, metodologisk uafhængigt test for at mindske risikoen for, at den samme fejlkilde forårsager begge resultater.

Billeddiagnostik

Billeddiagnostiske studier er særligt følsomme for:

  • undersøgerens erfaring
  • teknisk udstyr og protokoller
  • kendskab til kliniske oplysninger
  • kendskab til andre billedfund
  • uklare eller flere beslutningsgrænser
  • verifikation overvejende af testpositive patienter.

Testets kliniske rolle skal angives. En metode kan være tilstrækkelig specifik til at lokalisere en forandring forud for kirurgi, men utilstrækkelig sensitiv til at udelukke sygdommen. I en Cochrane-oversigt over billeddiagnostik ved endometriose varierede nøjagtigheden med anatomisk lokalisation og klinisk rolle. Ingen undersøgelsesmetode kunne pålideligt erstatte kirurgisk diagnostik for al bækkenendometriose, trods god ydeevne for visse afgrænsede læsioner [21].

Kritisk vurdering af diagnostiske studier

Patientudvælgelse

Det mest anvendelige design omfatter som regel konsekutive eller tilfældigt udvalgte patienter, som i klinisk praksis ville blive overvejet til testet. Et case-kontrol-studie, hvor patienter med fremskreden, sikker sygdom sammenlignes med raske kontroller, skaber et unaturligt bredt spektrum. Sådanne studier risikerer at overvurdere både sensitivitet og specificitet.

Vurder:

  • inklusions- og eksklusionskriterier
  • behandlingsniveau og henvisningsveje
  • tidligere testning
  • sygdommens stadium og sværhedsgrad
  • relevante differentialdiagnoser i gruppen uden måltilstanden
  • om rekrutteringen var konsekutiv, tilfældig eller baseret på bekvemmelighedsudvælgelse.

Empiriske metodeoversigter har identificeret variation i demografi, sygdomsprævalens, sværhedsgrad, verifikation, observatør og instrument som vigtige årsager til varierende nøjagtighedsresultater [9,11].

Referencestandard

Referencestandarden behøver ikke være perfekt, men den skal klassificere måltilstanden tilstrækkeligt korrekt og uafhængigt af indekstestet. En mangelfuld referencestandard kan få et godt indekstest til at fremstå dårligere, eller omvendt.

Risici omfatter:

  • Inkorporeringsbias: indekstestet indgår i referencediagnosen.
  • Review-bias: den, der fortolker referencestandarden, kender indekstestets resultat.
  • Differentiel verifikation: forskellige referencestandarder anvendes afhængigt af indekstestets resultat.
  • Partiel verifikation: kun visse patienter, ofte de testpositive, gennemgår referencestandarden.
  • Ændring over tid: måltilstanden ændrer sig mellem indekstest og referencestandard.

Hvis der ikke findes nogen accepteret referencestandard, kan man anvende sammensatte kriterier, ekspertpanel, longitudinel opfølgning eller statistiske latent klasse-modeller. Hver metode kræver eksplicitte antagelser og kan give forskellige resultater [12]. Latent klasse-modeller behandler den sande sygdomsstatus som en ikke-observeret variabel, men resultaterne kan være stærkt afhængige af antagelser om testenes indbyrdes afhængighed og om, hvorvidt nøjagtigheden er konstant mellem populationer [13].

Blinding og tilgængelig klinisk information

Indekstest og referencestandard bør så vidt muligt fortolkes uden kendskab til hinandens resultater. Samtidig skal studiet efterligne den tilsigtede kliniske anvendelse. Hvis en radiolog normalt har adgang til symptomer, tidligere billeder og laboratorieværdier, kan fuldstændig blinding give et mindre realistisk estimat.

Studiet skal derfor tydeligt angive:

  • hvilken information testfortolkeren havde
  • hvilken information referencebedømmeren havde
  • om beslutningsgrænserne var foruddefinerede
  • fortolkerens uddannelse og erfaring
  • hvordan uenighed mellem bedømmere blev håndteret.

Forløb, tidsintervaller og frafald

Alle inkluderede patienter bør redegøres for. Der kræves særlig opmærksomhed, når:

  • referencestandard mangler hos mange deltagere
  • frafaldet er forskelligt mellem testpositive og testnegative
  • behandlingen blev indledt før verifikation
  • et langt interval giver mulighed for, at tilstanden ændrer sig
  • inkonklusive resultater udelukkes fra analysen.

At udelukke teknisk mislykkede eller svært fortolkelige resultater kan give et overdrevent positivt billede af testets praktiske ydeevne. Andelen af sådanne resultater og deres kliniske håndtering bør rapporteres separat.

QUADAS-2 og STARD

QUADAS-2 vurderer diagnostiske studier inden for fire domæner:

  1. patientudvælgelse
  2. indekstest
  3. referencestandard
  4. patientforløb og tidsforhold.

De tre første vurderes også med hensyn til anvendelighed [10]. STARD 2015 er en rapporteringsretningslinje med 30 centrale punkter for transparent rapportering af diagnostiske nøjagtighedsstudier [8]. STARD er ikke et kvalitetsstempel, men manglende oplysninger gør det vanskeligt at vurdere bias.

Ved direkte sammenligninger mellem to test er det bedst, hvis begge test udføres på de samme patienter, eller hvis patienterne randomiseres mellem teststrategier. Forskelle mellem separate studier kan ellers skyldes population og gennemførelse snarere end testene. QUADAS-C supplerer QUADAS-2 ved sådanne sammenligninger [18].

Statistisk usikkerhed og metaanalyse

Konfidensintervaller

Alle diagnostiske mål er stikprøveestimater og skal rapporteres med konfidensintervaller. Præcisionen for sensitivitet bestemmes primært af antallet af personer med måltilstanden, mens præcisionen for specificitet bestemmes af antallet uden tilstanden.

Et resultat med 100 procents sensitivitet i et studie med ti syge patienter er meget usikkert. Nul observerede falsk negative resultater beviser ikke, at den sande sensitivitet er 100 procent.

Diagnostiske studier er ofte for små. I en kortlægning af 43 studier var medianen 49 deltagere med måltilstanden, og kun 5 procent rapporterede en forudgående stikprøvestørrelsesberegning [14]. I en senere gennemgang af 89 studier af depressionsinstrumenter rapporterede kun 3 procent en brugbar stikprøvestørrelsesberegning, og kun 8 procent havde et konfidensinterval for sensitiviteten med en bredde på højst 10 procentpoint [15].

Stikprøvestørrelsen bør planlægges ud fra:

  • mindste acceptable sensitivitet og specificitet
  • ønsket bredde af konfidensintervallerne
  • forventet prævalens
  • andel inkonklusive resultater og frafald
  • planlagte subgruppeanalyser
  • om flere test skal sammenlignes [16].

Metaanalyse af diagnostisk nøjagtighed

Sensitivitet og specificitet er korrelerede, især når studier anvender forskellige beslutningsgrænser. De bør derfor ikke metaanalyseres som helt uafhængige udfald. Anbefalede modeller omfatter den bivariate model og den hierarkiske summary ROC-model. Disse tager højde for både variation inden for studier, variation mellem studier og sammenhængen mellem sensitivitet og specificitet [17].

Et samlet estimat må ikke fortolkes uden at vurdere:

  • forskelle i patientpopulation
  • beslutningsgrænser
  • prøvetagning og analyseteknik
  • referencestandard
  • klinisk setting
  • studiernes risiko for bias
  • prædiktionsintervaller og heterogenitet.

Prædiktive værdier bør som regel ikke overføres direkte fra en metaanalyse til en lokal population. De kan i stedet beregnes ud fra samlet sensitivitet, specificitet og en relevant lokal prætestsandsynlighed.

Praktisk tjekliste

Når et diagnostisk testresultat skal vurderes, så kontroller følgende:

  1. Hvilken måltilstand er der tale om? Definitionen skal være klinisk relevant.
  2. Hvilken rolle har testet? Screening, triage, tillæg, erstatning eller bekræftelse.
  3. Hvad er prætestsandsynligheden? Tag udgangspunkt i patient, behandlingsniveau og tidligere information.
  4. Hvilken beslutningsgrænse anvendes? Kontroller, at den svarer til studiets og laboratoriets validering.
  5. Hvad er sensitivitet og specificitet? Læs dem som et par.
  6. Hvad er LR+ og LR−? Brug den relevante likelihood ratio til at opdatere sandsynligheden.
  7. Hvor præcist er resultatet? Vurder konfidensintervaller og antal personer med henholdsvis uden måltilstanden.
  8. Ligner studiepopulationen patienten? Tag hensyn til alder, stadium, komorbiditet, symptomer og tidligere testning.
  9. Er referencestandarden troværdig? Se efter partiel, differentiel eller inkorporeret verifikation.
  10. Hvordan blev inkonklusive resultater og frafald håndteret? Udelukkelse kan overvurdere testets ydeevne.
  11. Ændrer posttestsandsynligheden håndteringen? Hvis ikke, var testet sandsynligvis ikke begrundet.
  12. Er teststrategien klinisk nyttig? Nøjagtighed, omkostninger, risiko og patientudfald skal afvejes samlet.

Kilder

  1. Habibzadeh F. Diagnostic tests performance indices: an overview. Biochemia Medica 2025. PMID: 39974192
  2. Eusebi P. Diagnostic accuracy measures. Cerebrovascular Diseases 2013. PMID: 24135733
  3. Bours MJ. Bayes' rule in diagnosis. Journal of Clinical Epidemiology 2021. PMID: 33741123
  4. Fischer JE, Bachmann LM, Jaeschke R. A readers' guide to the interpretation of diagnostic test properties: clinical example of sepsis. Intensive Care Medicine 2003. PMID: 12734652
  5. Hajian-Tilaki K. Receiver Operating Characteristic (ROC) Curve Analysis for Medical Diagnostic Test Evaluation. Caspian Journal of Internal Medicine 2013. PMID: 24009950
  6. Obuchowski NA, Lieber ML, Wians FH Jr. ROC curves in clinical chemistry: uses, misuses, and possible solutions. Clinical Chemistry 2004. PMID: 15142978
  7. Cohen JF, Korevaar DA, Altman DG et al. STARD 2015 guidelines for reporting diagnostic accuracy studies: explanation and elaboration. BMJ Open 2016. PMID: 28137831
  8. Bossuyt PM, Reitsma JB, Bruns DE et al. STARD 2015: an updated list of essential items for reporting diagnostic accuracy studies. BMJ 2015. PMID: 26511519
  9. Whiting P, Rutjes AW, Reitsma JB et al. Sources of variation and bias in studies of diagnostic accuracy: a systematic review. Annals of Internal Medicine 2004. PMID: 14757617
  10. Whiting PF, Rutjes AW, Westwood ME et al. QUADAS-2: a revised tool for the quality assessment of diagnostic accuracy studies. Annals of Internal Medicine 2011. PMID: 22007046
  11. Whiting P, Rutjes AW, Dinnes J et al. Development and validation of methods for assessing the quality of diagnostic accuracy studies. Health Technology Assessment 2004. PMID: 15193208
  12. Rutjes AW, Reitsma JB, Coomarasamy A et al. Evaluation of diagnostic tests when there is no gold standard. A review of methods. Health Technology Assessment 2007. PMID: 18021577
  13. Collins J, Huynh M. Estimation of diagnostic test accuracy without full verification: a review of latent class methods. Statistics in Medicine 2014. PMID: 24910172
  14. Bachmann LM, Puhan MA, ter Riet G et al. Sample sizes of studies on diagnostic accuracy: literature survey. BMJ 2006. PMID: 16627488
  15. Thombs BD, Rice DB. Sample sizes and precision of estimates of sensitivity and specificity from primary studies on the diagnostic accuracy of depression screening tools: a survey of recently published studies. International Journal of Methods in Psychiatric Research 2016. PMID: 27060912
  16. Hajian-Tilaki K. Sample size estimation in diagnostic test studies of biomedical informatics. Journal of Biomedical Informatics 2014. PMID: 24582925
  17. Ma X, Nie L, Cole SR et al. Statistical methods for multivariate meta-analysis of diagnostic tests: an overview and tutorial. Statistical Methods in Medical Research 2016. PMID: 23804970
  18. Yang B, Mallett S, Takwoingi Y et al. QUADAS-C: A Tool for Assessing Risk of Bias in Comparative Diagnostic Accuracy Studies. Annals of Internal Medicine 2021. PMID: 34698503
  19. Van Calster B, Wynants L, Verbeek JFM et al. Reporting and Interpreting Decision Curve Analysis: A Guide for Investigators. European Urology 2018. PMID: 30241973
  20. Cohen JF, Pauchard JY, Hjelm N et al. Efficacy and safety of rapid tests to guide antibiotic prescriptions for sore throat. Cochrane Database of Systematic Reviews 2020. PMID: 32497279
  21. Nisenblat V, Bossuyt PM, Farquhar C et al. Imaging modalities for the non-invasive diagnosis of endometriosis. Cochrane Database of Systematic Reviews 2016. PMID: 26919512

Opdateret 29. september 2026