Kapittel 13 · Statistikk · 13.4
Sannsynlighet og diagnostiske tester
En diagnostisk test svarer sjelden med et rent ja eller nei – den gir et signal som noen ganger stemmer og noen ganger bommer. Spørsmålet du egentlig vil ha svar på når en test slår ut, er ikke «hvor god er testen i seg selv?», men det mer nærgående: hva betyr dette resultatet for pasienten foran meg? Svaret er en sannsynlighet, og det viser seg å avhenge like mye av hvor vanlig tilstanden er som av testens egenskaper. For å komme dit må vi først bygge selve sannsynlighetsbegrepet, og deretter la det gjøre arbeidet i tolkningen av tester. Dette er også der sannsynlighet kommer inn som forutsetning for resten av kapittelet: fordelingene, konfidensintervallene og hypotesetestene som følger, hviler alle på det vi legger her.
Utfallsrom, hendelse og sannsynlighet
Et tilfeldig forsøk er en handling med et utfall vi ikke kan forutsi sikkert – et terningkast, et myntkast, eller trekningen av hvilken pasient som blir den neste inn døra. Mengden av alle mulige utfall kaller vi utfallsrommet, og skriver det . For ett terningkast er . En hendelse er en delmengde av utfallsrommet – et utvalg av utfall vi er interessert i. «Terningen viser minst fem» er hendelsen .
Sannsynligheten for en hendelse , skrevet , er et tall mellom og som måler hvor ofte inntreffer i det lange løp: betyr aldri, betyr alltid, og betyr i halvparten av tilfellene. Tre grunnkrav – aksiomer – fester begrepet:
-
•
enhver sannsynlighet ligger mellom og : ;
-
•
hele utfallsrommet er sikkert: ;
-
•
en umulig hendelse har sannsynlighet null.
Er alle utfallene i like sannsynlige – som de seks sidene på en rettferdig terning – kan sannsynligheten telles direkte. Da er
den klassiske sannsynlighetsdefinisjonen. For hendelsen «minst fem» blir det . Legg merke til at den store her er sannsynligheten – ikke effekten eller styrken fra fysikk- og optikk-kapitlene, og ikke den lille som senere står for en andel.
Regneregler for sannsynligheter
Fire regler dekker nesten alt vi trenger, og de er alle enkle å begrunne.
Komplementregelen. Hendelsen «ikke », kalt komplementet , inntreffer nettopp når ikke gjør det. Siden det ene eller det andre alltid skjer,
Denne regelen er kortere vei enn den ser ut: mange «minst én»-spørsmål løses lettest ved å regne ut sannsynligheten for ingen og trekke fra .
Addisjonsregelen. For sannsynligheten for at eller inntreffer,
der det siste leddet trekkes fra for ikke å telle overlappet to ganger. Er hendelsene disjunkte (gjensidig utelukkende, kan ikke inntreffe samtidig), er overlappet tomt og leddet faller bort.
Multiplikasjonsregelen. For sannsynligheten for at og begge inntreffer,
der er sannsynligheten for gitt at har inntruffet – den betingede sannsynligheten vi kommer til om litt.
Uavhengighet. To hendelser er uavhengige når den ene ikke påvirker sannsynligheten for den andre. Da er , og multiplikasjonsregelen forenkles til
Uavhengighet er en forutsetning du må vurdere, ikke anta – to øyne på samme pasient er sjelden helt uavhengige, en tråd vi tar opp igjen i den avsluttende seksjonen.
Eksempel 13.4.1
Du trekker ett kort fra en godt stokket kortstokk med kort. Hva er sannsynligheten for å trekke et hjerterkort, og hva er sannsynligheten for ikke å trekke et hjerterkort?
Løsning: Vi bruker den klassiske definisjonen og komplementregelen direkte. Alle kortene er like sannsynlige, og av dem er hjerter, så
Komplementet følger av at det ene utelukker det andre:
De to tallene summerer til , slik komplementregelen krever.
Eksempel 13.4.2
Ved en netthinnescreening fotograferes begge øyne. Anta at hvert øye uavhengig av det andre har sannsynlighet for et gradbart funn. Finn sannsynligheten for at (a) begge øynene har funn, og (b) minst ett øye har funn.
Løsning: Vi kombinerer multiplikasjonsregelen for uavhengige hendelser med komplementregelen. For (a) multipliserer vi, siden øynene antas uavhengige:
For (b) er det raskeste å gå om komplementet. «Minst ett funn» er det motsatte av «ingen funn»; hvert øye er fritt for funn med sannsynlighet , så
Legg merke til at er nær, men ikke lik, den naive summen – differansen er nettopp overlappet fra addisjonsregelen. Antakelsen om uavhengige øyne er her en forenkling; deler øynene en systemisk årsak, er de positivt koblet, og blir større enn .
Betinget sannsynlighet og Bayes’ regel
Kjernen i all testtolkning er betinget sannsynlighet: sannsynligheten for én ting gitt at vi allerede vet noe annet. Den skrives – «sannsynligheten for gitt » – og defineres som
Å betinge på er å krympe utfallsrommet til bare de tilfellene der er sant, og så spørre hvor stor andel av dem som også har .
Rekkefølgen i betingelsen er ikke likegyldig – og det er nettopp her testtolkning går galt. og er to forskjellige tall, selv om de ser nesten like ut. Det første spør hvor ofte en syk person tester positivt; det andre hvor ofte en positiv test tilhører en syk person. Å forveksle dem er den vanligste feilen i klinisk statistikk, og vi skal se den koste dyrt.
Verktøyet som snur en betinget sannsynlighet fra den ene retningen til den andre, er Bayes’ regel:
Formelen er utledet fra definisjonen over, og vi oppgir den her heller enn å utlede den – poenget er hva den lar oss gjøre: gå fra det testen leverer, , til det pasienten spør om, .
Bayes’ regel skremmer på formen, men den samme regningen kan gjøres nesten uten formel ved å telle personer i en tenkt gruppe. Metoden – naturlige frekvenser – er å forestille seg en stor, konkret populasjon, for eksempel personer, og følge hvordan de fordeler seg først etter tilstand og så etter testresultat. I stedet for brøker og betingelser jobber du med hele mennesker, og det betingede spørsmålet blir til en enkel opptelling. Vi bruker den gjennomgående nedenfor.
Diagnostiske tester: sensitivitet, spesifisitet og prediktive verdier
En diagnostisk test stilles opp mot den sanne tilstanden i en -tabell. Hver person er enten syk eller frisk (kolonnene) og tester enten positivt eller negativt (radene), og havner dermed i én av fire celler:
-
•
sann positiv (SP): syk og tester positivt – korrekt fanget;
-
•
falsk positiv (FP): frisk, men tester positivt – falsk alarm;
-
•
falsk negativ (FN): syk, men tester negativt – oversett;
-
•
sann negativ (SN): frisk og tester negativt – korrekt klarert.
Fra disse fire tallene leses testens egenskaper på to måter, og det er avgjørende å holde retningene fra hverandre.
Nedover kolonnene – betinget på sykdomsstatus – ligger testens egne egenskaper. Sensitiviteten er andelen av de syke som testen fanger,
og spesifisiteten er andelen av de friske som testen klarerer,
Husk fra innledningen spørsmålet om hva det innebærer at en test har en «sensitivitet på »: det betyr at av hundre syke øyne slår testen ut på – verken mer eller mindre.
Bortover radene – betinget på testresultatet – ligger det pasienten faktisk lurer på. Den positive prediktive verdien er andelen av de positive som virkelig er syke,
og den negative prediktive verdien er andelen av de negative som virkelig er friske,
Sensitivitet og PPV er begge betingede sannsynligheter – men med byttet betingelse, akkurat de to retningene fra forrige underavsnitt. Det er PPV, ikke sensitiviteten, som svarer pasienten som nettopp testet positivt.
For å se hvor ulike de kan bli, følger vi et tilbakevendende eksempel gjennom resten av seksjonen.
Eksempel 13.4.3
Anta at en screeningtest for glaukom har sensitivitet og spesifisitet . Den brukes på en generell voksenbefolkning der prevalensen – andelen som faktisk har glaukom – settes til : et rundt tall valgt for regnestykket, og av samme størrelsesorden som de europeiske befolkningsstudier gir for aldersgruppen over 40 år [180, avsn. I.6.1]. En pasient tester positivt. Hvor sannsynlig er det at hun virkelig har glaukom?
Løsning: Vi bygger en tenkt populasjon på personer med naturlige frekvenser og teller. Med prevalens har personer glaukom, og de øvrige er friske. Blant de syke fanger testen (sanne positive, SP), mens overses (falske negative, FN). Blant de friske klarerer testen (sanne negative, SN), mens får falsk alarm (falske positive, FP). Positive tester finnes dermed i to grener – sanne og falske, til sammen – og bare de er virkelig syke, så
En positiv screeningtest betyr altså bare rundt sannsynlighet for glaukom – ikke , som sensitiviteten kunne forlede en til å tro.
Tallene forgrener seg som et tre, med hele personer i hver gren:
Treet gjør opptellingen synlig: de falske positive () er nesten tre ganger så mange som de sanne (), rett og slett fordi det er så mange flere friske enn syke å ta feil av. Det er nettopp derfor PPV lander på bare selv om testen fanger av de syke.
Den samme opptellingen kan settes i -tabellen, med testresultatet nedover og sann tilstand bortover:
| Glaukom | Frisk | Sum | |
|---|---|---|---|
| Test | (SP) | (FP) | |
| Test | (FN) | (SN) | |
| Sum |
Leser du nedover kolonnene, får du testens egenskaper: sensitivitet og spesifisitet – akkurat de vi startet med. Leser du bortover radene, får du de prediktive verdiene: PPV og NPV . Samme fire tall, to leseretninger, to helt forskjellige spørsmål.
I R er hele regningen én linje via Bayes-formelen, eller noen få linjer om du vil bygge de naturlige frekvensene selv.
R-kode
R-kode
Prevalensavhengighet: samme test, ulikt svar
Her ligger seksjonens viktigste innsikt. Sensitivitet og spesifisitet er egenskaper ved testen og endrer seg ikke når du flytter testen til en ny befolkning. De prediktive verdiene gjør det derimot – de avhenger sterkt av prevalensen, andelen syke i gruppen testen brukes på. Jo lavere prevalensen er, jo flere friske er det å ta feil av, og jo flere av de positive er falske. PPV synker; NPV stiger.
Skrevet med Bayes’ regel er sammenhengen
der er prevalensen. Bare endrer seg mellom to bruksområder for samme test; sensitivitet og spesifisitet står fast.
Eksempel 13.4.4
Den samme glaukomtesten (sensitivitet , spesifisitet ) brukes nå ikke til screening, men i en henvisningsklinikk der pasientene allerede er plukket ut på forhøyet trykk, alder og familiehistorie, slik at prevalensen er langt høyere, si . En pasient tester positivt. Hvor sannsynlig er glaukom nå – og hva forklarer forskjellen fra screeningtilfellet?
Løsning: Vi gjentar den naturlige-frekvens-tellingen med den nye prevalensen på personer. Nå har glaukom og er friske. Testen fanger sanne positive og gir falske positive, til sammen positive. Da er
Samme test, men PPV har hoppet fra ved screening til i klinikken – utelukkende fordi prevalensen steg fra til . Ved høy pretest-sannsynlighet er de syke i flertall blant de positive, så en positiv test veier tungt; ved lav prevalens drukner de sanne positive i falske alarmer. Det er derfor en positiv screeningtest i første rekke er et signal om å undersøke videre, mens det samme resultatet i en høyrisikoklinikk langt på vei er en diagnose.
R-kode
*Likelihood-ratio og ROC-kurven
Dette underavsnittet kan hoppes over ved første gjennomlesning; det samler noen begreper du vil møte igjen i litteraturen, på oversiktsnivå.
En likelihood-ratio oppsummerer en test i ett tall per resultat og har den fordelen at den, som sensitivitet og spesifisitet, er uavhengig av prevalensen. Den positive, , sier hvor mange ganger mer sannsynlig et positivt svar er hos syke enn hos friske; med våre tall . Den negative, , gjør det samme for et negativt svar. Jo større LR og jo mindre LR, jo mer flytter testen din tro om diagnosen.
De fleste kliniske tester bygger dessuten på en terskel for en kontinuerlig måling – en trykkgrense, en synsfeltindeks. Senker du terskelen, fanger du flere syke (sensitiviteten stiger), men flagger samtidig flere friske (spesifisiteten synker). Denne avveiningen er uunngåelig, og valget avhenger av hva som er verst: å overse en syk eller å skremme en frisk – en kobling til type I- og type II-feil som seksjonen om hypotesetesting tar opp. Tegner du sensitiviteten mot mens terskelen varieres over hele sitt spenn, får du en ROC-kurve. Arealet under den, forkortet AUC, måler hvor godt testen skiller syke fra friske: svarer til rene gjetninger, til en perfekt test.
Oppgaver
Oppgave 13.4.1
En diagnostisk test for en øyetilstand prøves på pasienter, der har tilstanden. Testen har sensitivitet og spesifisitet .
-
a)
Sett opp -tabellen med antall sanne positive, falske positive, sanne negative og falske negative.
-
b)
Regn ut den positive og den negative prediktive verdien.
-
c)
Hvor mange av dem som tester positivt, har faktisk tilstanden?
Løsningsforslag
Oppgave 13.4.1: Av de pasientene har tilstanden og er friske.
-
a)
Sensitiviteten fanger sanne positive, så overses (FN); spesifisiteten klarerer sanne negative, så får falsk alarm (FP).
Syk Frisk Sum Test (SP) (FP) Test (FN) (SN) Sum Radsummene stemmer med totalen.
-
b)
Bortover radene:
Kontroll med Bayes’ regel: – samme svar.
-
c)
Av de som tester positivt, har 90 faktisk tilstanden – altså , i samsvar med PPV fra b).
Oppgave 13.4.2
Ved en netthinnescreening fotograferes begge øyne. Anta at hvert øye uavhengig har sannsynlighet for et gradbart funn.
-
a)
Hva er sannsynligheten for at begge øynene har funn?
-
b)
Hva er sannsynligheten for at minst ett øye har funn?
-
c)
Er antakelsen om at de to øynene er uavhengige, realistisk? Gi ett argument.
Løsningsforslag
Oppgave 13.4.2: Hvert øye har uavhengig sannsynlighet for funn.
-
a)
Multiplikasjonsregelen for uavhengige hendelser gir
-
b)
Komplementet til «minst ett funn» er «ingen funn», og hvert øye er fritt for funn med sannsynlighet :
Kontroll med addisjonsregelen: – samme svar.
-
c)
Nei, neppe. To øyne deler samme pasient: en systemisk årsak – for eksempel diabetes – rammer gjerne begge øyne, så et funn på ett øye øker sannsynligheten for funn på det andre. Øynene er da positivt koblet, og blir større enn de uavhengighetsantakelsen ga.
Oppgave 13.4.3
Bruk testen fra oppgave 1 (sensitivitet , spesifisitet ).
-
a)
Beregn PPV når testen brukes til screening i en befolkning der prevalensen er .
-
b)
Beregn PPV når den samme testen brukes i en henvisningsklinikk der prevalensen er .
-
c)
Forklar, uten å gjenta regningen, hvorfor PPV endrer seg så mye når testen er den samme.
Løsningsforslag
Oppgave 13.4.3: Testen har sensitivitet og spesifisitet ; vi teller naturlige frekvenser i en tenkt populasjon på .
-
a)
Med prevalens er syke og friske. Testen fanger sanne positive og gir falske positive, til sammen positive:
Kontroll med Bayes-formelen: – samme svar.
-
b)
Med er syke og friske; sanne positive og falske positive gir
-
c)
Sensitivitet og spesifisitet er egenskaper ved testen og står fast; PPV beskriver testen i en bestemt befolkning og avhenger av prevalensen. Ved prevalens er det så mange flere friske enn syke at de falske positive drukner de sanne; ved er de syke i flertall blant de positive, og et positivt svar veier tungt.
Oppgave 13.4.4
En annonse påstår: «Testen vår er nøyaktig, så hvis du tester positivt, er du med sannsynlighet syk.» Testen har både sensitivitet og spesifisitet , og tilstanden har prevalens .
-
a)
Regn ut den faktiske positive prediktive verdien ved hjelp av en tenkt populasjon på .
-
b)
Vurder påstanden. Hvor stor er egentlig sannsynligheten for sykdom ved en positiv test, og hva er feilen i resonnementet?
Løsningsforslag
Oppgave 13.4.4: Testen har sensitivitet og spesifisitet , og prevalensen er .
-
a)
I en tenkt populasjon på har tilstanden og er friske. Testen fanger sanne positive og gir falske positive, til sammen positive:
Kontroll med Bayes-formelen: – samme svar.
-
b)
Påstanden er feil. Sannsynligheten for sykdom ved en positiv test er rundt , ikke . Feilen er å forveksle de to retningene i betingelsen: er – sensitiviteten – mens pasienten spør om , altså PPV. Annonsen ignorerer prevalensen: med bare syke er de falske positive () langt flere enn de sanne (), så de fleste positive svar er falske alarmer.