Hopp til innholdet

Kapittel 13 · Statistikk · 13.4

Sannsynlighet og diagnostiske tester

En diagnostisk test svarer sjelden med et rent ja eller nei – den gir et signal som noen ganger stemmer og noen ganger bommer. Spørsmålet du egentlig vil ha svar på når en test slår ut, er ikke «hvor god er testen i seg selv?», men det mer nærgående: hva betyr dette resultatet for pasienten foran meg? Svaret er en sannsynlighet, og det viser seg å avhenge like mye av hvor vanlig tilstanden er som av testens egenskaper. For å komme dit må vi først bygge selve sannsynlighetsbegrepet, og deretter la det gjøre arbeidet i tolkningen av tester. Dette er også der sannsynlighet kommer inn som forutsetning for resten av kapittelet: fordelingene, konfidensintervallene og hypotesetestene som følger, hviler alle på det vi legger her.

Utfallsrom, hendelse og sannsynlighet

Et tilfeldig forsøk er en handling med et utfall vi ikke kan forutsi sikkert – et terningkast, et myntkast, eller trekningen av hvilken pasient som blir den neste inn døra. Mengden av alle mulige utfall kaller vi utfallsrommet, og skriver det S. For ett terningkast er S={1,2,3,4,5,6}. En hendelse er en delmengde av utfallsrommet – et utvalg av utfall vi er interessert i. «Terningen viser minst fem» er hendelsen {5,6}.

Sannsynligheten for en hendelse A, skrevet P⁢(A), er et tall mellom 0 og 1 som måler hvor ofte A inntreffer i det lange løp: 0 betyr aldri, 1 betyr alltid, og 0.5 betyr i halvparten av tilfellene. Tre grunnkrav – aksiomer – fester begrepet:

  • •

    enhver sannsynlighet ligger mellom 0 og 1:  0≤P⁢(A)≤1;

  • •

    hele utfallsrommet er sikkert: P⁢(S)=1;

  • •

    en umulig hendelse har sannsynlighet null.

Er alle utfallene i S like sannsynlige – som de seks sidene på en rettferdig terning – kan sannsynligheten telles direkte. Da er

P⁢(A)=antall gunstige utfallantall mulige utfall,

den klassiske sannsynlighetsdefinisjonen. For hendelsen «minst fem» blir det P⁢({5,6})=2/6=1/3. Legg merke til at den store P⁢(⋅) her er sannsynligheten – ikke effekten eller styrken fra fysikk- og optikk-kapitlene, og ikke den lille p som senere står for en andel.

Regneregler for sannsynligheter

Fire regler dekker nesten alt vi trenger, og de er alle enkle å begrunne.

Komplementregelen. Hendelsen «ikke A», kalt komplementet Ac, inntreffer nettopp når A ikke gjør det. Siden det ene eller det andre alltid skjer,

P⁢(Ac)=1−P⁢(A).

Denne regelen er kortere vei enn den ser ut: mange «minst én»-spørsmål løses lettest ved å regne ut sannsynligheten for ingen og trekke fra 1.

Addisjonsregelen. For sannsynligheten for at A eller B inntreffer,

P⁢(A⁢ eller ⁢B)=P⁢(A)+P⁢(B)−P⁢(A⁢ og ⁢B),

der det siste leddet trekkes fra for ikke å telle overlappet to ganger. Er hendelsene disjunkte (gjensidig utelukkende, kan ikke inntreffe samtidig), er overlappet tomt og leddet faller bort.

Multiplikasjonsregelen. For sannsynligheten for at A og B begge inntreffer,

P⁢(A⁢ og ⁢B)=P⁢(A)⋅P⁢(B∣A),

der P⁢(B∣A) er sannsynligheten for B gitt at A har inntruffet – den betingede sannsynligheten vi kommer til om litt.

Uavhengighet. To hendelser er uavhengige når den ene ikke påvirker sannsynligheten for den andre. Da er P⁢(B∣A)=P⁢(B), og multiplikasjonsregelen forenkles til

P⁢(A⁢ og ⁢B)=P⁢(A)⋅P⁢(B).

Uavhengighet er en forutsetning du må vurdere, ikke anta – to øyne på samme pasient er sjelden helt uavhengige, en tråd vi tar opp igjen i den avsluttende seksjonen.

Eksempel 13.4.1

Du trekker ett kort fra en godt stokket kortstokk med 52 kort. Hva er sannsynligheten for å trekke et hjerterkort, og hva er sannsynligheten for ikke å trekke et hjerterkort?

Løsning: Vi bruker den klassiske definisjonen og komplementregelen direkte. Alle 52 kortene er like sannsynlige, og 13 av dem er hjerter, så

P⁢(hjerter)=1352=14=0.25.

Komplementet følger av at det ene utelukker det andre:

P⁢(ikke hjerter)=1−0.25=0.75.

De to tallene summerer til 1, slik komplementregelen krever.

Eksempel 13.4.2

Ved en netthinnescreening fotograferes begge øyne. Anta at hvert øye uavhengig av det andre har sannsynlighet 0.10 for et gradbart funn. Finn sannsynligheten for at (a) begge øynene har funn, og (b) minst ett øye har funn.

Løsning: Vi kombinerer multiplikasjonsregelen for uavhengige hendelser med komplementregelen. For (a) multipliserer vi, siden øynene antas uavhengige:

P⁢(begge)=0.10⋅0.10=0.01.

For (b) er det raskeste å gå om komplementet. «Minst ett funn» er det motsatte av «ingen funn»; hvert øye er fritt for funn med sannsynlighet 1−0.10=0.90, så

P⁢(minst ett)=1−P⁢(ingen)=1−0.902=1−0.81=0.19.

Legg merke til at P⁢(minst ett)=0.19 er nær, men ikke lik, den naive summen 0.10+0.10=0.20 – differansen er nettopp overlappet P⁢(begge)=0.01 fra addisjonsregelen. Antakelsen om uavhengige øyne er her en forenkling; deler øynene en systemisk årsak, er de positivt koblet, og P⁢(begge) blir større enn 0.01.

Betinget sannsynlighet og Bayes’ regel

Kjernen i all testtolkning er betinget sannsynlighet: sannsynligheten for én ting gitt at vi allerede vet noe annet. Den skrives P⁢(A∣B) – «sannsynligheten for A gitt B» – og defineres som

P⁢(A∣B)=P⁢(A⁢ og ⁢B)P⁢(B),P⁢(B)>0.

Å betinge på B er å krympe utfallsrommet til bare de tilfellene der B er sant, og så spørre hvor stor andel av dem som også har A.

Rekkefølgen i betingelsen er ikke likegyldig – og det er nettopp her testtolkning går galt. P⁢(test positiv∣syk) og P⁢(syk∣test positiv) er to forskjellige tall, selv om de ser nesten like ut. Det første spør hvor ofte en syk person tester positivt; det andre hvor ofte en positiv test tilhører en syk person. Å forveksle dem er den vanligste feilen i klinisk statistikk, og vi skal se den koste dyrt.

Verktøyet som snur en betinget sannsynlighet fra den ene retningen til den andre, er Bayes’ regel:

P⁢(A∣B)=P⁢(B∣A)⋅P⁢(A)P⁢(B).

Formelen er utledet fra definisjonen over, og vi oppgir den her heller enn å utlede den – poenget er hva den lar oss gjøre: gå fra det testen leverer, P⁢(test∣tilstand), til det pasienten spør om, P⁢(tilstand∣test).

Bayes’ regel skremmer på formen, men den samme regningen kan gjøres nesten uten formel ved å telle personer i en tenkt gruppe. Metoden – naturlige frekvenser – er å forestille seg en stor, konkret populasjon, for eksempel 10 000 personer, og følge hvordan de fordeler seg først etter tilstand og så etter testresultat. I stedet for brøker og betingelser jobber du med hele mennesker, og det betingede spørsmålet blir til en enkel opptelling. Vi bruker den gjennomgående nedenfor.

Diagnostiske tester: sensitivitet, spesifisitet og prediktive verdier

En diagnostisk test stilles opp mot den sanne tilstanden i en 2×2-tabell. Hver person er enten syk eller frisk (kolonnene) og tester enten positivt eller negativt (radene), og havner dermed i én av fire celler:

  • •

    sann positiv (SP): syk og tester positivt – korrekt fanget;

  • •

    falsk positiv (FP): frisk, men tester positivt – falsk alarm;

  • •

    falsk negativ (FN): syk, men tester negativt – oversett;

  • •

    sann negativ (SN): frisk og tester negativt – korrekt klarert.

Fra disse fire tallene leses testens egenskaper på to måter, og det er avgjørende å holde retningene fra hverandre.

Nedover kolonnene – betinget på sykdomsstatus – ligger testens egne egenskaper. Sensitiviteten er andelen av de syke som testen fanger,

sensitivitet=SPSP+FN=P(test+∣syk),

og spesifisiteten er andelen av de friske som testen klarerer,

spesifisitet=SNSN+FP=P(test−∣frisk).

Husk fra innledningen spørsmålet om hva det innebærer at en test har en «sensitivitet på 85 %»: det betyr at av hundre syke øyne slår testen ut på 85 – verken mer eller mindre.

Bortover radene – betinget på testresultatet – ligger det pasienten faktisk lurer på. Den positive prediktive verdien er andelen av de positive som virkelig er syke,

PPV=SPSP+FP=P⁢(syk∣test+),

og den negative prediktive verdien er andelen av de negative som virkelig er friske,

NPV=SNSN+FN=P⁢(frisk∣test−).

Sensitivitet og PPV er begge betingede sannsynligheter – men med byttet betingelse, akkurat de to retningene fra forrige underavsnitt. Det er PPV, ikke sensitiviteten, som svarer pasienten som nettopp testet positivt.

For å se hvor ulike de kan bli, følger vi et tilbakevendende eksempel gjennom resten av seksjonen.

Eksempel 13.4.3

Anta at en screeningtest for glaukom har sensitivitet 85 % og spesifisitet 95 %. Den brukes på en generell voksenbefolkning der prevalensen – andelen som faktisk har glaukom – settes til 2 %: et rundt tall valgt for regnestykket, og av samme størrelsesorden som de 2.99 % europeiske befolkningsstudier gir for aldersgruppen over 40 år [180, avsn. I.6.1]. En pasient tester positivt. Hvor sannsynlig er det at hun virkelig har glaukom?

Løsning: Vi bygger en tenkt populasjon på 10 000 personer med naturlige frekvenser og teller. Med prevalens p=0.02 har 0.02⋅10 000=200 personer glaukom, og de øvrige 9800 er friske. Blant de 200 syke fanger testen 0.85⋅200=170 (sanne positive, SP), mens 30 overses (falske negative, FN). Blant de 9800 friske klarerer testen 0.95⋅9800=9310 (sanne negative, SN), mens 0.05⋅9800=490 får falsk alarm (falske positive, FP). Positive tester finnes dermed i to grener – 170 sanne og 490 falske, til sammen 660 – og bare de 170 er virkelig syke, så

PPV=170660≈0.258≈25.8 %.

En positiv screeningtest betyr altså bare rundt 26 % sannsynlighet for glaukom – ikke 85 %, som sensitiviteten kunne forlede en til å tro.

Tallene forgrener seg som et tre, med hele personer i hver gren:

Frekvenstre for screeningeksempelet, med hele personer i hver gren i stedet for sannsynligheter.
Figur 13.5: Frekvenstre for screeningeksempelet, med hele personer i hver gren i stedet for sannsynligheter.

Treet gjør opptellingen synlig: de falske positive (490) er nesten tre ganger så mange som de sanne (170), rett og slett fordi det er så mange flere friske enn syke å ta feil av. Det er nettopp derfor PPV lander på bare 25.8 % selv om testen fanger 85 % av de syke.

Den samme opptellingen kan settes i 2×2-tabellen, med testresultatet nedover og sann tilstand bortover:

Glaukom Frisk Sum
Test + 170 (SP) 490 (FP) 660
Test − 30 (FN) 9310 (SN) 9340
Sum 200 9800 10 000

Leser du nedover kolonnene, får du testens egenskaper: sensitivitet 170/200=0.85 og spesifisitet 9310/9800=0.95 – akkurat de vi startet med. Leser du bortover radene, får du de prediktive verdiene: PPV 170/660≈0.258 og NPV 9310/9340≈0.997. Samme fire tall, to leseretninger, to helt forskjellige spørsmål.

I R er hele regningen én linje via Bayes-formelen, eller noen få linjer om du vil bygge de naturlige frekvensene selv.

R-kode

# PPV fra prevalens via Bayes (glaukom-screeningen)
sens <- 0.85 # sensitivitet
spec <- 0.95 # spesifisitet
prev <- 0.02 # prevalens ved screening
ppv <- sens*prev / (sens*prev + (1 - spec)*(1 - prev))
ppv
#> [1] 0.2575758

R-kode

# Naturlige frekvenser: bygg 2x2 i en tenkt populasjon paa N = 10000
N <- 10000
syk <- prev * N # 200
frisk <- N - syk # 9800
SP <- sens*syk; FN <- syk - SP # 170, 30
FP <- (1 - spec)*frisk; SN <- frisk - FP # 490, 9310
SP / (SP + FP) # PPV
#> [1] 0.2575758
SN / (SN + FN) # NPV
#> [1] 0.9967880

Prevalensavhengighet: samme test, ulikt svar

Her ligger seksjonens viktigste innsikt. Sensitivitet og spesifisitet er egenskaper ved testen og endrer seg ikke når du flytter testen til en ny befolkning. De prediktive verdiene gjør det derimot – de avhenger sterkt av prevalensen, andelen syke i gruppen testen brukes på. Jo lavere prevalensen er, jo flere friske er det å ta feil av, og jo flere av de positive er falske. PPV synker; NPV stiger.

Skrevet med Bayes’ regel er sammenhengen

PPV=sens⋅psens⋅p+(1−spes)⋅(1−p),

der p er prevalensen. Bare p endrer seg mellom to bruksområder for samme test; sensitivitet og spesifisitet står fast.

Eksempel 13.4.4

Den samme glaukomtesten (sensitivitet 85 %, spesifisitet 95 %) brukes nå ikke til screening, men i en henvisningsklinikk der pasientene allerede er plukket ut på forhøyet trykk, alder og familiehistorie, slik at prevalensen er langt høyere, si 30 %. En pasient tester positivt. Hvor sannsynlig er glaukom nå – og hva forklarer forskjellen fra screeningtilfellet?

Løsning: Vi gjentar den naturlige-frekvens-tellingen med den nye prevalensen p=0.30 på 10 000 personer. Nå har 0.30⋅10 000=3000 glaukom og 7000 er friske. Testen fanger 0.85⋅3000=2550 sanne positive og gir 0.05⋅7000=350 falske positive, til sammen 2900 positive. Da er

PPV=25502900≈0.879≈87.9 %.

Samme test, men PPV har hoppet fra 25.8 % ved screening til 87.9 % i klinikken – utelukkende fordi prevalensen steg fra 2 % til 30 %. Ved høy pretest-sannsynlighet er de syke i flertall blant de positive, så en positiv test veier tungt; ved lav prevalens drukner de sanne positive i falske alarmer. Det er derfor en positiv screeningtest i første rekke er et signal om å undersøke videre, mens det samme resultatet i en høyrisikoklinikk langt på vei er en diagnose.

R-kode

# Samme test, tre prevalenser -- se PPV foelge prevalensen
prev <- c(0.02, 0.10, 0.30)
ppv <- sens*prev / (sens*prev + (1 - spec)*(1 - prev))
round(ppv, 3)
#> [1] 0.258 0.654 0.879

*Likelihood-ratio og ROC-kurven

Dette underavsnittet kan hoppes over ved første gjennomlesning; det samler noen begreper du vil møte igjen i litteraturen, på oversiktsnivå.

En likelihood-ratio oppsummerer en test i ett tall per resultat og har den fordelen at den, som sensitivitet og spesifisitet, er uavhengig av prevalensen. Den positive, LR+=sens/(1−spes), sier hvor mange ganger mer sannsynlig et positivt svar er hos syke enn hos friske; med våre tall LR+=0.85/0.05=17.0. Den negative, LR−=(1−sens)/spes=0.15/0.95≈0.16, gjør det samme for et negativt svar. Jo større LR+ og jo mindre LR−, jo mer flytter testen din tro om diagnosen.

De fleste kliniske tester bygger dessuten på en terskel for en kontinuerlig måling – en trykkgrense, en synsfeltindeks. Senker du terskelen, fanger du flere syke (sensitiviteten stiger), men flagger samtidig flere friske (spesifisiteten synker). Denne avveiningen er uunngåelig, og valget avhenger av hva som er verst: å overse en syk eller å skremme en frisk – en kobling til type I- og type II-feil som seksjonen om hypotesetesting tar opp. Tegner du sensitiviteten mot 1−spesifisitet mens terskelen varieres over hele sitt spenn, får du en ROC-kurve. Arealet under den, forkortet AUC, måler hvor godt testen skiller syke fra friske: 0.5 svarer til rene gjetninger, 1.0 til en perfekt test.

Oppgaver

Oppgave 13.4.1

En diagnostisk test for en øyetilstand prøves på 1000 pasienter, der 100 har tilstanden. Testen har sensitivitet 90 % og spesifisitet 85 %.

  1. a)

    Sett opp 2×2-tabellen med antall sanne positive, falske positive, sanne negative og falske negative.

  2. b)

    Regn ut den positive og den negative prediktive verdien.

  3. c)

    Hvor mange av dem som tester positivt, har faktisk tilstanden?

Løsningsforslag

Oppgave 13.4.1: Av de 1000 pasientene har 100 tilstanden og 900 er friske.

  1. a)

    Sensitiviteten 0.90 fanger 0.90⋅100=90 sanne positive, så 10 overses (FN); spesifisiteten 0.85 klarerer 0.85⋅900=765 sanne negative, så 135 får falsk alarm (FP).

    Syk Frisk Sum
    Test + 90 (SP) 135 (FP) 225
    Test − 10 (FN) 765 (SN) 775
    Sum 100 900 1000

    Radsummene 225+775=1000 stemmer med totalen.

  2. b)

    Bortover radene:

    PPV=9090+135=90225=0.40=40 %,NPV=765765+10=765775≈0.987≈98.7 %.

    Kontroll med Bayes’ regel: PPV=0.90⋅0.10/(0.90⋅0.10+0.15⋅0.90)=0.09/0.225=0.40 – samme svar.

  3. c)

    Av de 225 som tester positivt, har 90 faktisk tilstanden – altså 40 %, i samsvar med PPV fra b).

Oppgave 13.4.2

Ved en netthinnescreening fotograferes begge øyne. Anta at hvert øye uavhengig har sannsynlighet 0.08 for et gradbart funn.

  1. a)

    Hva er sannsynligheten for at begge øynene har funn?

  2. b)

    Hva er sannsynligheten for at minst ett øye har funn?

  3. c)

    Er antakelsen om at de to øynene er uavhengige, realistisk? Gi ett argument.

Løsningsforslag

Oppgave 13.4.2: Hvert øye har uavhengig sannsynlighet 0.08 for funn.

  1. a)

    Multiplikasjonsregelen for uavhengige hendelser gir

    P⁢(begge)=0.08⋅0.08=0.0064.
  2. b)

    Komplementet til «minst ett funn» er «ingen funn», og hvert øye er fritt for funn med sannsynlighet 1−0.08=0.92:

    P⁢(minst ett)=1−0.922=1−0.8464=0.1536.

    Kontroll med addisjonsregelen: 0.08+0.08−0.0064=0.1536 – samme svar.

  3. c)

    Nei, neppe. To øyne deler samme pasient: en systemisk årsak – for eksempel diabetes – rammer gjerne begge øyne, så et funn på ett øye øker sannsynligheten for funn på det andre. Øynene er da positivt koblet, og P⁢(begge) blir større enn de 0.0064 uavhengighetsantakelsen ga.

Oppgave 13.4.3

Bruk testen fra oppgave 1 (sensitivitet 90 %, spesifisitet 85 %).

  1. a)

    Beregn PPV når testen brukes til screening i en befolkning der prevalensen er 2 %.

  2. b)

    Beregn PPV når den samme testen brukes i en henvisningsklinikk der prevalensen er 40 %.

  3. c)

    Forklar, uten å gjenta regningen, hvorfor PPV endrer seg så mye når testen er den samme.

Løsningsforslag

Oppgave 13.4.3: Testen har sensitivitet 0.90 og spesifisitet 0.85; vi teller naturlige frekvenser i en tenkt populasjon på 10 000.

  1. a)

    Med prevalens p=0.02 er 200 syke og 9800 friske. Testen fanger 0.90⋅200=180 sanne positive og gir 0.15⋅9800=1470 falske positive, til sammen 1650 positive:

    PPV=1801650≈0.109≈10.9 %.

    Kontroll med Bayes-formelen: 0.90⋅0.02/(0.90⋅0.02+0.15⋅0.98)=0.018/0.165≈0.109 – samme svar.

  2. b)

    Med p=0.40 er 4000 syke og 6000 friske; 0.90⋅4000=3600 sanne positive og 0.15⋅6000=900 falske positive gir

    PPV=36004500=0.80=80 %.
  3. c)

    Sensitivitet og spesifisitet er egenskaper ved testen og står fast; PPV beskriver testen i en bestemt befolkning og avhenger av prevalensen. Ved 2 % prevalens er det så mange flere friske enn syke at de falske positive drukner de sanne; ved 40 % er de syke i flertall blant de positive, og et positivt svar veier tungt.

Oppgave 13.4.4

En annonse påstår: «Testen vår er 95 % nøyaktig, så hvis du tester positivt, er du med 95 % sannsynlighet syk.» Testen har både sensitivitet 95 % og spesifisitet 95 %, og tilstanden har prevalens 1 %.

  1. a)

    Regn ut den faktiske positive prediktive verdien ved hjelp av en tenkt populasjon på 10 000.

  2. b)

    Vurder påstanden. Hvor stor er egentlig sannsynligheten for sykdom ved en positiv test, og hva er feilen i resonnementet?

Løsningsforslag

Oppgave 13.4.4: Testen har sensitivitet og spesifisitet 95 %, og prevalensen er 1 %.

  1. a)

    I en tenkt populasjon på 10 000 har 0.01⋅10 000=100 tilstanden og 9900 er friske. Testen fanger 0.95⋅100=95 sanne positive og gir 0.05⋅9900=495 falske positive, til sammen 590 positive:

    PPV=95590≈0.161≈16.1 %.

    Kontroll med Bayes-formelen: 0.95⋅0.01/(0.95⋅0.01+0.05⋅0.99)=0.0095/0.059≈0.161 – samme svar.

  2. b)

    Påstanden er feil. Sannsynligheten for sykdom ved en positiv test er rundt 16 %, ikke 95 %. Feilen er å forveksle de to retningene i betingelsen: 95 % er P(test+∣syk) – sensitiviteten – mens pasienten spør om P⁢(syk∣test+), altså PPV. Annonsen ignorerer prevalensen: med bare 1 % syke er de falske positive (495) langt flere enn de sanne (95), så de fleste positive svar er falske alarmer.

Alle løsningsforslag til kapittel 13