Kapittel 13 · Statistikk · 13.5
Sannsynlighetsfordelinger og normalfordelingen
Forrige seksjon bygde sannsynlighet for enkelthendelser – et positivt testsvar, et funn på ett øye. Men klinikken måler oftest tall: et trykk, en aksiallengde, en synsstyrke, som varierer fra øye til øye på en måte vi vil kunne resonnere om samlet. Spørsmålet som styrer denne seksjonen, er derfor: hvordan beskriver vi sannsynligheten for hele mønsteret av verdier en slik målestørrelse kan ta – ikke bare for én enkelt hendelse? Svaret er en sannsynlighetsfordeling, og den ene fordelingen alt annet hviler på, er normalfordelingen. Vi bygger opp til den i tur: først det som varierer, så to måter å feste sannsynlighet på det, deretter selve klokkekurven, og til slutt hvorfor den dukker opp nesten overalt så snart vi tar gjennomsnitt.
Stokastisk variabel: diskret og kontinuerlig
En stokastisk variabel (eller tilfeldig variabel) er en tallverdi knyttet til utfallet av et tilfeldig forsøk. Vi skriver den med stor bokstav, oftest , og en konkret observert verdi med liten, . Antall øyne med et funn i en gruppe, det avleste trykket på neste pasient, aksiallengden til et tilfeldig trukket øye – alt dette er stokastiske variabler: før forsøket vet vi ikke hvilken verdi tar, bare hvor sannsynlige de ulike verdiene er. Dette er motstykket til de deterministiske størrelsene fra kapitlets første seksjon: linseformelen gir samme bildeavstand hver gang, mens en stokastisk variabel spriker.
Stokastiske variabler deler seg i to slag, akkurat som variabeltypene fra første seksjon. En diskret variabel teller og kan bare ta atskilte verdier – antall positive tester, antall fargesvake i en klasse, antall bokstaver lest. En kontinuerlig variabel måler og kan i prinsippet ta en hvilken som helst verdi i et intervall – trykk, aksiallengde, LogMAR-synsstyrke. Skillet er ikke pedantisk: det avgjør hvordan vi i det hele tatt kan feste sannsynlighet på variabelen.
Punktsannsynlighet og tetthet: sannsynlighet som areal
For en diskret variabel er det enkelt. Hver mulige verdi har en punktsannsynlighet – sjansen for akkurat den verdien. Tegner vi punktsannsynlighetene som et stolpediagram, får vi hele fordelingen, og fordi må ta en av verdiene, summerer stolpene til :
For en kontinuerlig variabel bryter dette sammen. Fordi verdiene ligger tett i et helt intervall, er det uendelig mange av dem, og sannsynligheten for å treffe nøyaktig én bestemt verdi er null: for ethvert enkeltpunkt. Et trykk er aldri eksakt ut i det uendelige antall desimaler. Sannsynlighet gir bare mening for intervaller – «mellom og », «over ». I stedet for punktsannsynligheter beskrives en kontinuerlig variabel av en tetthetsfunksjon , og sannsynligheten for et intervall er arealet under tetthetskurven over det intervallet:
Husk fra kapittelet om kalkulus at det bestemte integralet nettopp er arealet under kurven mellom og . Her får det integralet en direkte statistisk mening: arealet under en tetthet er en sannsynlighet.
To krav gjør en funksjon til en gyldig tetthet, og begge speiler krav vi allerede kjenner for sannsynlighet. Tettheten kan aldri være negativ, overalt (en sannsynlighet kan ikke være under null); og det samlede arealet under hele kurven må være (variabelen tar med sikkerhet en verdi):
Før vi møter en tetthet uten enkel formel, er det verdt å se én der arealet kan regnes med ren geometri. Betrakt den enkle tettheten for , og ellers. Kurven er en rett linje fra opp til :
Det samlede arealet er en trekant med grunnlinje og høyde , altså – kravet er oppfylt, og dette er en gyldig tetthet. Sannsynligheten er arealet av den skraverte trekanten med grunnlinje og høyde , altså . Ingen integraltabell trengs; her holder trekantformelen.
Eksempel 13.5.1
For tettheten på (og ellers), finn .
Løsning: Vi regner arealet under linja mellom og . Området er et trapes med de to parallelle sidene og og bredde :
Halvparten av sannsynligheten ligger altså i den midtre halvdelen av området – et areal regnet uten en eneste integrasjonsregel, fordi tettheten er rettlinjet.
Binomialfordelingen: telledata og andeler
Den viktigste diskrete fordelingen i klinikken teller hvor mange av som har en egenskap. Gjør du uavhengige forsøk som hvert lykkes med samme sannsynlighet – øyne som hvert med sannsynlighet har et funn, personer som hver med sannsynlighet er fargesvake – følger antallet suksesser en binomialfordeling, skrevet . Her er den lille en andel (suksessandelen), ikke en p-verdi; sammenhengen avgjør, som kapittelboksen varslet.
Punktsannsynligheten for nøyaktig suksesser er
der binomialkoeffisienten – « over » – teller hvor mange måter suksesser kan fordele seg på forsøk, faktoren er sannsynligheten for at disse lykkes, og at de øvrige mislykkes. To størrelser oppsummerer fordelingen. Forventningen – det gjennomsnittlige antallet suksesser i det lange løp – og variansen er
og standardavviket er . Formlene oppgis her; forventningen er intuitiv (lykkes hvert forsøk med sannsynlighet , blir det typisk av ), og variansuttrykket motiveres av at spredningen er størst når er nær og krymper mot begge ytterkantene.
Rød-grønn fargesynssvakhet forekommer hos om lag av menn i europeiske materialer, og hos under av kvinner [170, tab. 1.6, s. 30] – det samme tallet som kapittelet om øyets fysikk og anatomi regner på. Screener du en gruppe på menn, følger antallet fargesvake , med forventning . Stolpediagrammet under viser hele fordelingen – diskret, med atskilte stolper, i motsetning til den sammenhengende tetthetskurven vi straks møter:
Eksempel 13.5.2
Et optikerkontor screener en gruppe på menn for rød-grønn fargesynssvakhet, som forekommer hos av menn. La være antallet med svakhet. (a) Hvilken fordeling har , og hva er forventet antall? (b) Finn . (c) Finn sannsynligheten for at minst én er fargesvak. (d) Finn .
Løsning: Vi kjenner igjen et fast antall uavhengige forsøk med samme suksessandel, så modellen er binomial. For (a): , med forventning og standardavvik . For (b) setter vi i punktsannsynligheten; da faller binomialkoeffisienten og bort:
For (c) er «minst én» komplementet til «ingen» – komplementregelen fra forrige seksjon er kortere vei enn å summere :
For (d) setter vi :
Kort oppsummert: ; , , . At det er mer sannsynlig å finne minst én fargesvak enn ikke, følger direkte av at det forventede antallet er – selv om den enkelte har lav sannsynlighet, blir det fort minst én i en gruppe på .
R-kode
Normalfordelingen og 68–95–99.7-regelen
Den klart viktigste kontinuerlige fordelingen er normalfordelingen, også kalt Gauss-fordelingen etter dens opphavsmann. Noen kliniske størrelser er selv tilnærmet normalfordelte – de europeiske glaukomretningslinjene oppgir hornhinnens sentraltykkelse målt med ultralyd som en normalfordeling med gjennomsnitt om lag og standardavvik om lag [180, avsn. II.1.1.2] – og nesten ethvert gjennomsnitt er det, uansett hvilken fordeling tallene kommer fra. Tettheten er den velkjente symmetriske klokkekurven, bestemt fullt ut av to tall: gjennomsnittet , som ligger under toppen og fastsetter hvor kurven er sentrert, og standardavviket , som fastsetter hvor bred den er. Et større gir en lavere, bredere klokke; et mindre en høyere, smalere.
Vi oppgir tetthetens formel og utleder den ikke – utledningen hører ikke hjemme her, og selve funksjonsformen skal du ikke lære utenat:
Ett trekk ved kurven er verdt å nevne med det samme, for det får en praktisk følge. I motsetning til tettheten over, har denne funksjonen ingen elementær antiderivert – det finnes ingen lukket formel, bygget av de vanlige funksjonene, for arealet under den. Sannsynligheten finnes derfor ikke ved å regne ut et antiderivert uttrykk, slik kalkulus-kapittelet ellers lærte; den må slås opp i en tabell eller hentes fra programvare. Det er en ærlig begrensning, ikke en forglemmelse, og den forklarer hvorfor statistikk lener seg på tabeller og på R der andre emner klarer seg med en formel.
Selv om det eksakte arealet krever oppslag, kan mønsteret huskes med tre tall. Uansett hva og er, ligger en fast andel av fordelingen innenfor et gitt antall standardavvik fra midten – 68–95–99.7-regelen:
-
•
om lag () ligger innenfor ;
-
•
om lag () ligger innenfor ;
-
•
om lag () ligger innenfor .
Denne regelen alene løser mange kliniske overslag uten et eneste tabelloppslag, så lenge grensene faller på hele antall standardavvik fra .
-standardisering
For grenser som ikke lander på et helt antall standardavvik, trenger vi tabellen – og for å slippe én tabell per tenkelig og , gjør vi et lite grep som slår alle normalfordelinger sammen til én. Vi teller hvor mange standardavvik en verdi ligger fra midten. Det tallet kalles en -verdi (eller standardisert verdi):
En på betyr «to standardavvik over gjennomsnittet», uansett hva størrelsen måler eller hvilke enheter den har. Denne operasjonen – standardisering – gjør en verdi enhetsløs og sammenlignbar på tvers av fordelinger.
Etter standardisering følger standardnormalfordelingen: normalfordelingen med og . Dens tetthet, , har sin topp ved med verdien , og alle sannsynligheter for en hvilken som helst normalfordeling kan leses av denne ene kurven når verdiene først er gjort om til -verdier. Sannsynligheten – arealet til venstre for – er tabellert (og er av standardtettheten). Fra den følger de øvrige med komplement- og differanseregning: , og .
Noen -verdier er verdt å feste, for de kommer igjen i seksjonen om konfidensintervall. De skjærer av en gitt sentral andel (like mye i hver hale):
-
•
sentralt svarer til ;
-
•
sentralt svarer til ;
-
•
sentralt svarer til .
Merk at det er , ikke , som gir nøyaktig : arealet innenfor er , mens innenfor er det – nær hverandre, men ikke like, og tallet er det du vil se igjen i konfidensintervaller.
Eksempel 13.5.3
Anta at trykket (IOP) i en populasjon er normalfordelt med og – tall satt for regnestykket, ikke normtall fra en befolkningsstudie. (a) Standardiser verdien til en -verdi. (b) Hvor stor andel av øynene har trykk over ? (c) Hvor stor andel ligger mellom og ?
Løsning: Vi standardiserer hver grense til en -verdi og henter arealene fra standardnormaltabellen. For (a) teller vi standardavvik fra midten:
Verdien ligger altså akkurat to standardavvik over gjennomsnittet. For (b) slår vi opp og bruker komplementet:
altså om lag av øynene. (Dette er også nettopp den øvre halen utenfor , som 68–95–99.7-regelen anslår til .) For (c) standardiserer vi begge grensene:
og tar differansen av arealene. Med de avrundede tabellverdiene blir ; regner du i stedet med den uavrundede , gir programvaren . Andelene er ; ca. over ; ca. mellom og . De over er en påminnelse om at «forhøyet trykk» ikke er sjeldent i seg selv – det er derfor et enkelt trykktall er en svak glaukomtest, slik seksjonen om diagnostiske tester viste.
R-kode
Sentralgrenseteoremet og standardfeilen
Til slutt det som gjør normalfordelingen så gjennomgripende. Trykket til enkeltøyne trenger slett ikke være normalfordelt – det behandlede trykket i klinikkdatasettet var om lag symmetrisk, men mange kliniske størrelser har en hale mot høyre, slik det tenkte åttepasientsettet i seksjonen om deskriptiv statistikk hadde. Men tar du gjennomsnittet av mange målinger, retter fordelingen seg ut. Sentralgrenseteoremet sier at gjennomsnittet av uavhengige observasjoner er tilnærmet normalfordelt når er stort nok – uansett formen på fordelingen de trekkes fra – med senter i populasjonsgjennomsnittet og et standardavvik som krymper med . Dette er bemerkelsesverdig: skjevhet og pukler i enkeltdataene vaskes bort så snart vi midler, og klokkekurven dukker opp av seg selv.
Nettopp fordi gjennomsnittets fordeling er smalere enn enkeltverdienes, trenger vi et eget mål på hvor mye gjennomsnittet spriker. Husk fra seksjonen om måling og usikkerhet at dette er standardfeilen SEM, og at den avtar som :
Skillet er verdt å holde skarpt: standardavviket måler spredningen mellom enkeltindivider (hvor ulike to øyne er), mens SEM måler hvor presist gjennomsnittet anslår populasjonssnittet . SEM er alltid mindre enn , og fordi det er som står i nevneren, må du firedoble antallet målinger for å halvere den. Denne standardfeilen er selve motoren i neste seksjon: den setter bredden på konfidensintervallet for .
Teoremet lar seg ikke bevise her, men det lar seg se ved simulering. Trekker vi mange utvalg fra en sterkt høyreskjev fordeling, regner gjennomsnittet i hvert, og tegner et histogram av gjennomsnittene, blir det klokkeformet – og dets standardavvik nærmer seg den teoretiske SEM.
R-kode
Simuleringens mean og sd er omtrentlige og varierer med frøet; det eksakte tallet er den teoretiske standardfeilen , som simuleringen bekrefter. Poenget er formen: gjennomsnittene fordeler seg tilnærmet normalt selv når enkeltverdiene ikke gjør det.
Eksempel 13.5.4
En optiker måler trykket på pasienter og finner standardavvik . (a) Regn ut standardfeilen til gjennomsnittet. (b) Forklar med egne ord hva og SEM hver især beskriver. (c) Optikeren vil halvere SEM. Hvor mange pasienter må hun da måle, og hvorfor er svaret ikke ?
Løsning: Vi bruker og -loven fra seksjonen om måling og usikkerhet. For (a):
For (b): beskriver spredningen mellom enkeltpasienters trykk – hvor ulike to tilfeldige pasienter er. SEM beskriver hvor presist gjennomsnittet av de anslår det sanne populasjonssnittet ; den er mindre nettopp fordi å midle jevner ut den tilfeldige variasjonen. For (c): fordi SEM , halverer man den ved å firedoble , ikke ved å doble det. Med blir , akkurat halvparten. Å bare doble til gir – langt fra en halvering. Svaret er ; halvering krever , ikke . Det er den samme -loven som forklarer hvorfor gjentatte målinger gir stadig mindre gevinst: de første gjentakene monner mye, de siste nesten ingenting.
Oppgaver
Oppgave 13.5.1
Anta at trykket i en populasjon er normalfordelt med og – de samme stipulerte tallene som i seksjonens eksempel.
-
a)
Bruk 68–95–99.7-regelen (uten tabell) til å anslå hvor stor andel som har trykk mellom og .
-
b)
Standardiser verdien til en -verdi.
-
c)
Bruk 68–95–99.7-regelen til å anslå andelen med trykk under .
Løsningsforslag
Oppgave 13.5.1:
-
a)
Grensene er og , så intervallet er nøyaktig . Regelen gir da ca. av øynene.
-
b)
.
-
c)
Verdien ligger nøyaktig to standardavvik under gjennomsnittet. Utenfor ligger av fordelingen, og halvparten av dette er i nedre hale: , altså ca. .
Oppgave 13.5.2
Rød-grønn fargesynssvakhet finnes hos ca. av menn. En klasse har mannlige studenter. La være antallet med svakhet.
-
a)
Hvilken fordeling har , og hva er det forventede antallet?
-
b)
Regn ut .
-
c)
Regn ut sannsynligheten for at minst én student er fargesvak.
Løsningsforslag
Oppgave 13.5.2:
-
a)
Et fast antall uavhengige forsøk med samme suksessandel gir en binomialmodell: , med .
-
b)
Med faller binomialkoeffisienten og bort:
-
c)
«Minst én» er komplementet til «ingen»:
Oppgave 13.5.3
En optiker måler aksiallengden på øyne og finner standardavvik .
-
a)
Regn ut standardfeilen til gjennomsnittet.
-
b)
Forklar forskjellen på hva og SEM beskriver i denne situasjonen.
-
c)
Hun ønsker en standardfeil på . Hvor mange øyne må hun da måle? Forklar hvorfor svaret ikke er .
Løsningsforslag
Oppgave 13.5.3:
-
a)
-
b)
beskriver spredningen mellom enkeltøynes aksiallengder – hvor ulike to tilfeldige øyne er. SEM beskriver hvor presist gjennomsnittet av de målingene anslår populasjonssnittet ; den er mindre fordi midling jevner ut tilfeldig variasjon.
-
c)
Kravet gir , altså øyne. Fordi SEM , krever en halvering (fra til ) en firedobling av , ikke en dobling: med blir , langt fra kravet, mens treffer nøyaktig.
Oppgave 13.5.4
En kollega hevder: «Siden enkeltmålinger av trykk er høyreskjeve og ikke normalfordelte, kan vi ikke bruke normalfordelingen på gjennomsnittet av trykkmålinger heller.»
-
a)
Vurder påstanden i lys av sentralgrenseteoremet. Har kollegaen rett? Begrunn.
-
b)
Beskriv i ord (eller som R-kode) en simulering som ville avgjort spørsmålet, og angi hva du forventer å se for , og .
-
c)
Konstruer selv en kort oppgave der forskjellen på fordelingen til enkeltverdier og fordelingen til gjennomsnittet er avgjørende for konklusjonen.
Løsningsforslag
Oppgave 13.5.4:
-
a)
Kollegaen tar feil. Sentralgrenseteoremet sier at gjennomsnittet av uavhengige observasjoner er tilnærmet normalfordelt når er stort nok – uansett formen på fordelingen enkeltverdiene trekkes fra. At enkeltmålingene av trykk er høyreskjeve, hindrer altså ikke at snittet av målinger følger en tilnærmet klokkekurve; for en moderat skjevhet som trykkets er rikelig. Påstanden blander sammen fordelingen til enkeltverdier med fordelingen til gjennomsnittet.
-
b)
Trekk mange (f.eks. ) utvalg av størrelse fra en høyreskjev fordeling, regn gjennomsnittet i hvert, og tegn histogrammet av gjennomsnittene – som i seksjonens R-eksempel: hist(replicate(10000, mean(rexp(n, rate = 0.25)))) for , og . Forventning: for gjengir histogrammet selve den høyreskjeve fordelingen; for er skjevheten tydelig dempet, men ikke borte; for er histogrammet tilnærmet klokkeformet og smalt, med bredde omkring den teoretiske standardfeilen .
-
c)
Åpen deloppgave; ingen entydig fasit. Et vurderingsmoment: konklusjonen i den konstruerte oppgaven må faktisk snu avhengig av om man bruker enkeltverdienes spredning eller gjennomsnittets spredning – ellers er skillet ikke avgjørende slik oppgaven krever.