Kapittel 13 · Statistikk · 13.3
Måling og usikkerhet
Ethvert klinisk tall du leser av, er beheftet med usikkerhet – og spørsmålet som styrer denne seksjonen, er hvor mye du kan stole på tallet. Et trykk på , en aksiallengde på , en refraksjon på : ingen av dem er den sanne verdien truffet på kornet, men en sann verdi pluss en feil du sjelden kjenner størrelsen på. Å behandle måletall kritisk vil si å vite hvor feilen kommer fra, hvordan den forplanter seg når du regner videre med tallet, og hvor mange siffer resultatet egentlig bærer. Denne seksjonen kommer etter den forrige med hensikt: den tilfeldige delen av en måleusikkerhet er nettopp den spredningen som deskriptiv statistikk lærte oss å tallfeste.
Systematiske og tilfeldige feil
Måleusikkerhet deler seg i to slag som oppfører seg helt ulikt, og som må håndteres på hver sin måte.
En tilfeldig feil varierer uforutsigbart fra måling til måling. Gjentar du den samme målingen på det samme øyet, spriker tallene litt hver gang – snart litt over, snart litt under. Det er denne sprikingen som gir et datasett sin spredning, og den måles av standardavviket fra forrige seksjon. En systematisk feil (også kalt skjevhet eller bias) forskyver derimot hver måling i samme retning med omtrent samme beløp. Den gir ingen ekstra spredning; den flytter hele fordelingen bort fra den sanne verdien.
Forskjellen har en avgjørende praktisk følge. Fordi en tilfeldig feil er like ofte positiv som negativ, jevner den seg delvis ut når du tar gjennomsnittet av flere målinger – jo flere gjentak, jo mindre tilfeldig usikkerhet i snittet. En systematisk feil gjør ikke det: er hver eneste avlesning for høy, blir gjennomsnittet av dem også for høyt, uansett hvor mange du tar. Den kan bare avsløres ved å sammenligne mot en kjent referanse. Husk fra kapittelet om mekanikk at et Goldmann-tonometer bommer systematisk på øyne med uvanlig tykk eller tynn hornhinne – en tykkere hornhinne gir en konsekvent for høy avlesning. Det er en systematisk feil i renkultur: den forsvinner ikke om du måler ti ganger. Et anker fra kapittelet om bølger viser det motsatte samspillet. Aksiallengden fra et A-skann følger med en antatt lydfart . Bruker instrumentet en feil antatt lydfart, blir hver lengde forskjøvet med samme faktor – en systematisk feil. At to gjentatte subjektive refraksjoner spriker et kvart trinn, er derimot tilfeldig feil.
Hvor mye den tilfeldige usikkerheten avtar med gjentak, kan tallfestes. Har enkeltmålingene et standardavvik , har gjennomsnittet av uavhengige gjentak en standardfeil (av engelsk standard error of the mean, forkortet SEM):
Standardfeilen måler hvor mye gjennomsnittet ville sprikt om du gjentok hele måleserien – den er alltid mindre enn spredningen i enkeltmålingene, og krymper når vokser. Fordi det er kvadratroten av som står i nevneren, må du firedoble antallet målinger for å halvere den tilfeldige usikkerheten. Denne standardfeilen møter du igjen, i full bredde, i seksjonen om normalfordelingen.
R-kode
Presisjon, riktighet og nøyaktighet
Tre ord som i dagligtale flyter over i hverandre, betyr noe forskjellig i måleteknikken, og skillet mellom dem er nettopp skillet mellom de to feiltypene.
Presisjon er hvor tett gjentatte målinger ligger på hverandre. Høy presisjon betyr liten spredning – altså liten tilfeldig feil. Presisjon sier ingenting om hvor riktig tallet er, bare hvor gjentakbart det er. Riktighet er hvor tett gjennomsnittet av mange målinger ligger på den sanne verdien. Høy riktighet betyr liten systematisk feil. En serie kan være riktig i snitt selv om enkeltmålingene spriker mye. Nøyaktighet krever begge deler samtidig: en måling er nøyaktig bare når den både er presis og riktig. Det er nøyaktighet du til slutt er ute etter, men de to komponentene svikter uavhengig av hverandre, og en diagnose av hva som er galt, begynner med å skille dem.
Blinkskiva gjør skillet håndfast. Tenk deg fire skyttere som hver løsner fem skudd mot midten; hvert mønster svarer til én kombinasjon av de to feiltypene.
Klyngen oppe til venstre er presis (skuddene ligger tett) men ikke riktig (de sitter samlet et stykke fra midten – en ren systematisk feil). Oppe til høyre er det motsatt: skuddene er spredt (lav presisjon), men fordeler seg rundt midten, så gjennomsnittet treffer – riktig, men ikke presis. Bare klyngen nede til venstre er nøyaktig: tett og sentrert. Nede til høyre er begge feiltypene til stede på én gang.
Å regne med usikkerhet: feilpropagasjon
Ofte er ikke tallet du bryr deg om, det du måler direkte, men noe du regner deg fram til fra flere målte størrelser – hver med sin egen usikkerhet. Spørsmålet er da hvordan usikkerhetene i inngangsstørrelsene forplanter seg til resultatet. Dette kalles feilpropagasjon, og to regler dekker de vanligste tilfellene. Begge hviler på én forutsetning som du må huske å sjekke: at de enkelte feilene er uavhengige av hverandre – at en tilfeldig bom på den ene størrelsen ikke henger sammen med bommen på den andre.
Legger du størrelser sammen eller trekker dem fra hverandre, adderes de absolutte feilene i kvadratur. Skriver vi resultatet med usikkerheter og , er
Hvorfor kvadratsummen og ikke den enkle summen ? Fordi uavhengige feil sjelden slår ut maksimalt i samme retning samtidig – de opphever delvis hverandre. Ren addisjon ville gitt et for pessimistisk anslag; kvadratsummen er alltid mindre og er det ærlige tallet når feilene er uavhengige.
Denne regelen bærer en advarsel i seg. Trekker du to nesten like store, hver litt usikre tall fra hverandre, blir differansen liten mens den absolutte feilen består – og den relative feilen på differansen kan bli dramatisk stor. To aksiallengder avlest til og gir en forskjell på med usikkerhet – altså relativ usikkerhet på differansen, mot bare et par promille på hver enkeltlengde. En liten differanse mellom to usikre tall er noe av det minst pålitelige du kan regne ut.
Multipliserer eller dividerer du størrelser, er det i stedet de relative feilene som adderes i kvadratur. For er
For en potens blir dette til den nyttige regelen : en kvadrert størrelse har dobbelt så stor relativ feil som størrelsen selv. Et gjennomgående trekk ved kvadratsummen er at det største bidraget dominerer. Er ett relativt feilledd tre ganger et annet, gir de to til sammen – det lille leddet flytter nesten ingenting. Måleinnsatsen din bør derfor rettes mot den minst nøyaktige faktoren, ikke mot å skvise ut det siste av den som allerede er god.
Eksempel 13.3.1
Pupillens areal regnes ut fra radien som . Radien måles til . Finn arealet og dets relative og absolutte usikkerhet.
Løsning: Vi bruker potensregelen for feilpropagasjon på . Arealet er
Radiens relative usikkerhet er . Fordi arealet går som , dobles den relative feilen:
Den absolutte usikkerheten blir , altså . En upresis radiusmåling straffer seg altså dobbelt så hardt i arealet – verdt å vite når en pupilldiameter måles for øyet på et bilde.
Et anker fra kapittelet om bølgeoptikk gir et fullstendig produkt-og-kvotient-tilfelle. Husk at bølgelengden i et dobbeltspalteforsøk følger av stripeavstanden , spalteavstanden og skjermavstanden gjennom – et rent produkt delt på en størrelse, så de relative feilene adderes i kvadratur.
Eksempel 13.3.2
I et dobbeltspalteforsøk måles stripeavstanden på en skjerm bak en dobbeltspalte med spalteavstand . Bølgelengden er . Finn med usikkerhet, og avgjør hvilken målt størrelse som bidrar mest.
Løsning: Vi setter inn i produkt-og-kvotient-regelen og adderer de tre relative feilene i kvadratur. Bølgelengden selv er
De tre relative feilene er : , : og : . I kvadratur:
Da er , altså . Spalteavstanden med sine dominerer usikkerheten; skjermavstanden med monner nesten ikke. Vil du måle bølgelengden mer nøyaktig, er det du skal måle bedre – ikke . (Til sammenligning ville ren addisjon av de relative feilene gitt , altså : kvadratsummen er ærligere og mindre.)
R-kode
Eksempel 13.3.3
En A-skann rapporterer aksiallengden fra ekkotiden via , med antatt lydfart . Ekkoet kommer etter pulsen.
-
a)
Finn aksiallengden.
-
b)
Instrumentet er ved en feil satt til luftens lydfart, . Hvilken lengde rapporterer det da, og hvorfor er lengden proporsjonal med antatt lydfart?
-
c)
Anta i stedet at er kjent bare til . Hvor stor lengdeusikkerhet gir det, og – med tommelregelen om lag feil i valgt kunstig linse (IOL) per millimeter [87] – hvor stor styrkefeil svarer det til? Er dette en systematisk eller en tilfeldig feil?
Løsning: Vi bruker ekko-relasjonen og skiller de to feiltypene. For (a):
For (b): ekkotiden er fast for et gitt ekko, så er rett proporsjonal med den antatte lydfarten. Med luftens fart blir
en meningsløst kort lengde – nettopp fordi lengden skalerer med : dobles antatt fart, dobles rapportert lengde. For (c): en usikkerhet i gir (produktregelen med én faktor) usikkerhet i lengden, altså . Med per millimeter svarer det til feil i linsestyrken. Tommelregelen er selv en middelverdi, ikke en konstant: litteraturen spenner til per millimeter [88, avsn. «Introduction»], og den britiske nasjonale retningslinjen for kataraktkirurgi regner med [184] – som her ville gitt i stedet. Størrelsesordenen er den samme, og det er den som bærer konklusjonen. En feil antatt lydfart er en systematisk feil (, ca. ): den forskyver hver lengde samme vei og forsvinner ikke ved å måle flere ganger. Det er nettopp derfor aksiallengden er det kritiske målet før kataraktkirurgi.
Signifikante siffer og falsk presisjon
Et resultat kan aldri være mer presist enn den minst presise størrelsen som gikk inn i det. Å skrive flere siffer enn måledataene bærer, er falsk presisjon – det gir et inntrykk av nøyaktighet som ikke finnes.
Et talls gjeldende siffer er de sifrene som bærer informasjon om verdien – de du faktisk har målt, ikke nuller som bare plasserer desimaltegnet. Standardformen fra kapittelet om de vanlige regneoperasjonene, , gjør dem synlige: siffertallet foran tierpotensen er nettopp antallet gjeldende siffer. Du har dessuten sett boken bytte fra til i det steget der en verdi avrundes – samme disiplin, brukt på notasjonen. Det samme prinsippet styrer måletall: oppgi bare så mange siffer som instrumentets oppløsning og inngangsdataenes usikkerhet faktisk bærer. Et klinisk eksempel gjør poenget skarpt. En refraksjon notert som ser mer nøyaktig ut enn , men er det ikke: de fleste prøvelinsesett er gradert i -trinn [7, avsn. VIII.3, s. 11], og foropterens sfæredial innfører styrke i de samme trinnene [185, s. 22]. Når utstyret arbeider i -trinn, bærer et tredje siffer ingen måleinformasjon – det er oppdiktet. Riktig notasjon er (nærmeste trinn) eller , ikke noe imellom. Det gjelder generelt: rund sluttresultatet til den presisjonen den svakeste inngangsverdien tåler, verken mer eller mindre.
Kalibrering, sporbarhet og oppløsning
Tre beslektede begreper avslutter seksjonen, og de handler alle om å holde de systematiske feilene i sjakk.
Kalibrering er å sammenligne instrumentets avlesning mot en kjent referanse for å avdekke – og korrigere – systematisk feil. Det er den ene måten en bias kan fanges på, siden gjentak alene aldri røper den. Sporbarhet er en ubrutt kjede av slike sammenligninger som knytter din måling helt tilbake til en nasjonal eller internasjonal standard. Når et instrument er sporbart, vet du ikke bare at det ble kalibrert, men mot hva – og at referansen igjen ble kalibrert mot noe mer grunnleggende, ledd for ledd opp til SI-enheten. Oppløsning er den minste endringen instrumentet kan skille eller vise – det siste sifferet på skjermen. Oppløsningen setter et gulv på presisjonen, men er noe helt annet enn nøyaktighet: et instrument kan vise fire desimaler og likevel ha en stor systematisk feil. Fin oppløsning uten kalibrering er bare presis usannhet.
Husk fra kapittelet om mekanikk at Goldmann-tonometeret måler trykk gjennom . Instrumentet kontrolleres månedlig med en vektstang mot trommelstillingene , og , som ganget med ti svarer til , og [186, avsn. 2.5 og tillegg B.1]; viser det avvik ut over toleransen, er hver framtidig avlesning forskjøvet – en systematisk feil som ingen mengde gjentak retter opp. En slik kontroll er kalibrering i praksis, og sporbarheten er det som gjør at «» på vektstangen betyr det samme fra klinikk til klinikk.
Eksempel 13.3.4
Et tonometer gir på ett og samme øye avlesningene , , og , mens øyets sanne trykk – målt med et nykalibrert referanseinstrument – er . Er instrumentet presist? Riktig? Nøyaktig? Hvilken feiltype dominerer, hjelper det å ta gjennomsnittet, og hvordan ville du avdekket og rettet feilen?
Løsning: Vi bruker de tre begrepene og de to feiltypene på tallene etter tur. Avlesningene ligger tett (), så instrumentet er presist: den tilfeldige feilen er liten. Men gjennomsnittet er , som ligger over den sanne . Instrumentet er altså ikke riktig: det bærer en systematisk bias på om lag . Og fordi nøyaktighet krever både presisjon og riktighet, er det ikke nøyaktig. Den dominerende feilen er systematisk, og å ta gjennomsnittet hjelper ikke det minste mot den – snittet er selv forskjøvet. Bare en sammenligning mot en kjent referanse avslører biasen: en kalibreringskontroll (vektstangen ved , og ), og viser den avvik ut over toleransen, skal instrumentet tas ut av bruk og sendes til leverandøren. Kort: presist, men verken riktig eller nøyaktig; systematisk bias som bare kalibrering avdekker. Uten den kontrollen ville en avlesning like over den konvensjonelle normalgrensen – si på et øye med sant trykk – kunne utløst unødig glaukomutredning. Og legg merke til hva den grensen er: er den tradisjonelle øvre normalgrensen, satt statistisk ut fra trykkfordelingen i befolkningen, ikke en sykdomsgrense. De europeiske glaukomretningslinjene sier det rett ut: ingen enkelt trykkverdi alene kan skille friskt fra sykt – men høyere trykk er likevel en av de viktigste risikofaktorene både for å utvikle glaukom og for at det forverrer seg [180]. Grensen som utløser handling, ligger dessuten høyere: i britisk nasjonal retningslinje er et ubehandlet trykk på eller mer nivået der henvisning og behandling skal vurderes – men den ber samtidig om at målingen gjentas ved en annen anledning før pasienten henvises, og skade på synsnerven eller utfall i synsfeltet utløser henvisning uansett hvilket trykk du måler [187, punkt 1.1.4, 1.1.5 og 1.4.4]. Nettopp derfor betyr instrumentets bias så mye: den flytter denne pasienten fra til – nøyaktig opp på grensen som avgjør hva som skjer videre.
Oppgaver
Oppgave 13.3.1
Aksiallengden kan settes sammen av tre målte segmenter langs øyets akse: fremre kammerdybde , linsetykkelse og glasslegemedybde . Segmentene er målt uavhengig av hverandre.
-
a)
Finn den samlede aksiallengden.
-
b)
Regn ut usikkerheten i summen ved å addere de absolutte feilene i kvadratur.
-
c)
Sammenlign med det du ville fått ved ren addisjon av de tre feilene, og forklar i én setning hvorfor kvadratsummen er mindre.
Løsningsforslag
Oppgave 13.3.1:
-
a)
Summen av de tre segmentene er .
-
b)
Segmentene er målt uavhengig av hverandre, så de absolutte feilene adderes i kvadratur:
altså .
-
c)
Ren addisjon ville gitt – kvadratsummen er mindre fordi uavhengige feil sjelden slår ut maksimalt i samme retning samtidig og derfor delvis opphever hverandre.
Oppgave 13.3.2
En pasient har trykk om morgenen og om kvelden, målt med samme tonometer ( tilfeldig avlesningsusikkerhet hver gang).
-
a)
Beregn den absolutte usikkerheten i differansen (endringen) ved kvadratsummen for en differanse.
-
b)
Uttrykk endringen med usikkerhet, og oppgi dens relative usikkerhet.
-
c)
Er de «døgnvariasjon» et pålitelig tegn på en reell endring? Begrunn ut fra tallene, og foreslå hva som måtte til for å skille en reell variasjon fra avlesningsstøy.
Løsningsforslag
Oppgave 13.3.2:
-
a)
For en differanse adderes de absolutte feilene i kvadratur:
-
b)
Endringen er , altså , med relativ usikkerhet .
-
c)
Usikkerheten på er nesten like stor som endringen selv – en liten differanse mellom to usikre tall er noe av det minst pålitelige man kan regne ut, og de kan langt på vei være ren avlesningsstøy. For å skille reell døgnvariasjon fra støy må den tilfeldige usikkerheten ned: ta flere avlesninger på hvert tidspunkt og bruk gjennomsnittet, siden standardfeilen faller som – fire gjentak halverer den. Nei – endringen er ikke pålitelig skilt fra avlesningsstøy.
Oppgave 13.3.3
Et keratometer gir på det samme øyet de fire avlesningene , , og , mens hornhinnens sanne styrke (målt med et nykalibrert referanseinstrument) er .
-
a)
Er instrumentet presist? Er det riktig? Er det nøyaktig? Begrunn hvert svar med tallene.
-
b)
Hvilken feiltype dominerer, og hjelper det å ta gjennomsnittet av flere avlesninger?
-
c)
Hvordan ville du avdekket og rettet feilen?
Løsningsforslag
Oppgave 13.3.3:
-
a)
Avlesningene ligger tett (, ), så instrumentet er presist. Men gjennomsnittet ligger over den sanne styrken, så det er ikke riktig: det bærer en systematisk bias på om lag . Og fordi nøyaktighet krever både presisjon og riktighet, er det heller ikke nøyaktig. Presist; ikke riktig; ikke nøyaktig.
-
b)
Den systematiske feilen dominerer, og å ta gjennomsnittet hjelper ikke: snittet er selv forskjøvet, og flere avlesninger flytter det ikke. Systematisk feil; nei, gjennomsnitt hjelper ikke.
-
c)
Bare sammenligning mot en kjent referanse avslører biasen: en kalibreringskontroll mot et referanselegeme med kjent krumning, og ved avvik ut over toleransen skal instrumentet rekalibreres eller tas ut av bruk.
Oppgave 13.3.4
En biometer viser aksiallengden med tre desimaler, for eksempel . En kollega slutter at «målingen derfor er nøyaktig til ».
-
a)
Forklar hvorfor slutningen er feil ved å skille begrepene oppløsning og nøyaktighet.
-
b)
Hvis instrumentet er stilt inn på en litt gal antatt lydfart, hva slags feil gir det, og vil det tredje desimalsifferet avsløre den?
-
c)
Hvilken prosedyre ville faktisk fortalt deg hvor nøyaktig instrumentet er, og hva har sporbarhet med svaret å gjøre?
Løsningsforslag
Oppgave 13.3.4:
-
a)
Tre desimaler forteller bare at oppløsningen – den minste endringen instrumentet kan vise – er . Oppløsningen setter et gulv på presisjonen, men sier ingenting om systematisk feil: instrumentet kan vise tre desimaler og likevel være forskjøvet – fin oppløsning uten kalibrering er bare presis usannhet. Slutningen forveksler oppløsning med nøyaktighet.
-
b)
Fordi , skalerer hver rapportert lengde med den antatte lydfarten: en gal fart forskyver alle lengder med samme faktor – en systematisk feil. Det tredje desimalsifferet avslører den ikke: avlesningene ligger fortsatt like tett, bare samlet på feil sted. Nei.
-
c)
Bare kalibrering forteller hvor nøyaktig instrumentet er: mål et referanselegeme med kjent lengde og sammenlign. Sporbarhet er det som gir referansen verdi – en ubrutt kjede av sammenligninger som knytter den, ledd for ledd, tilbake til SI-enheten, slik at du vet hva den kjente lengden faktisk er verdt. Kalibrering mot en sporbar referanse.
Oppgave 13.3.5
En medstudent noterer refraksjonen som og forsvarer det med at «flere desimaler er mer nøyaktig».
-
a)
Forklar hvorfor dette er falsk presisjon, og hva verdien bør skrives som. Knytt svaret til begrepet oppløsning og til avrunding til gjeldende siffer.
-
b)
Konstruer selv en kort oppgave – gjerne fra keratometri, aksiallengde eller synsstyrke – der noen oppgir flere siffer enn måleinstrumentet kan bære. Angi instrumentets oppløsning og det korrekte antallet siffer, med en kort begrunnelse.
Løsningsforslag
Oppgave 13.3.5:
-
a)
De fleste prøvelinsesett er gradert i -trinn, og foropterens sfæredial innfører styrke i de samme trinnene, så utstyret arbeider i trinn på – det tredje sifferet i bærer ingen måleinformasjon og er falsk presisjon. Verdien skal rundes til den presisjonen instrumentets oppløsning tåler, altså nærmeste trinn: (nærmeste trinn) eller , ikke noe imellom.
-
b)
Åpen deloppgave; ingen entydig fasit. Vurderingsmoment: den konstruerte oppgaven må oppgi en realistisk instrumentoppløsning, og det «korrekte» svaret må ikke ha flere gjeldende siffer enn den oppløsningen bærer.