Hopp til innholdet

Løsningsforslag · Kapittel 13

Statistikk

Statistikkens formål, grunnbegreper og data

Oppgave 13.1.1: Vi anvender inndelingen fra seksjonen på hver variabel etter tur.

  1. a)

    Kjønn er en kategori uten rangordning: kategorisk, nominalnivå.

  2. b)

    Sfærisk ekvivalent er en underliggende størrelse som i prinsippet kan ta en hvilken som helst verdi i et intervall, selv om den rapporteres i 0.25 D-trinn: kontinuerlig kvantitativ, forholdsnivå.

  3. c)

    Kontaktlinsebruker (ja/nei) er to kategorier uten rekkefølge: kategorisk, nominalnivå.

  4. d)

    Antall bokstaver lest er et telletall med ekte nullpunkt: diskret kvantitativ, forholdsnivå.

  5. e)

    Tørrøyesymptomer (ingen/milde/alvorlige) er rangordnede kategorier uten fast avstand mellom trinnene: ordinal, ordinalnivå.

Oppgave 13.1.2: Testen er den samme i alle fire tilfellene: gir samme utgangspunkt nøyaktig samme resultat hver gang?

  1. a)

    En beregning av brennvidden fra en gitt styrke gir samme tall hver gang den utføres – deterministisk.

  2. b)

    Fem trykkmålinger på det samme øyet gir fem tall som ligger nær hverandre, men ikke er identiske; den måletekniske variasjonen gjør utfallet stokastisk.

  3. c)

    Effektiv styrke ved en gitt vertex-avstand er en ren formelberegning med ett bestemt svar – deterministisk.

  4. d)

    Aksiallengden hos 30 forskjellige pasienter varierer både biologisk (øyne er virkelig ulikt lange) og måleteknisk – stokastisk.

Oppgave 13.1.3: Vi går gjennom begrepene fra seksjonen ett for ett. Populasjonen er alle studentene forskeren vil uttale seg om – nærsynte og ikke-nærsynte studenter, ikke bare de målte. Utvalget er de 74 studentene som faktisk ble målt (n=74). Analyseenheten er høyre øye hos hver student; siden bare ett øye måles per student, faller øye og student her sammen som enhet, og de 74 radene er uavhengige – samme grep som biometridatasettet i kapittelet bruker. To variabler: aksiallengden (i mm) er en kontinuerlig kvantitativ variabel på forholdsnivå, og refraksjonsstatus (nærsynt/ikke-nærsynt) er en kategorisk variabel på nominalnivå. Kilder til variasjon: biologisk variasjon (ekte forskjeller i aksiallengde mellom øyne) og måleteknisk variasjon (gjentatte målinger på samme øye gir ikke identiske tall); én av dem er nok som svar. Populasjon = (nærsynte og ikke-nærsynte) studenter; utvalg = de 74 målte studentene; enhet = høyre øye per student; variabler = aksiallengde (kontinuerlig, forholdsnivå) og refraksjonsstatus (kategorisk, nominalnivå); variasjon = biologisk og/eller måleteknisk.

Oppgave 13.1.4: Testen fra seksjonen: hører målingene naturlig sammen på den samme enheten, eller kommer de fra uavhengige grupper av ulike enheter?

  1. a)

    Høyre og venstre øye hos den samme pasienten hører sammen i par – paret.

  2. b)

    Kontaktlinsebrukere og ikke-brukere er to uavhengige grupper av ulike personer, uten kobling mellom en bestemt bruker og en bestemt ikke-bruker – uparet.

  3. c)

    To instrumenter på de samme øynene gir to tall fra samme enhet, så hver måling hører sammen med sin makker – paret.

  4. d)

    Nærsynte og ikke-nærsynte er ulike enheter i uavhengige grupper – uparet.

  5. e)

    Før og etter tilpasningen måles det samme øyet, så de to tallene hører sammen – paret.

Oppgave 13.1.5: Åpen oppgave; ingen entydig fasit. Et godt svar navngir en konkret konfunder som henger sammen med både linsebruk og tørre øyne (for eksempel alder eller skjermbruk), en konkret skjevhet i klinikkutvalget (de som oppsøker klinikken, er ikke et tilfeldig utvalg av befolkningen), og et designgrep som randomisering eller oppfølging over tid – og bruker eksplisitt at en observert samvariasjon alene ikke skiller mellom disse forklaringene og en årsakssammenheng.

Deskriptiv statistikk

Oppgave 13.2.1: Vi bruker definisjonene av summetegn, gjennomsnitt og median direkte.

  1. a)

    ∑i=17xi=11+13+14+15+16+18+18=105 mmHg.

  2. b)

    x¯=17⋅105=15 mmHg.

  3. c)

    Tallene er allerede sortert; med n=7 (oddetall) er medianen den fjerde verdien, 15 mmHg. At gjennomsnitt og median faller sammen, tyder på en nokså symmetrisk fordeling.

Oppgave 13.2.2: Vi følger samme oppsett som i seksjonens eksempel: avvik, kvadrering, sum, og deling på n−1.

  1. a)

    ∑i=15xi=11+13+15+17+19=75, så x¯=755=15 mmHg.

  2. b)

    Avvikene xi−x¯ er −4,−2, 0, 2, 4; kvadrert gir de 16, 4, 0, 4, 16, med kvadratsum ∑i=15(xi−x¯)2=40. Med n=5 er s2=405−1=10 mmHg2 og s=10≈3.16 mmHg.

  3. c)

    Som i seksjonens eksempel med fem sorterte verdier er Q1 den andre og Q3 den fjerde: Q1=13 mmHg, Q3=17 mmHg, så IQR=17−13=4 mmHg.

  4. d)

    Variansen er et gjennomsnitt av kvadrerte avvik og arver derfor den kvadrerte enheten mmHg2; kvadratroten i s=s2 bringer målet tilbake til dataenes egen enhet, mmHg.

Oppgave 13.2.3: Vi regner begge sentralmålene og leser formen ut av dem.

  1. a)

    Summen er 12+13+14+14+15+16+18+26=128, så x¯=1288=16 mmHg. Med n=8 (partall) er medianen gjennomsnittet av de to midterste (fjerde og femte) verdiene: 14+152=14.5 mmHg.

  2. b)

    Bare 16, 18 og 26 ligger på eller over gjennomsnittet – 3 av 8; flertallet ligger under det.

  3. c)

    At x¯=16>median=14.5, viser at fordelingen er høyreskjev: den ene høye verdien (26 mmHg, den glaukommistenkte) drar gjennomsnittet opp uten å være representativ. Medianen 14.5 mmHg beskriver den typiske pasienten best og bør rapporteres med kvartilbredden.

Oppgave 13.2.4: Påstanden blander sammen gjennomsnitt og median; vi bruker tallene fra forrige oppgave (12, 13, 14, 14, 15, 16, 18 og 26 mmHg).

  1. a)

    Nei. Bare 18 og 26 ligger over 16 mmHg – 2 av 8, en fjerdedel, ikke halvparten. Det er medianen som deler materialet i to like halvdeler: over medianen 14.5 mmHg ligger nøyaktig fire av de åtte. Kollegaen har tillagt gjennomsnittet en egenskap som tilhører medianen; i denne høyreskjeve fordelingen ligger gjennomsnittet over medianen, så færre enn halvparten ligger over det.

  2. b)

    Median 14.5 mmHg (IQR 13.75–16.5) bør rapporteres. Fordelingen er høyreskjev, og den ene avlesningen på 26 mmHg blåser opp både gjennomsnittet og standardavviket – SD-en på 4.4 mmHg skyldes i stor grad denne ene verdien. Median og kvartilbredde er robuste mot uteliggeren og beskriver de typiske pasientene ærlig, i tråd med seksjonens regel: ligger gjennomsnittet merkbart over medianen, rapporter median med kvartilbredde.

Oppgave 13.2.5:

  1. a)

    Vi bruker beslutningstavlen fra seksjonen. (i) Spredningsdiagram – spørsmålet gjelder samvariasjon mellom to kontinuerlige variabler (CCT og IOP). (ii) Histogram – spørsmålet gjelder formen på fordelingen til én variabel. (iii) Boksplott – spørsmålet sammenligner median og spredning mellom to grupper (menn og kvinner), gjerne som ett boksplott per gruppe side om side.

  2. b)

    Åpen deloppgave; ingen entydig fasit. Vurderingsmoment: datasettet godkjennes når alle seks verdiene ligger mellom 10 og 24 mmHg og differansen x¯−median, regnet ut av studenten selv, er minst 2 mmHg – det krever typisk flere lave verdier tett samlet og én eller to høye, og fordelingen skal da oppgis som høyreskjev.

Måling og usikkerhet

Oppgave 13.3.1:

  1. a)

    Summen av de tre segmentene er AL=3.2+4.0+16.8=24.0 mm.

  2. b)

    Segmentene er målt uavhengig av hverandre, så de absolutte feilene adderes i kvadratur:

    Δ⁢AL=0.12+0.12+0.22=0.06≈0.24 mm,

    altså AL=(24.0±0.24)⁢mm.

  3. c)

    Ren addisjon ville gitt 0.1+0.1+0.2=0.4 mm – kvadratsummen er mindre fordi uavhengige feil sjelden slår ut maksimalt i samme retning samtidig og derfor delvis opphever hverandre.

Oppgave 13.3.2:

  1. a)

    For en differanse adderes de absolutte feilene i kvadratur:

    Δ⁢q=12+12=2≈1.4 mmHg.
  2. b)

    Endringen er 22−20=2 mmHg, altså (2±1.4)⁢mmHg, med relativ usikkerhet 1.4/2≈71 %.

  3. c)

    Usikkerheten på 1.4 mmHg er nesten like stor som endringen selv – en liten differanse mellom to usikre tall er noe av det minst pålitelige man kan regne ut, og de 2 mmHg kan langt på vei være ren avlesningsstøy. For å skille reell døgnvariasjon fra støy må den tilfeldige usikkerheten ned: ta flere avlesninger på hvert tidspunkt og bruk gjennomsnittet, siden standardfeilen faller som s/n – fire gjentak halverer den. Nei – endringen er ikke pålitelig skilt fra avlesningsstøy.

Oppgave 13.3.3:

  1. a)

    Avlesningene ligger tett (x¯=43.85 D, s≈0.06 D), så instrumentet er presist. Men gjennomsnittet ligger 43.85−43.1=0.75 D over den sanne styrken, så det er ikke riktig: det bærer en systematisk bias på om lag +0.75 D. Og fordi nøyaktighet krever både presisjon og riktighet, er det heller ikke nøyaktig. Presist; ikke riktig; ikke nøyaktig.

  2. b)

    Den systematiske feilen dominerer, og å ta gjennomsnittet hjelper ikke: snittet 43.85 D er selv forskjøvet, og flere avlesninger flytter det ikke. Systematisk feil; nei, gjennomsnitt hjelper ikke.

  3. c)

    Bare sammenligning mot en kjent referanse avslører biasen: en kalibreringskontroll mot et referanselegeme med kjent krumning, og ved avvik ut over toleransen skal instrumentet rekalibreres eller tas ut av bruk.

Oppgave 13.3.4:

  1. a)

    Tre desimaler forteller bare at oppløsningen – den minste endringen instrumentet kan vise – er 0.001 mm. Oppløsningen setter et gulv på presisjonen, men sier ingenting om systematisk feil: instrumentet kan vise tre desimaler og likevel være forskjøvet – fin oppløsning uten kalibrering er bare presis usannhet. Slutningen forveksler oppløsning med nøyaktighet.

  2. b)

    Fordi AL=12⁢cvev⁢tekko, skalerer hver rapportert lengde med den antatte lydfarten: en gal fart forskyver alle lengder med samme faktor – en systematisk feil. Det tredje desimalsifferet avslører den ikke: avlesningene ligger fortsatt like tett, bare samlet på feil sted. Nei.

  3. c)

    Bare kalibrering forteller hvor nøyaktig instrumentet er: mål et referanselegeme med kjent lengde og sammenlign. Sporbarhet er det som gir referansen verdi – en ubrutt kjede av sammenligninger som knytter den, ledd for ledd, tilbake til SI-enheten, slik at du vet hva den kjente lengden faktisk er verdt. Kalibrering mot en sporbar referanse.

Oppgave 13.3.5:

  1. a)

    De fleste prøvelinsesett er gradert i 0.25 D-trinn, og foropterens sfæredial innfører styrke i de samme trinnene, så utstyret arbeider i trinn på 0.25 D – det tredje sifferet i −2.13 D bærer ingen måleinformasjon og er falsk presisjon. Verdien skal rundes til den presisjonen instrumentets oppløsning tåler, altså nærmeste trinn: −2.25 D (nærmeste trinn) eller −2.00 D, ikke noe imellom.

  2. b)

    Åpen deloppgave; ingen entydig fasit. Vurderingsmoment: den konstruerte oppgaven må oppgi en realistisk instrumentoppløsning, og det «korrekte» svaret må ikke ha flere gjeldende siffer enn den oppløsningen bærer.

Sannsynlighet og diagnostiske tester

Oppgave 13.4.1: Av de 1000 pasientene har 100 tilstanden og 900 er friske.

  1. a)

    Sensitiviteten 0.90 fanger 0.90⋅100=90 sanne positive, så 10 overses (FN); spesifisiteten 0.85 klarerer 0.85⋅900=765 sanne negative, så 135 får falsk alarm (FP).

    Syk Frisk Sum
    Test + 90 (SP) 135 (FP) 225
    Test − 10 (FN) 765 (SN) 775
    Sum 100 900 1000

    Radsummene 225+775=1000 stemmer med totalen.

  2. b)

    Bortover radene:

    PPV=9090+135=90225=0.40=40 %,NPV=765765+10=765775≈0.987≈98.7 %.

    Kontroll med Bayes’ regel: PPV=0.90⋅0.10/(0.90⋅0.10+0.15⋅0.90)=0.09/0.225=0.40 – samme svar.

  3. c)

    Av de 225 som tester positivt, har 90 faktisk tilstanden – altså 40 %, i samsvar med PPV fra b).

Oppgave 13.4.2: Hvert øye har uavhengig sannsynlighet 0.08 for funn.

  1. a)

    Multiplikasjonsregelen for uavhengige hendelser gir

    P⁢(begge)=0.08⋅0.08=0.0064.
  2. b)

    Komplementet til «minst ett funn» er «ingen funn», og hvert øye er fritt for funn med sannsynlighet 1−0.08=0.92:

    P⁢(minst ett)=1−0.922=1−0.8464=0.1536.

    Kontroll med addisjonsregelen: 0.08+0.08−0.0064=0.1536 – samme svar.

  3. c)

    Nei, neppe. To øyne deler samme pasient: en systemisk årsak – for eksempel diabetes – rammer gjerne begge øyne, så et funn på ett øye øker sannsynligheten for funn på det andre. Øynene er da positivt koblet, og P⁢(begge) blir større enn de 0.0064 uavhengighetsantakelsen ga.

Oppgave 13.4.3: Testen har sensitivitet 0.90 og spesifisitet 0.85; vi teller naturlige frekvenser i en tenkt populasjon på 10 000.

  1. a)

    Med prevalens p=0.02 er 200 syke og 9800 friske. Testen fanger 0.90⋅200=180 sanne positive og gir 0.15⋅9800=1470 falske positive, til sammen 1650 positive:

    PPV=1801650≈0.109≈10.9 %.

    Kontroll med Bayes-formelen: 0.90⋅0.02/(0.90⋅0.02+0.15⋅0.98)=0.018/0.165≈0.109 – samme svar.

  2. b)

    Med p=0.40 er 4000 syke og 6000 friske; 0.90⋅4000=3600 sanne positive og 0.15⋅6000=900 falske positive gir

    PPV=36004500=0.80=80 %.
  3. c)

    Sensitivitet og spesifisitet er egenskaper ved testen og står fast; PPV beskriver testen i en bestemt befolkning og avhenger av prevalensen. Ved 2 % prevalens er det så mange flere friske enn syke at de falske positive drukner de sanne; ved 40 % er de syke i flertall blant de positive, og et positivt svar veier tungt.

Oppgave 13.4.4: Testen har sensitivitet og spesifisitet 95 %, og prevalensen er 1 %.

  1. a)

    I en tenkt populasjon på 10 000 har 0.01⋅10 000=100 tilstanden og 9900 er friske. Testen fanger 0.95⋅100=95 sanne positive og gir 0.05⋅9900=495 falske positive, til sammen 590 positive:

    PPV=95590≈0.161≈16.1 %.

    Kontroll med Bayes-formelen: 0.95⋅0.01/(0.95⋅0.01+0.05⋅0.99)=0.0095/0.059≈0.161 – samme svar.

  2. b)

    Påstanden er feil. Sannsynligheten for sykdom ved en positiv test er rundt 16 %, ikke 95 %. Feilen er å forveksle de to retningene i betingelsen: 95 % er P(test+∣syk) – sensitiviteten – mens pasienten spør om P⁢(syk∣test+), altså PPV. Annonsen ignorerer prevalensen: med bare 1 % syke er de falske positive (495) langt flere enn de sanne (95), så de fleste positive svar er falske alarmer.

Sannsynlighetsfordelinger og normalfordelingen

Oppgave 13.5.1:

  1. a)

    Grensene er 12.5=16−3.5=μ−σ og 19.5=16+3.5=μ+σ, så intervallet er nøyaktig μ±1⁢σ. Regelen gir da ca. 68 % av øynene.

  2. b)

    z=9−163.5=−73.5=−2.00.

  3. c)

    Verdien 9 mmHg ligger nøyaktig to standardavvik under gjennomsnittet. Utenfor μ±2⁢σ ligger 1−0.9545 av fordelingen, og halvparten av dette er i nedre hale: (1−0.9545)/2≈0.023, altså ca. 2.3 %.

Oppgave 13.5.2:

  1. a)

    Et fast antall uavhengige forsøk med samme suksessandel gir en binomialmodell: X∼Bin⁢(20, 0.08), med E⁢(X)=n⁢p=20⋅0.08=1.6.

  2. b)

    Med k=0 faller binomialkoeffisienten og p0 bort:

    P⁢(X=0)=0.9220≈0.189.
  3. c)

    «Minst én» er komplementet til «ingen»:

    P⁢(X≥1)=1−P⁢(X=0)≈1−0.189=0.811.

Oppgave 13.5.3:

  1. a)
    SEM=sn=1.216=1.24=0.30 mm.
  2. b)

    s=1.2 mm beskriver spredningen mellom enkeltøynes aksiallengder – hvor ulike to tilfeldige øyne er. SEM =0.30 mm beskriver hvor presist gjennomsnittet av de 16 målingene anslår populasjonssnittet μ; den er mindre fordi midling jevner ut tilfeldig variasjon.

  3. c)

    Kravet s/n=0.15 gir n=1.2/0.15=8, altså n=64 øyne. Fordi SEM ∝1/n, krever en halvering (fra 0.30 til 0.15 mm) en firedobling av n, ikke en dobling: med n=32 blir SEM=1.2/32≈0.21 mm, langt fra kravet, mens 1.2/64=0.15 mm treffer nøyaktig.

Oppgave 13.5.4:

  1. a)

    Kollegaen tar feil. Sentralgrenseteoremet sier at gjennomsnittet av n uavhengige observasjoner er tilnærmet normalfordelt når n er stort nok – uansett formen på fordelingen enkeltverdiene trekkes fra. At enkeltmålingene av trykk er høyreskjeve, hindrer altså ikke at snittet av 40 målinger følger en tilnærmet klokkekurve; for en moderat skjevhet som trykkets er n=40 rikelig. Påstanden blander sammen fordelingen til enkeltverdier med fordelingen til gjennomsnittet.

  2. b)

    Trekk mange (f.eks. 10 000) utvalg av størrelse n fra en høyreskjev fordeling, regn gjennomsnittet i hvert, og tegn histogrammet av gjennomsnittene – som i seksjonens R-eksempel: hist(replicate(10000, mean(rexp(n, rate = 0.25)))) for n=1, 5 og 40. Forventning: for n=1 gjengir histogrammet selve den høyreskjeve fordelingen; for n=5 er skjevheten tydelig dempet, men ikke borte; for n=40 er histogrammet tilnærmet klokkeformet og smalt, med bredde omkring den teoretiske standardfeilen σ/40.

  3. c)

    Åpen deloppgave; ingen entydig fasit. Et vurderingsmoment: konklusjonen i den konstruerte oppgaven må faktisk snu avhengig av om man bruker enkeltverdienes spredning s eller gjennomsnittets spredning s/n – ellers er skillet ikke avgjørende slik oppgaven krever.

Statistisk inferens: konfidensintervall og hypotesetesting

Oppgave 13.6.1:

  1. a)

    Standardfeilen er

    SEM=sn=2.1171≈0.250 mmHg.
  2. b)

    Feilmarginen er t∗⋅SEM=1.994⋅0.250≈0.499≈0.50 mmHg, og intervallet blir

    13.46±0.50≈[ 12.96, 13.96]⁢mmHg

    – samme intervall som t.test(IOP) ga i brødteksten.

  3. c)

    Intervallet forteller at populasjonsgjennomsnitt fra 12.96 til 13.96 mmHg er forenlige med dataene – metoden som konstruerte intervallet, fanger μ i 95 % av gjentatte studier. Det forteller ikke at 95 % av pasientene har trykk i dette intervallet – det gjelder gjennomsnittet μ, ikke spredningen mellom enkeltpasienter. Og siden pasientene er glaukompasienter under behandling, gjelder μ det behandlede trykket i en slik gruppe, ikke trykket i befolkningen.

Oppgave 13.6.2:

  1. a)

    Ja. P-verdien: p<0.001<0.05=α, så H0 forkastes. Konfidensintervallet: [−3.36,−2.44] mmHg inneholder ikke 0, så en tosidig test på 5 %-nivå forkaster H0. De to kriteriene er ekvivalente og gir samme svar: forskjellen er statistisk signifikant. Retningen leses av fortegnet: middeldifferansen Corvis − GAT er negativ, og hele intervallet ligger under null, så Corvis ST leser lavere enn Goldmann – i snitt om lag 2.9 mmHg, med en forskjell som med 95 % sikkerhet ligger mellom 2.44 og 3.36 mmHg.

  2. b)

    H0: instrumentene måler likt i snitt – den sanne middeldifferansen Corvis − GAT er null, μd=0. H1: μd≠0.

  3. c)

    Kollegaen leser p-verdien som sannsynligheten for at H0 er sann. Men p-verdien er betinget på at H0 er sann: den er sannsynligheten for en minst så ekstrem testobservator (|t|≥12.48) gitt like instrumenter – ikke sannsynligheten for at instrumentene er like, gitt dataene. Betingelsen er snudd; at tallet er lite, endrer ikke feilslutningen.

Oppgave 13.6.3:

  1. a)

    En type I-feil er å forkaste en sann H0: et friskt øye stemples som glaukom – falsk alarm, med unødig henvisning, engstelse og kostnad. En type II-feil er å beholde en falsk H0: et ekte glaukom passerer som friskt – pasienten går ubehandlet, med fortsatt synstap.

  2. b)

    Type I-feilene svarer til lav spesifisitet: friske som får positivt svar. Type II-feilene svarer til lav sensitivitet: syke som får negativt svar.

  3. c)

    Fordi glaukomatøst synstap er irreversibelt, veier en oversett syk (type II) tyngre enn en falsk alarm (type I). Screeningen bør derfor bruke en test med høy sensitivitet, slik at få ekte glaukomer slipper gjennom. Prisen er lavere spesifisitet: flere friske får falskt positivt svar og henvises unødig – en akseptabel pris, siden den feilen rettes ved videre utredning, mens tapt syn ikke kan hentes tilbake.

Oppgave 13.6.4:

  1. a)

    Påstanden forteller bare at den observerte bedringen neppe er ren tilfeldighet. Den sier ingenting om hvor stor bedringen er, eller om den er merkbar for pasienten. Med n=1200 krymper standardfeilen mot null, og selv en klinisk ubetydelig forskjell blir statistisk signifikant; den lille p-verdien kan derfor like gjerne speile det store utvalget som en viktig effekt, og er alene utilstrekkelig som anbefalingsgrunnlag.

  2. b)

    En effektstørrelse (for eksempel Cohens d), som tallfester hvor stor bedringen er på en skala som ikke blåses opp av n, og et konfidensintervall for forskjellen, som viser retning og størrelsesorden – og dermed om hele intervallet ligger innenfor det klinisk ubetydelige.

  3. c)

    Åpen deloppgave – et skape-spørsmål uten entydig fasit. Vurderingsmoment: eksemplet må oppfylle begge krav samtidig – Cohens d=(x¯1−x¯2)/sp under om lag 0.2, mens testobservatoren t=d⁢n/2 – relasjonen følger direkte av t-testens definisjon for to like store grupper – likevel overstiger om lag 2; med d=0.1 krever det rundt 800 pasienter per gruppe.

Statistiske analyser: å velge og tolke metoden

Oppgave 13.7.1:

  1. a)

    Vi kvadrerer korrelasjonene: r2=(−0.75)2=0.5625≈0.56 for AL mot SER – om lag 56 % av variasjonen i aksiallengde følger lineært med refraksjonen. For CCT mot NCT − GAT er r2=0.412=0.1681≈0.17 – bare om lag 17 % av variasjonen i forskjellen mellom de to trykkavlesningene følger med hornhinnetykkelsen; den positive r sier at en tykk hornhinne gir høyere avlesning på det berøringsfrie tonometeret enn på Goldmann, men sammenhengen er svak.

  2. b)

    AL mot SER forklarer klart mest; marginen er 56−17=39 prosentpoeng.

  3. c)

    Innsetting i linja gir

    add^⁢(48)=−2.127+0.0749⋅48≈1.47 D

    (kontroll: 1.99 D ved 55 år minus 7⋅0.0749 D≈1.47 D). En pasient på 25 år ligger langt utenfor dataområdet 42–63 år, så prediksjonen ville vært ekstrapolasjon – linja er ikke belagt der, og den ville gitt et meningsløst negativt tillegg.

Oppgave 13.7.2: Vi går fram etter seksjonens to spørsmål – hva slags spørsmål, og hva slags data.

  1. a)

    To kontinuerlige variabler, spørsmål om samvariasjon: korrelasjon (Pearsons r) – Spearmans ρ dersom sammenhengen ikke er lineær eller uteliggere forstyrrer.

  2. b)

    Kontinuerlig utfall i to uavhengige grupper: uparet to-utvalgs t-test.

  3. c)

    Kontinuerlig utfall i tre grupper: enveis-ANOVA – parvise t-tester ville gitt multiplisitetsproblemet.

  4. d)

    To målinger på de samme 71 øynene, altså paret design: paret t-test på differansene Corvis − GAT (paret Wilcoxon ved brudd på normalitet).

  5. e)

    To kategoriske variabler – myopi (ja/nei) og kjønn – i en 2×2-tabell: kji-kvadrat-test for uavhengighet – Fishers eksakte test dersom noen forventede celletall er under 5.

Oppgave 13.7.3: Risikoene er Rt=15/100=0.15 i behandlingsgruppen og Rk=30/100=0.30 i kontrollgruppen.

  1. a)

    Vi setter inn i de fire målene:

    RR=0.150.30=0.50,ARR=0.30−0.15=0.15,
    RRR=0.150.30=0.50,NNT=10.15≈6.67→7

    (NNT rundes alltid opp til nærmeste hele pasient).

  2. b)

    Man må behandle 7 pasienter med dråpepreparatet for å hindre at én progredierer.

  3. c)

    Oddsforholdet er

    OR=15/8530/70=15⋅7085⋅30=10502550≈0.41.

    Det avviker fra RR=0.50 fordi utfallet her er vanlig – 30 % progredierer i kontrollgruppen. OR≈RR gjelder bare når utfallet er sjeldent; ved et så vanlig utfall ligger OR lenger fra 1 enn RR og overdriver effekten.

Oppgave 13.7.4:

  1. a)

    Hver test bærer sin egen 5 % risiko for falsk alarm (type I-feil). Med seks tester vokser den samlede sjansen for minst én falsk alarm kraftig – var testene uavhengige, ville den vært 1−0.956≈0.26. Å kjøre alle seks og så trekke fram den ene med p=0.04 er nettopp multiplisitetsproblemet: en enkelt p like under 0.05 er da godt forenlig med ren tilfeldighet, og konklusjonen «gruppene er forskjellige» er ikke belagt.

  2. b)

    Studenten burde kjørt enveis-ANOVA – én samlet test over de fire gruppene. En signifikant F ville fortalt at minst ett gruppepar skiller seg, men ikke hvilke; det krever oppfølgende parvise sammenligninger med korreksjon for multiplisitet.

  3. c)

    Ved siden av p-verdien hører effektstørrelsen η2 med tolkning mot grovgrensene, gruppenes n, gjennomsnitt og spredning (gjerne med konfidensintervall), en kontroll av forutsetningene (tilnærmet normalfordelte data – ellers Kruskal-Wallis), og en ærlig redegjørelse for alle testene som ble kjørt, ikke bare den som slo ut.

Metodesamsvar, reliabilitet og kritisk lesing

Oppgave 13.8.1: Samme oppsett som i eksempelet med de to tonometrene: middeldifferanse, standardavvik til differansene, og d¯±1.96⁢sd.

  1. a)

    Summen av differansene er 3⋅0.25+4⋅0.50+0.00=2.75, så d¯=2.75/8=0.34375≈0.34 D.

  2. b)

    Avvikene fra d¯ er −0.09375 (tre ganger), 0.15625 (fire ganger) og −0.34375 (én gang); summen av kvadratene er 0.2422, og

    sd=0.24228−1≈0.19 D.
  3. c)

    1.96⁢sd≈1.96⋅0.186=0.36, så grensene er

    0.344±0.365≈[−0.02, 0.71]⁢D.
  4. d)

    Det manuelle keratometeret leser i snitt 0.34 D høyere, og for en enkelt pasient kan avviket bli opp mot 0.7 D – nesten tre styrketrinn à 0.25 D – så klinikeren må avgjøre om et så stort sprik er akseptabelt før instrumentene brukes om hverandre.

Oppgave 13.8.2: Vi setter opp de fire cellene (12 ja/ja, 31 nei/nei, 4 A-ja/B-nei, 3 A-nei/B-ja; n=50) og bruker κ=(po−pe)/(1−pe).

  1. a)

    po=(12+31)/50=43/50=0.86.

  2. b)

    A sier ja i 16/50=0.32 av tilfellene, B i 15/50=0.30. Den forventede enigheten ved uavhengig gjetting er

    pe=0.32⋅0.30+0.68⋅0.70=0.096+0.476=0.572,

    så

    κ=0.86−0.5721−0.572=0.2880.428≈0.67.
  3. c)

    Den rå enigheten på 86 % ser imponerende ut, men 57 prosentpoeng av den ville kommet av ren tilfeldighet – begge sier oftest nei, så de er «enige» om de fleste papillene uansett. Kappa måler bare enigheten ut over dette og lander på 0.67, betydelig men ikke nær perfekt etter referanseskalaen. Rapporter κ – gjerne med po ved siden av – siden den ikke lar seg blåse opp av tilfeldig enighet.

Oppgave 13.8.3: Multiplisitetsregnestykket fra brødteksten, med 25 tester i stedet for 20.

  1. a)

    Forventet antall falske positive er 25⋅0.05=1.25.

  2. b)

    Når alle nullhypotesene er sanne, gir de 25 testene minst én falsk positiv med sannsynlighet om lag 0.72 – det er altså mer sannsynlig enn ikke at noe slår ut ved ren tilfeldighet. Ett enkeltfunn med p=0.03 er nøyaktig det mønsteret man da venter å se, og kan derfor ikke uten videre kalles en oppdagelse.

  3. c)

    Bonferroni-idéen gir per-test-nivået 0.05/25=0.002, og siden 0.03>0.002 holder funnet ikke etter korreksjonen.

Oppgave 13.8.4: Vi holder sammendraget opp mot sjekklisten i seksjonen.

  1. a)

    Tre svakheter: (1) Analyseenheten er gal – 80 øyne fra 40 pasienter behandles som n=80 uavhengige observasjoner, men høyre og venstre øye hos samme person er som regel positivt korrelerte, så standardfeilen undervurderes og p-verdiene blir kunstig små. (2) Korrelasjon brukes som bevis for samsvar – r=0.93 viser bare at instrumentene rangerer pasientene likt; en konstant forskyvning ville gitt like høy r, og ingen Bland-Altman-analyse med bias og samsvarsgrenser er rapportert. (3) «Ikke signifikant» tolkes som «like» – p=0.21 er fravær av bevis for en forskjell, ikke bevis for at forskjellen er null. Dessuten sies ingenting om hvor store avvik en enkelt pasient kan få.

  2. b)

    p=0.21 betyr bare at dataene ikke gir grunnlag for å forkaste nullhypotesen om lik middelverdi – det kan like gjerne skyldes for lite utvalg eller stor spredning som en reelt liten forskjell. Og selv med bias nær null kan samsvarsgrensene være vide, slik at enkeltpasienter får klinisk viktige avvik – kapittelets eget berøringsfrie tonometer mot Goldmann er nettopp et slikt tilfelle (p=0.20, men samsvarsgrenser på om lag −4.0 til 3.4 mmHg); å vise at metodene er utbyttbare krever at hele det aktuelle avviksområdet ligger innenfor en forhåndsbestemt klinisk akseptgrense, ikke at én test lot være å slå ut.

  3. c)

    For eksempel: «Det nye tonometeret samvarierer sterkt med Goldmann (r=0.93), og vi fant ingen signifikant forskjell i gjennomsnittstrykk (p=0.21). Om instrumentene samsvarer godt nok til å brukes om hverandre, kan disse tallene ikke avgjøre: det krever en Bland-Altman-analyse med bias og samsvarsgrenser, basert på ett øye per pasient eller en analyse som tar hensyn til korrelasjonen mellom øynene, vurdert mot en klinisk akseptgrense.»

Konklusjon: sammendragets tall bærer ikke konklusjonen; utbyttbarhet må vises med samsvarsanalyse på riktig analyseenhet.