Statistikk
Statistikkens formål, grunnbegreper og data
Oppgave 13.1.1: Vi anvender inndelingen fra seksjonen på hver variabel etter tur.
-
a)
Kjønn er en kategori uten rangordning: kategorisk, nominalnivå.
-
b)
Sfærisk ekvivalent er en underliggende størrelse som i prinsippet kan ta en hvilken som helst verdi i et intervall, selv om den rapporteres i -trinn: kontinuerlig kvantitativ, forholdsnivå.
-
c)
Kontaktlinsebruker (ja/nei) er to kategorier uten rekkefølge: kategorisk, nominalnivå.
-
d)
Antall bokstaver lest er et telletall med ekte nullpunkt: diskret kvantitativ, forholdsnivå.
-
e)
Tørrøyesymptomer (ingen/milde/alvorlige) er rangordnede kategorier uten fast avstand mellom trinnene: ordinal, ordinalnivå.
Oppgave 13.1.2: Testen er den samme i alle fire tilfellene: gir samme utgangspunkt nøyaktig samme resultat hver gang?
-
a)
En beregning av brennvidden fra en gitt styrke gir samme tall hver gang den utføres – deterministisk.
-
b)
Fem trykkmålinger på det samme øyet gir fem tall som ligger nær hverandre, men ikke er identiske; den måletekniske variasjonen gjør utfallet stokastisk.
-
c)
Effektiv styrke ved en gitt vertex-avstand er en ren formelberegning med ett bestemt svar – deterministisk.
-
d)
Aksiallengden hos 30 forskjellige pasienter varierer både biologisk (øyne er virkelig ulikt lange) og måleteknisk – stokastisk.
Oppgave 13.1.3: Vi går gjennom begrepene fra seksjonen ett for ett. Populasjonen er alle studentene forskeren vil uttale seg om – nærsynte og ikke-nærsynte studenter, ikke bare de målte. Utvalget er de 74 studentene som faktisk ble målt (). Analyseenheten er høyre øye hos hver student; siden bare ett øye måles per student, faller øye og student her sammen som enhet, og de 74 radene er uavhengige – samme grep som biometridatasettet i kapittelet bruker. To variabler: aksiallengden (i ) er en kontinuerlig kvantitativ variabel på forholdsnivå, og refraksjonsstatus (nærsynt/ikke-nærsynt) er en kategorisk variabel på nominalnivå. Kilder til variasjon: biologisk variasjon (ekte forskjeller i aksiallengde mellom øyne) og måleteknisk variasjon (gjentatte målinger på samme øye gir ikke identiske tall); én av dem er nok som svar. Populasjon = (nærsynte og ikke-nærsynte) studenter; utvalg = de 74 målte studentene; enhet = høyre øye per student; variabler = aksiallengde (kontinuerlig, forholdsnivå) og refraksjonsstatus (kategorisk, nominalnivå); variasjon = biologisk og/eller måleteknisk.
Oppgave 13.1.4: Testen fra seksjonen: hører målingene naturlig sammen på den samme enheten, eller kommer de fra uavhengige grupper av ulike enheter?
-
a)
Høyre og venstre øye hos den samme pasienten hører sammen i par – paret.
-
b)
Kontaktlinsebrukere og ikke-brukere er to uavhengige grupper av ulike personer, uten kobling mellom en bestemt bruker og en bestemt ikke-bruker – uparet.
-
c)
To instrumenter på de samme øynene gir to tall fra samme enhet, så hver måling hører sammen med sin makker – paret.
-
d)
Nærsynte og ikke-nærsynte er ulike enheter i uavhengige grupper – uparet.
-
e)
Før og etter tilpasningen måles det samme øyet, så de to tallene hører sammen – paret.
Oppgave 13.1.5: Åpen oppgave; ingen entydig fasit. Et godt svar navngir en konkret konfunder som henger sammen med både linsebruk og tørre øyne (for eksempel alder eller skjermbruk), en konkret skjevhet i klinikkutvalget (de som oppsøker klinikken, er ikke et tilfeldig utvalg av befolkningen), og et designgrep som randomisering eller oppfølging over tid – og bruker eksplisitt at en observert samvariasjon alene ikke skiller mellom disse forklaringene og en årsakssammenheng.
Deskriptiv statistikk
Oppgave 13.2.1: Vi bruker definisjonene av summetegn, gjennomsnitt og median direkte.
-
a)
.
-
b)
.
-
c)
Tallene er allerede sortert; med (oddetall) er medianen den fjerde verdien, . At gjennomsnitt og median faller sammen, tyder på en nokså symmetrisk fordeling.
Oppgave 13.2.2: Vi følger samme oppsett som i seksjonens eksempel: avvik, kvadrering, sum, og deling på .
-
a)
, så .
-
b)
Avvikene er ; kvadrert gir de , med kvadratsum . Med er og .
-
c)
Som i seksjonens eksempel med fem sorterte verdier er den andre og den fjerde: , , så .
-
d)
Variansen er et gjennomsnitt av kvadrerte avvik og arver derfor den kvadrerte enheten ; kvadratroten i bringer målet tilbake til dataenes egen enhet, .
Oppgave 13.2.3: Vi regner begge sentralmålene og leser formen ut av dem.
-
a)
Summen er , så . Med (partall) er medianen gjennomsnittet av de to midterste (fjerde og femte) verdiene: .
-
b)
Bare , og ligger på eller over gjennomsnittet – 3 av 8; flertallet ligger under det.
-
c)
At , viser at fordelingen er høyreskjev: den ene høye verdien (, den glaukommistenkte) drar gjennomsnittet opp uten å være representativ. Medianen beskriver den typiske pasienten best og bør rapporteres med kvartilbredden.
Oppgave 13.2.4: Påstanden blander sammen gjennomsnitt og median; vi bruker tallene fra forrige oppgave (, , , , , , og ).
-
a)
Nei. Bare og ligger over – 2 av 8, en fjerdedel, ikke halvparten. Det er medianen som deler materialet i to like halvdeler: over medianen ligger nøyaktig fire av de åtte. Kollegaen har tillagt gjennomsnittet en egenskap som tilhører medianen; i denne høyreskjeve fordelingen ligger gjennomsnittet over medianen, så færre enn halvparten ligger over det.
-
b)
Median (IQR –) bør rapporteres. Fordelingen er høyreskjev, og den ene avlesningen på blåser opp både gjennomsnittet og standardavviket – SD-en på skyldes i stor grad denne ene verdien. Median og kvartilbredde er robuste mot uteliggeren og beskriver de typiske pasientene ærlig, i tråd med seksjonens regel: ligger gjennomsnittet merkbart over medianen, rapporter median med kvartilbredde.
Oppgave 13.2.5:
-
a)
Vi bruker beslutningstavlen fra seksjonen. (i) Spredningsdiagram – spørsmålet gjelder samvariasjon mellom to kontinuerlige variabler (CCT og IOP). (ii) Histogram – spørsmålet gjelder formen på fordelingen til én variabel. (iii) Boksplott – spørsmålet sammenligner median og spredning mellom to grupper (menn og kvinner), gjerne som ett boksplott per gruppe side om side.
-
b)
Åpen deloppgave; ingen entydig fasit. Vurderingsmoment: datasettet godkjennes når alle seks verdiene ligger mellom og og differansen , regnet ut av studenten selv, er minst – det krever typisk flere lave verdier tett samlet og én eller to høye, og fordelingen skal da oppgis som høyreskjev.
Måling og usikkerhet
Oppgave 13.3.1:
-
a)
Summen av de tre segmentene er .
-
b)
Segmentene er målt uavhengig av hverandre, så de absolutte feilene adderes i kvadratur:
altså .
-
c)
Ren addisjon ville gitt – kvadratsummen er mindre fordi uavhengige feil sjelden slår ut maksimalt i samme retning samtidig og derfor delvis opphever hverandre.
Oppgave 13.3.2:
-
a)
For en differanse adderes de absolutte feilene i kvadratur:
-
b)
Endringen er , altså , med relativ usikkerhet .
-
c)
Usikkerheten på er nesten like stor som endringen selv – en liten differanse mellom to usikre tall er noe av det minst pålitelige man kan regne ut, og de kan langt på vei være ren avlesningsstøy. For å skille reell døgnvariasjon fra støy må den tilfeldige usikkerheten ned: ta flere avlesninger på hvert tidspunkt og bruk gjennomsnittet, siden standardfeilen faller som – fire gjentak halverer den. Nei – endringen er ikke pålitelig skilt fra avlesningsstøy.
Oppgave 13.3.3:
-
a)
Avlesningene ligger tett (, ), så instrumentet er presist. Men gjennomsnittet ligger over den sanne styrken, så det er ikke riktig: det bærer en systematisk bias på om lag . Og fordi nøyaktighet krever både presisjon og riktighet, er det heller ikke nøyaktig. Presist; ikke riktig; ikke nøyaktig.
-
b)
Den systematiske feilen dominerer, og å ta gjennomsnittet hjelper ikke: snittet er selv forskjøvet, og flere avlesninger flytter det ikke. Systematisk feil; nei, gjennomsnitt hjelper ikke.
-
c)
Bare sammenligning mot en kjent referanse avslører biasen: en kalibreringskontroll mot et referanselegeme med kjent krumning, og ved avvik ut over toleransen skal instrumentet rekalibreres eller tas ut av bruk.
Oppgave 13.3.4:
-
a)
Tre desimaler forteller bare at oppløsningen – den minste endringen instrumentet kan vise – er . Oppløsningen setter et gulv på presisjonen, men sier ingenting om systematisk feil: instrumentet kan vise tre desimaler og likevel være forskjøvet – fin oppløsning uten kalibrering er bare presis usannhet. Slutningen forveksler oppløsning med nøyaktighet.
-
b)
Fordi , skalerer hver rapportert lengde med den antatte lydfarten: en gal fart forskyver alle lengder med samme faktor – en systematisk feil. Det tredje desimalsifferet avslører den ikke: avlesningene ligger fortsatt like tett, bare samlet på feil sted. Nei.
-
c)
Bare kalibrering forteller hvor nøyaktig instrumentet er: mål et referanselegeme med kjent lengde og sammenlign. Sporbarhet er det som gir referansen verdi – en ubrutt kjede av sammenligninger som knytter den, ledd for ledd, tilbake til SI-enheten, slik at du vet hva den kjente lengden faktisk er verdt. Kalibrering mot en sporbar referanse.
Oppgave 13.3.5:
-
a)
De fleste prøvelinsesett er gradert i -trinn, og foropterens sfæredial innfører styrke i de samme trinnene, så utstyret arbeider i trinn på – det tredje sifferet i bærer ingen måleinformasjon og er falsk presisjon. Verdien skal rundes til den presisjonen instrumentets oppløsning tåler, altså nærmeste trinn: (nærmeste trinn) eller , ikke noe imellom.
-
b)
Åpen deloppgave; ingen entydig fasit. Vurderingsmoment: den konstruerte oppgaven må oppgi en realistisk instrumentoppløsning, og det «korrekte» svaret må ikke ha flere gjeldende siffer enn den oppløsningen bærer.
Sannsynlighet og diagnostiske tester
Oppgave 13.4.1: Av de pasientene har tilstanden og er friske.
-
a)
Sensitiviteten fanger sanne positive, så overses (FN); spesifisiteten klarerer sanne negative, så får falsk alarm (FP).
Syk Frisk Sum Test (SP) (FP) Test (FN) (SN) Sum Radsummene stemmer med totalen.
-
b)
Bortover radene:
Kontroll med Bayes’ regel: – samme svar.
-
c)
Av de som tester positivt, har 90 faktisk tilstanden – altså , i samsvar med PPV fra b).
Oppgave 13.4.2: Hvert øye har uavhengig sannsynlighet for funn.
-
a)
Multiplikasjonsregelen for uavhengige hendelser gir
-
b)
Komplementet til «minst ett funn» er «ingen funn», og hvert øye er fritt for funn med sannsynlighet :
Kontroll med addisjonsregelen: – samme svar.
-
c)
Nei, neppe. To øyne deler samme pasient: en systemisk årsak – for eksempel diabetes – rammer gjerne begge øyne, så et funn på ett øye øker sannsynligheten for funn på det andre. Øynene er da positivt koblet, og blir større enn de uavhengighetsantakelsen ga.
Oppgave 13.4.3: Testen har sensitivitet og spesifisitet ; vi teller naturlige frekvenser i en tenkt populasjon på .
-
a)
Med prevalens er syke og friske. Testen fanger sanne positive og gir falske positive, til sammen positive:
Kontroll med Bayes-formelen: – samme svar.
-
b)
Med er syke og friske; sanne positive og falske positive gir
-
c)
Sensitivitet og spesifisitet er egenskaper ved testen og står fast; PPV beskriver testen i en bestemt befolkning og avhenger av prevalensen. Ved prevalens er det så mange flere friske enn syke at de falske positive drukner de sanne; ved er de syke i flertall blant de positive, og et positivt svar veier tungt.
Oppgave 13.4.4: Testen har sensitivitet og spesifisitet , og prevalensen er .
-
a)
I en tenkt populasjon på har tilstanden og er friske. Testen fanger sanne positive og gir falske positive, til sammen positive:
Kontroll med Bayes-formelen: – samme svar.
-
b)
Påstanden er feil. Sannsynligheten for sykdom ved en positiv test er rundt , ikke . Feilen er å forveksle de to retningene i betingelsen: er – sensitiviteten – mens pasienten spør om , altså PPV. Annonsen ignorerer prevalensen: med bare syke er de falske positive () langt flere enn de sanne (), så de fleste positive svar er falske alarmer.
Sannsynlighetsfordelinger og normalfordelingen
Oppgave 13.5.1:
-
a)
Grensene er og , så intervallet er nøyaktig . Regelen gir da ca. av øynene.
-
b)
.
-
c)
Verdien ligger nøyaktig to standardavvik under gjennomsnittet. Utenfor ligger av fordelingen, og halvparten av dette er i nedre hale: , altså ca. .
Oppgave 13.5.2:
-
a)
Et fast antall uavhengige forsøk med samme suksessandel gir en binomialmodell: , med .
-
b)
Med faller binomialkoeffisienten og bort:
-
c)
«Minst én» er komplementet til «ingen»:
Oppgave 13.5.3:
-
a)
-
b)
beskriver spredningen mellom enkeltøynes aksiallengder – hvor ulike to tilfeldige øyne er. SEM beskriver hvor presist gjennomsnittet av de målingene anslår populasjonssnittet ; den er mindre fordi midling jevner ut tilfeldig variasjon.
-
c)
Kravet gir , altså øyne. Fordi SEM , krever en halvering (fra til ) en firedobling av , ikke en dobling: med blir , langt fra kravet, mens treffer nøyaktig.
Oppgave 13.5.4:
-
a)
Kollegaen tar feil. Sentralgrenseteoremet sier at gjennomsnittet av uavhengige observasjoner er tilnærmet normalfordelt når er stort nok – uansett formen på fordelingen enkeltverdiene trekkes fra. At enkeltmålingene av trykk er høyreskjeve, hindrer altså ikke at snittet av målinger følger en tilnærmet klokkekurve; for en moderat skjevhet som trykkets er rikelig. Påstanden blander sammen fordelingen til enkeltverdier med fordelingen til gjennomsnittet.
-
b)
Trekk mange (f.eks. ) utvalg av størrelse fra en høyreskjev fordeling, regn gjennomsnittet i hvert, og tegn histogrammet av gjennomsnittene – som i seksjonens R-eksempel: hist(replicate(10000, mean(rexp(n, rate = 0.25)))) for , og . Forventning: for gjengir histogrammet selve den høyreskjeve fordelingen; for er skjevheten tydelig dempet, men ikke borte; for er histogrammet tilnærmet klokkeformet og smalt, med bredde omkring den teoretiske standardfeilen .
-
c)
Åpen deloppgave; ingen entydig fasit. Et vurderingsmoment: konklusjonen i den konstruerte oppgaven må faktisk snu avhengig av om man bruker enkeltverdienes spredning eller gjennomsnittets spredning – ellers er skillet ikke avgjørende slik oppgaven krever.
Statistisk inferens: konfidensintervall og hypotesetesting
Oppgave 13.6.1:
-
a)
Standardfeilen er
-
b)
Feilmarginen er , og intervallet blir
– samme intervall som t.test(IOP) ga i brødteksten.
-
c)
Intervallet forteller at populasjonsgjennomsnitt fra til er forenlige med dataene – metoden som konstruerte intervallet, fanger i av gjentatte studier. Det forteller ikke at av pasientene har trykk i dette intervallet – det gjelder gjennomsnittet , ikke spredningen mellom enkeltpasienter. Og siden pasientene er glaukompasienter under behandling, gjelder det behandlede trykket i en slik gruppe, ikke trykket i befolkningen.
Oppgave 13.6.2:
-
a)
Ja. P-verdien: , så forkastes. Konfidensintervallet: inneholder ikke , så en tosidig test på -nivå forkaster . De to kriteriene er ekvivalente og gir samme svar: forskjellen er statistisk signifikant. Retningen leses av fortegnet: middeldifferansen Corvis GAT er negativ, og hele intervallet ligger under null, så Corvis ST leser lavere enn Goldmann – i snitt om lag , med en forskjell som med sikkerhet ligger mellom og .
-
b)
: instrumentene måler likt i snitt – den sanne middeldifferansen Corvis GAT er null, . : .
-
c)
Kollegaen leser p-verdien som sannsynligheten for at er sann. Men p-verdien er betinget på at er sann: den er sannsynligheten for en minst så ekstrem testobservator () gitt like instrumenter – ikke sannsynligheten for at instrumentene er like, gitt dataene. Betingelsen er snudd; at tallet er lite, endrer ikke feilslutningen.
Oppgave 13.6.3:
-
a)
En type I-feil er å forkaste en sann : et friskt øye stemples som glaukom – falsk alarm, med unødig henvisning, engstelse og kostnad. En type II-feil er å beholde en falsk : et ekte glaukom passerer som friskt – pasienten går ubehandlet, med fortsatt synstap.
-
b)
Type I-feilene svarer til lav spesifisitet: friske som får positivt svar. Type II-feilene svarer til lav sensitivitet: syke som får negativt svar.
-
c)
Fordi glaukomatøst synstap er irreversibelt, veier en oversett syk (type II) tyngre enn en falsk alarm (type I). Screeningen bør derfor bruke en test med høy sensitivitet, slik at få ekte glaukomer slipper gjennom. Prisen er lavere spesifisitet: flere friske får falskt positivt svar og henvises unødig – en akseptabel pris, siden den feilen rettes ved videre utredning, mens tapt syn ikke kan hentes tilbake.
Oppgave 13.6.4:
-
a)
Påstanden forteller bare at den observerte bedringen neppe er ren tilfeldighet. Den sier ingenting om hvor stor bedringen er, eller om den er merkbar for pasienten. Med krymper standardfeilen mot null, og selv en klinisk ubetydelig forskjell blir statistisk signifikant; den lille p-verdien kan derfor like gjerne speile det store utvalget som en viktig effekt, og er alene utilstrekkelig som anbefalingsgrunnlag.
-
b)
En effektstørrelse (for eksempel Cohens ), som tallfester hvor stor bedringen er på en skala som ikke blåses opp av , og et konfidensintervall for forskjellen, som viser retning og størrelsesorden – og dermed om hele intervallet ligger innenfor det klinisk ubetydelige.
-
c)
Åpen deloppgave – et skape-spørsmål uten entydig fasit. Vurderingsmoment: eksemplet må oppfylle begge krav samtidig – Cohens under om lag , mens testobservatoren – relasjonen følger direkte av t-testens definisjon for to like store grupper – likevel overstiger om lag ; med krever det rundt pasienter per gruppe.
Statistiske analyser: å velge og tolke metoden
Oppgave 13.7.1:
-
a)
Vi kvadrerer korrelasjonene: for AL mot SER – om lag av variasjonen i aksiallengde følger lineært med refraksjonen. For CCT mot NCT GAT er – bare om lag av variasjonen i forskjellen mellom de to trykkavlesningene følger med hornhinnetykkelsen; den positive sier at en tykk hornhinne gir høyere avlesning på det berøringsfrie tonometeret enn på Goldmann, men sammenhengen er svak.
-
b)
AL mot SER forklarer klart mest; marginen er prosentpoeng.
-
c)
Innsetting i linja gir
(kontroll: ved år minus ). En pasient på år ligger langt utenfor dataområdet – år, så prediksjonen ville vært ekstrapolasjon – linja er ikke belagt der, og den ville gitt et meningsløst negativt tillegg.
Oppgave 13.7.2: Vi går fram etter seksjonens to spørsmål – hva slags spørsmål, og hva slags data.
-
a)
To kontinuerlige variabler, spørsmål om samvariasjon: korrelasjon (Pearsons ) – Spearmans dersom sammenhengen ikke er lineær eller uteliggere forstyrrer.
-
b)
Kontinuerlig utfall i to uavhengige grupper: uparet to-utvalgs t-test.
-
c)
Kontinuerlig utfall i tre grupper: enveis-ANOVA – parvise t-tester ville gitt multiplisitetsproblemet.
-
d)
To målinger på de samme øynene, altså paret design: paret t-test på differansene Corvis GAT (paret Wilcoxon ved brudd på normalitet).
-
e)
To kategoriske variabler – myopi (ja/nei) og kjønn – i en -tabell: kji-kvadrat-test for uavhengighet – Fishers eksakte test dersom noen forventede celletall er under .
Oppgave 13.7.3: Risikoene er i behandlingsgruppen og i kontrollgruppen.
-
a)
Vi setter inn i de fire målene:
(NNT rundes alltid opp til nærmeste hele pasient).
-
b)
Man må behandle pasienter med dråpepreparatet for å hindre at én progredierer.
-
c)
Oddsforholdet er
Det avviker fra fordi utfallet her er vanlig – progredierer i kontrollgruppen. gjelder bare når utfallet er sjeldent; ved et så vanlig utfall ligger OR lenger fra enn RR og overdriver effekten.
Oppgave 13.7.4:
-
a)
Hver test bærer sin egen risiko for falsk alarm (type I-feil). Med seks tester vokser den samlede sjansen for minst én falsk alarm kraftig – var testene uavhengige, ville den vært . Å kjøre alle seks og så trekke fram den ene med er nettopp multiplisitetsproblemet: en enkelt like under er da godt forenlig med ren tilfeldighet, og konklusjonen «gruppene er forskjellige» er ikke belagt.
-
b)
Studenten burde kjørt enveis-ANOVA – én samlet test over de fire gruppene. En signifikant ville fortalt at minst ett gruppepar skiller seg, men ikke hvilke; det krever oppfølgende parvise sammenligninger med korreksjon for multiplisitet.
-
c)
Ved siden av p-verdien hører effektstørrelsen med tolkning mot grovgrensene, gruppenes , gjennomsnitt og spredning (gjerne med konfidensintervall), en kontroll av forutsetningene (tilnærmet normalfordelte data – ellers Kruskal-Wallis), og en ærlig redegjørelse for alle testene som ble kjørt, ikke bare den som slo ut.
Metodesamsvar, reliabilitet og kritisk lesing
Oppgave 13.8.1: Samme oppsett som i eksempelet med de to tonometrene: middeldifferanse, standardavvik til differansene, og .
-
a)
Summen av differansene er , så .
-
b)
Avvikene fra er (tre ganger), (fire ganger) og (én gang); summen av kvadratene er , og
-
c)
, så grensene er
-
d)
Det manuelle keratometeret leser i snitt høyere, og for en enkelt pasient kan avviket bli opp mot – nesten tre styrketrinn à – så klinikeren må avgjøre om et så stort sprik er akseptabelt før instrumentene brukes om hverandre.
Oppgave 13.8.2: Vi setter opp de fire cellene ( ja/ja, nei/nei, A-ja/B-nei, A-nei/B-ja; ) og bruker .
-
a)
.
-
b)
A sier ja i av tilfellene, B i . Den forventede enigheten ved uavhengig gjetting er
så
-
c)
Den rå enigheten på ser imponerende ut, men prosentpoeng av den ville kommet av ren tilfeldighet – begge sier oftest nei, så de er «enige» om de fleste papillene uansett. Kappa måler bare enigheten ut over dette og lander på , betydelig men ikke nær perfekt etter referanseskalaen. Rapporter – gjerne med ved siden av – siden den ikke lar seg blåse opp av tilfeldig enighet.
Oppgave 13.8.3: Multiplisitetsregnestykket fra brødteksten, med tester i stedet for .
-
a)
Forventet antall falske positive er .
-
b)
Når alle nullhypotesene er sanne, gir de testene minst én falsk positiv med sannsynlighet om lag – det er altså mer sannsynlig enn ikke at noe slår ut ved ren tilfeldighet. Ett enkeltfunn med er nøyaktig det mønsteret man da venter å se, og kan derfor ikke uten videre kalles en oppdagelse.
-
c)
Bonferroni-idéen gir per-test-nivået , og siden holder funnet ikke etter korreksjonen.
Oppgave 13.8.4: Vi holder sammendraget opp mot sjekklisten i seksjonen.
-
a)
Tre svakheter: (1) Analyseenheten er gal – øyne fra pasienter behandles som uavhengige observasjoner, men høyre og venstre øye hos samme person er som regel positivt korrelerte, så standardfeilen undervurderes og p-verdiene blir kunstig små. (2) Korrelasjon brukes som bevis for samsvar – viser bare at instrumentene rangerer pasientene likt; en konstant forskyvning ville gitt like høy , og ingen Bland-Altman-analyse med bias og samsvarsgrenser er rapportert. (3) «Ikke signifikant» tolkes som «like» – er fravær av bevis for en forskjell, ikke bevis for at forskjellen er null. Dessuten sies ingenting om hvor store avvik en enkelt pasient kan få.
-
b)
betyr bare at dataene ikke gir grunnlag for å forkaste nullhypotesen om lik middelverdi – det kan like gjerne skyldes for lite utvalg eller stor spredning som en reelt liten forskjell. Og selv med bias nær null kan samsvarsgrensene være vide, slik at enkeltpasienter får klinisk viktige avvik – kapittelets eget berøringsfrie tonometer mot Goldmann er nettopp et slikt tilfelle (, men samsvarsgrenser på om lag til ); å vise at metodene er utbyttbare krever at hele det aktuelle avviksområdet ligger innenfor en forhåndsbestemt klinisk akseptgrense, ikke at én test lot være å slå ut.
-
c)
For eksempel: «Det nye tonometeret samvarierer sterkt med Goldmann (), og vi fant ingen signifikant forskjell i gjennomsnittstrykk (). Om instrumentene samsvarer godt nok til å brukes om hverandre, kan disse tallene ikke avgjøre: det krever en Bland-Altman-analyse med bias og samsvarsgrenser, basert på ett øye per pasient eller en analyse som tar hensyn til korrelasjonen mellom øynene, vurdert mot en klinisk akseptgrense.»
Konklusjon: sammendragets tall bærer ikke konklusjonen; utbyttbarhet må vises med samsvarsanalyse på riktig analyseenhet.