Hopp til innholdet

Kapittel 13 · Statistikk · 13.8

Metodesamsvar, reliabilitet og kritisk lesing

Denne siste seksjonen samler trådene, og som alltid begynner den med spørsmålet hva vil du oppnå? Nå er formålet et litt annet enn i de foregående. Du vil ikke lenger bare beskrive, sammenligne eller forklare – du vil vite om et måleverktøy er til å stole på: gir det samme svar når du gjentar målingen, gir to instrumenter samme svar på det samme øyet, og er to graderes vurdering av det samme bildet enige? Og til slutt vil du kunne snu blikket utover, mot en publisert studie, og avgjøre om tallene den bygger på faktisk bærer konklusjonen den trekker. De to spørsmålene henger sammen: den som forstår hva som skal til for at en måling er pålitelig, ser også raskt hvor en artikkel svikter.

Repeterbarhet og reproduserbarhet

To beslektede begreper skiller hvordan en måling kan gjenta seg selv. Repeterbarhet er samsvaret mellom gjentatte målinger under så like forhold som mulig – samme instrument, samme observatør, samme pasient, kort tid mellom målingene. Den fanger den rene tilfeldige variasjonen i selve målehandlingen. Reproduserbarhet er samsvaret når forholdene varierer systematisk – ulike observatører, ulike instrumenter, ulike dager eller klinikker. Den er alltid dårligere enn repeterbarheten, fordi den slipper til flere kilder til variasjon. Legg merke til at begge tallfestes gjennom spredningen i gjentakene, ikke gjennom en korrelasjon. Det er et poeng vi kommer tilbake til med en gang.

Metodedatasettet vi bruker gjennom seksjonen, er trykkolonnene fra klinikkdatasettet: de 71 høyre øynene målt samme dag med Goldmann (GAT), berøringsfritt tonometer (NCT) og Corvis ST (ukorrigert Corvis og biomekanisk korrigert bIOP) [181]. Tabell 13.3 viser de tolv første; hele settet står i Tillegg A, der GAT bare er et nytt navn på IOP-kolonnen. Datasettet har ingen gjentak å regne på – fila har én verdi per instrument per øye – så repeterbarheten til ett instrument kan vi ikke måle her. Reproduserbarheten på tvers av to instrumenter kan vi. Vi tar NCT mot GAT, som i snitt leser omtrent likt: for hvert øye er differansen NCT − GAT uten fast fortegn, og middeldifferansen er bare −0.29 mmHg, nær null og ikke signifikant (p=0.20 i den parede t-testen fra forrige seksjon). Det som betyr noe, er hvor mye de to spriker tilfeldig fra øye til øye. Det tallfestes med innen-individ-standardavviket (within-subject SD) Sw, som her er 1.36 mmHg. Ut fra det defineres en koeffisient: to avlesninger på det samme øyet forventes å avvike mindre enn

1.96⁢2⁢Sw≈2.77⁢Sw

i 95 % av tilfellene [192]. Er de to avlesningene gjort med det samme instrumentet, kalles tallet repeterbarhetskoeffisienten; er de gjort med to ulike instrumenter, som her, reproduserbarhetskoeffisienten – samme formel, hvert sitt begrep. Faktoren 1.96 er den samme som ga 95 %-dekningen i normalfordelingen (husk 68–95–99.7-regelen fra seksjonen om fordelinger), og 2 kommer av at en differanse mellom to like usikre målinger har 2 ganger så stor spredning som én måling. Her blir koeffisienten 2.77⁢Sw≈3.76 mmHg: en NCT- og en Goldmann-avlesning på samme øye ligger med 95 % sannsynlighet nærmere hverandre enn 3.76 mmHg. Er de lenger fra hverandre, er det mer enn tilfeldig måletukling – noe ved øyet eller målingen skiller seg ut. Formelen for Sw forutsetter at det ikke er noen systematisk forskjell mellom de to avlesningene; finnes det en, blåser den Sw opp. Her er biasen −0.29 mmHg liten mot spredningen i differansene (sd=1.91 mmHg), så Sw og sd/2≈1.35 er nesten like, og forutsetningen holder godt nok.

Tabell 13.3: Metodedatasettet, de tolv første av 71 øyne: samme høyre øye målt med Goldmann (GAT), berøringsfritt tonometer (NCT) og Corvis ST (ukorrigert Corvis og biomekanisk korrigert bIOP), alt i mmHg. Data fra [181]; hele settet i Tillegg A.
id GAT (mmHg) NCT (mmHg) Corvis (mmHg) bIOP (mmHg)
1 16.0 18 17.0 16.0
2 11.3 12 8.3 8.7
3 15.0 17 13.7 14.1
4 16.0 16 14.5 13.4
5 11.0 10 7.2 8.8
6 11.3 12 10.0 9.6
7 15.0 15 12.0 11.3
8 10.0 9 8.5 9.3
9 16.0 20 15.7 15.2
10 17.0 16 11.7 10.4
11 12.0 12 8.5 8.3
12 14.0 13 9.7 9.9

R-kode

# Reproduserbarhet: hvor mye spriker NCT og Goldmann paa samme oeye?
d_rep <- NCT - GAT
mean(d_rep) # systematisk forskjell -- naer 0
#> [1] -0.2943662
Sw <- sqrt(mean(d_rep^2) / 2) # within-subject SD paa tvers av instrumentene
Sw
#> [1] 1.356648
1.96 * sqrt(2) * Sw # reproduserbarhetskoeffisient
#> [1] 3.760436
sd(d_rep) # til sammenligning: SD til differansene
#> [1] 1.909367

Eksempel 13.8.1

Et keratometer måler hornhinnekrumningen på det samme øyet to ganger hos en rekke pasienter, og innen-individ-standardavviket blir Sw=0.12 D. Hvor mye kan to gjentatte avlesninger på det samme øyet forventes å avvike i 95 % av tilfellene?

Løsning: Samme instrument, gjentatt – dette er repeterbarhet, og vi setter Sw inn i repeterbarhetskoeffisienten 2.77⁢Sw.

2.77⋅0.12 D≈0.33 D.

To krumningsavlesninger på samme øye bør altså ligge nærmere hverandre enn omtrent 0.33 D; et større sprik tyder på at noe utenom den rene måleusikkerheten har endret seg.

Samsvar er ikke samvariasjon

Nå til det egentlige spørsmålet, stilt til det tredje instrumentet: gir Corvis ST og Goldmann samme trykk? Det er fristende å svare med en korrelasjon, og gjør du det, ser svaret oppmuntrende ut – Pearsons r mellom Corvis ST og Goldmann er 0.72, etter holdepunktene fra forrige seksjon en sterk sammenheng (r2=0.52). Men her er korrelasjonen feil verktøy, og forskjellen er kapittelets siste store poeng.

Samvariasjon – det korrelasjonen måler – er om de to instrumentene rangerer pasientene likt: om et øye som Corvis ST finner høyt, også er høyt hos Goldmann. Samsvar er noe strengere: om de gir samme tallverdi. De to er ikke det samme. Tenk deg et instrument som alltid leser nøyaktig 2.9 mmHg for lavt. Det følger det andre instrumentet perfekt oppover – høyt der det andre er høyt, lavt der det er lavt – så r blir nær 1. Likevel er de to systematisk uenige om hver eneste verdi. Korrelasjonen er blind for en slik konstant forskyvning, og den blåses dessuten opp av et bredt måleområde: jo mer trykkene spriker mellom pasientene, desto større blir r nesten uansett hvor godt instrumentene samsvarer. En høy korrelasjon er derfor ikke et bevis på at to metoder kan brukes om hverandre.

Bland-Altman-analyse

Verktøyet som faktisk svarer på samsvarsspørsmålet, er Bland-Altman-analysen. Ideen er enkel og direkte: se på forskjellen mellom de to metodene, ikke på hvordan de rangerer. For hvert øye regner du differansen mellom metodene og gjennomsnittet av dem:

di=Corvisi−GATi,gjennomsnitti=12⁢(Corvisi+GATi).

Så plotter du differansen (loddrett) mot gjennomsnittet (vannrett) – ett punkt per øye. Gjennomsnittet brukes på den vannrette aksen fordi ingen av de to metodene er en fasit å måle avviket fra; deres eget snitt er det beste anslaget på den sanne verdien.

To tall oppsummerer plottet. Systematisk forskjell (bias) er middeldifferansen d¯ – hvor mye den ene metoden i snitt ligger over den andre. Samsvarsgrensene (limits of agreement, LoA) er

d¯±1.96⁢sd,

der sd er standardavviket til differansene. Er differansene tilnærmet normalfordelte, ligger om lag 95 % av dem innenfor disse grensene – så de forteller hvor stort avvik du kan vente for en enkelt pasient, ikke bare i snitt [193]. Faktoren 1.96 er igjen 95 %-dekningen fra normalfordelingen.

For Corvis ST mot Goldmann blir biasen d¯=−2.90 mmHg – Corvis ST leser i dette datasettet systematisk lavere, akkurat som den parede t-testen i seksjonen om inferens viste – og med sd=1.96 mmHg blir grensene [−6.74, 0.94] mmHg.

Bland-Altman-plott for Corvis ST mot Goldmann hos de 71 pasientene: differansen mot gjennomsnittet, med bias og de to samsvarsgrensene; legg merke til at skyen skrår oppover mot høyre.
Figur 13.11: Bland-Altman-plott for Corvis ST mot Goldmann hos de 71 pasientene: differansen mot gjennomsnittet, med bias og de to samsvarsgrensene; legg merke til at skyen skrår oppover mot høyre.

Nå ser du hva korrelasjonen skjulte. Instrumentene samvarierer sterkt (r=0.72), men Corvis ST leser i dette datasettet i snitt 2.9 mmHg lavere enn Goldmann, og for en enkelt pasient kan avviket ligge hvor som helst fra −6.7  til 0.9 mmHg. Om det er akseptabelt, er en klinisk avgjørelse, ikke en statistisk: et sprik på 3–4 mmHg kan flytte en pasient over eller under den grensen britisk nasjonal retningslinje bruker når trykket er forhøyet uten påvist glaukomskade – et ubehandlet trykk på 24 mmHg eller mer [187, punkt 1.4.4]; en Corvis-avlesning på 21 mmHg kan svare til en Goldmann-avlesning på 24. Poenget er at det er samsvarsgrensene, ikke korrelasjonen, som gir klinikeren grunnlaget for å bestemme det. Plottet er dessuten stedet der du oppdager en proporsjonal bias – at forskjellen endrer seg med trykknivået – ved å se etter en skråning i punktskyen i stedet for en vannrett sky. Her er den til stede: skyen skrår oppover, så forskjellen krymper (blir mindre negativ) ved høyere trykk, om lag 0.33 mmHg per mmHg i gjennomsnitt, og pasienten øverst til høyre (gjennomsnitt 20.35, differanse +3.3 mmHg) er den med det høyeste Goldmann-trykket. En fast bias på −2.9 beskriver derfor de lave trykkene bedre enn de høye – enda en grunn til å se på plottet, ikke bare på de to tallene.

R-kode

# Bland-Altman: samsvar mellom Corvis ST og Goldmann
d <- Corvis - GAT # differanse per pasient
cor(GAT, Corvis) # korrelasjon -- ser hoey ut
#> [1] 0.7203152
mean(d) # bias = middeldifferanse
#> [1] -2.9
sd(d) # s_d
#> [1] 1.957622
mean(d) + c(-1, 1) * 1.96 * sd(d) # samsvarsgrenser (LoA)
#> [1] -6.73694 0.93694

Eksempel 13.8.2

To tonometre måles mot hverandre på seks øyne. Differansene (instrument 2 − instrument 1, i mmHg) er 1,3,0,2,4,2. (a) Finn biasen. (b) Finn standardavviket til differansene. (c) Oppgi samsvarsgrensene. (d) Si i én setning hva grensene betyr klinisk.

Løsning: Vi regner middeldifferansen, standardavviket til differansene, og setter inn i d¯±1.96⁢sd. For (a): d¯=(1+3+0+2+4+2)/6=2.00 mmHg. For (b): avvikene fra 2 er −1,1,−2,0,2,0; summen av kvadratene er 10, og

sd=106−1=2≈1.41 mmHg.

For (c): 1.96⁢sd=1.96⋅1.41≈2.77, så grensene er

2.00±2.77≈[−0.77, 4.77]⁢mmHg.

For (d): instrument 2 leser i snitt 2 mmHg høyere, og for en enkelt pasient kan de to avvike med fra om lag −0.8 til +4.8 mmHg – klinikeren må avgjøre om et sprik på nær 5 mmHg er til å leve med.

Eksempel 13.8.3

En kollega regner ut fra metodedatasettet at korrelasjonen mellom Corvis ST og Goldmann er r=0.72 (p<0.001) og konkluderer at «instrumentene er utbyttbare». (a) Forklar hvorfor en sterk korrelasjon ikke støtter den konklusjonen. (b) Hvilke to tall fra Bland-Altman-analysen svarer på det kollegaen egentlig lurer på, og hva sier de? (c) Er instrumentene utbyttbare?

Løsning: Vi knytter sammen samvariasjon, systematisk forskjell og valget av metode. For (a): r=0.72 måler bare at instrumentene rangerer pasientene likt – høyt trykk hos den ene svarer stort sett til høyt hos den andre. Fordi Corvis ST systematisk leser om lag 2.9 mmHg lavere, følger den Goldmann oppover og får en sterk r, samtidig som de er uenige om nesten hver verdi. Korrelasjonen er ufølsom for en konstant forskyvning. For (b): biasen d¯=−2.90 mmHg og samsvarsgrensene [−6.74, 0.94] mmHg. Den første sier at Corvis ST i snitt leser 2.9 mmHg lavt; de to andre at avviket for en enkelt pasient kan bli nær 7 mmHg. For (c): nei – ikke uten videre. Et sprik på inntil 7 mmHg kan endre en klinisk beslutning, så instrumentene kan ikke uten videre erstatte hverandre; om biasen kan korrigeres for og grensene er akseptable, er en klinisk vurdering korrelasjonen aldri kunne gitt.

Ett tall for samsvar: ICC og kappa

Bland-Altman gir to tall og et bilde. Noen ganger vil du i stedet ha ett tall å rapportere, og da avhenger valget av datatypen.

For kontinuerlige mål brukes intraklassekorrelasjonen (ICC): andelen av den totale variasjonen som skyldes ekte forskjeller mellom pasienter snarere enn målefeil, som et tall mellom 0 og 1. I motsetning til Pearsons r straffer ICC en systematisk bias, så den kan ikke lures av det eksempelet over. En grov tolkning – en tommelfingerregel for å lese reliabilitetsstudier, ikke en validert standard – er at under 0.5 er dårlig, 0.5–0.75 moderat, 0.75–0.9 god og over 0.9 utmerket reliabilitet [194]. Grensene bør legges på 95 %-konfidensintervallet til ICC-estimatet og ikke på punktestimatet alene, for estimatet er bare en forventningsverdi for den sanne ICC-en. Ulike varianter av ICC (om en også korrigerer for observatør, om en måler absolutt samsvar eller bare konsistens) gir ulike tall, så hvilken variant du bruker, må alltid oppgis.

For kategoriske bedømminger – to graderes ja/nei-vurdering av det samme funnet – måler Cohens kappa enigheten korrigert for det som ville kommet av ren tilfeldighet:

κ=po−pe1−pe,

der po er den observerte andelen enighet og pe andelen enighet du ville forvente om de to gjettet uavhengig. Korreksjonen er poenget: når et funn er sjeldent, er de to nesten alltid enige om at det ikke er der, og en stor del av den rå enigheten er da tilfeldig. En vanlig referanseskala er Landis og Kochs: 0.21–0.40 rimelig, 0.41–0.60 moderat, 0.61–0.80 betydelig og over 0.81 nær perfekt [195]. Den hjelper tolkningen, men er en konvensjon, ikke en naturlov – og kappa presses ned av lav prevalens selv når enigheten er høy.

Analyseenhet: øyne eller pasienter?

En feil er så vanlig i optometrisk forskning at den fortjener sitt eget avsnitt: å telle øyne som om de var uavhengige. Husk fra den første seksjonen at analyseenheten må velges bevisst. Høyre og venstre øye hos den samme personen er som regel positivt korrelerte, så målinger fra begge øynene kan ikke slås sammen som om de var uavhengige [196, 197] – to øyne fra én person bærer mindre enn dobbelt så mye informasjon som ett. Behandler du 60 øyne fra 30 personer som n=60 uavhengige observasjoner, bryter du uavhengighetsforutsetningen som nesten alle testene i forrige seksjon hviler på. Følgen er konkret: standardfeilen undervurderes, konfidensintervallene blir kunstig smale og p-verdiene kunstig små [197] – du «finner» sammenhenger som ikke tåler et ærlig regnestykke. Løsningen er enten å analysere ett øye per person (gjerne tilfeldig valgt) eller å bruke en metode som modellerer korrelasjonen mellom øynene. Den riktige n-en er som regel antallet pasienter, ikke antallet øyne.

Å velge riktig analyse

Metodene fra forrige seksjon og denne kan settes opp mot spørsmålet hver av dem svarer på. Tavlen nedenfor er ikke en oppskrift å følge blindt, men en påminnelse om at metodevalget følger av formålet, datatypen og designet – hver rad peker tilbake til metoden slik den ble innført.

Spørsmålet du stiller Parametrisk metode Rangbasert alternativ Nøkkelforutsetning
Henger to kontinuerlige mål sammen? Pearson-korrelasjon / regresjon Spearmans ρ Lineær sammenheng, få uteliggere
Skiller to uavhengige grupper seg? Uparet t-test Mann-Whitney Normalfordeling (og lik varians)
Skiller to mål på samme enhet seg? Paret t-test Paret Wilcoxon Normalfordelte differanser
Skiller tre eller flere grupper seg? Enveis-ANOVA Kruskal-Wallis Normalfordeling, lik varians
Henger to kategoriske variabler sammen? Kji-kvadrat-test Fishers eksakte test Forventede celletall ≥5 i minst 80 % av cellene
Gir to metoder samme tallverdi? Bland-Altman (bias + grenser) – Normalfordelte differanser, uavhengige enheter

Å lese forskning med et kritisk blikk

Alt dette munner ut i den ferdigheten kapittelet ble til for: å lese en forskningsartikkel og se om tallene bærer konklusjonen. Du trenger ikke å regne noe på nytt for å gjøre det – du trenger å stille de riktige spørsmålene. En kort sjekkliste fanger de fleste:

  • •

    Spørsmål og design. Hva er forskningsspørsmålet, og er studien lagt opp til å svare på det? Er utvalget representativt, og er analyseenheten riktig – pasienter eller øyne?

  • •

    Metode mot data. Passer den statistiske metoden til datatypen og designet? Er samsvar undersøkt med Bland-Altman eller ICC der det trengs, i stedet for med en korrelasjon?

  • •

    Effekt, ikke bare p. Rapporteres en effektstørrelse og et konfidensintervall ved siden av p-verdien, så du ser hvor stor og hvor presis forskjellen er?

  • •

    Hvor mange tester? Hvor mange hypoteser ble prøvd, og støtter konklusjonen seg på én som «tilfeldigvis» ble signifikant?

  • •

    Skjevhet og konfundering. Kunne utvalget vært skjevt valgt eller skjevt målt? Finnes en tredje variabel som henger sammen med både den antatte årsaken og virkningen – hornhinnetykkelsen bak en forskjell i avlest trykk, for eksempel – og er det i så fall justert for den?

  • •

    Konklusjonen mot dataene. Sier funnene faktisk det forfatteren hevder, eller er en korrelasjon fremstilt som en årsak?

To av fallgruvene er verdt å utdype. Den første er multiplisitet. Tester du mange hypoteser samtidig, stiger sjansen for minst én falsk positiv. Med 20 uavhengige tester der alle nullhypoteser i virkeligheten er sanne og α=0.05, er det forventede antallet falske alarmer 20⋅0.05=1, og sannsynligheten for minst én er 1−0.9520≈0.64. Den enkleste motgiften er Bonferroni-idéen: deler du signifikansnivået på antall tester (0.05/20=0.0025) og krever den strengere grensen, holder du den samlede feilraten nede. Den er konservativ, men lett å forstå og lett å be om. Den andre er p-fisking: å prøve mange analyser, undergrupper eller utfallsmål og bare rapportere dem som ble signifikante – eller å formulere hypotesen etter at dataene er sett. Da mister p-verdien sin mening, for den forutsetter én forhåndsbestemt test. Forsvaret er å skille den bekreftende analysen (bestemt på forhånd) fra den utforskende (som leter etter hypoteser å teste siden), og å rapportere alt som ble gjort, ikke bare det som slo ut.

Og over det hele hviler skillet fra seksjonen om inferens: statistisk signifikans er ikke det samme som klinisk betydning. Et stort nok utvalg gjør selv en forskjell på 0.3 mmHg «signifikant»; et lite utvalg kan la en klinisk viktig forskjell forbli upåvist. Det er derfor effektstørrelsen og konfidensintervallet, ikke p-verdien alene, som avgjør om et resultat betyr noe for en pasient.

Oppgaver

Oppgave 13.8.1

To keratometre måler gjennomsnittlig hornhinnekrumning (i D) på åtte pasienter. Differansene manuell − automatisk er 0.25, 0.50, 0.00, 0.50, 0.25, 0.25, 0.50, 0.50.

  1. a)

    Regn ut biasen (middeldifferansen).

  2. b)

    Regn ut standardavviket sd til differansene.

  3. c)

    Oppgi de nedre og øvre samsvarsgrensene, d¯±1.96⁢sd.

  4. d)

    Forklar i én setning hva grensene betyr for en kliniker som vurderer om de to instrumentene kan brukes om hverandre.

Løsningsforslag

Oppgave 13.8.1: Samme oppsett som i eksempelet med de to tonometrene: middeldifferanse, standardavvik til differansene, og d¯±1.96⁢sd.

  1. a)

    Summen av differansene er 3⋅0.25+4⋅0.50+0.00=2.75, så d¯=2.75/8=0.34375≈0.34 D.

  2. b)

    Avvikene fra d¯ er −0.09375 (tre ganger), 0.15625 (fire ganger) og −0.34375 (én gang); summen av kvadratene er 0.2422, og

    sd=0.24228−1≈0.19 D.
  3. c)

    1.96⁢sd≈1.96⋅0.186=0.36, så grensene er

    0.344±0.365≈[−0.02, 0.71]⁢D.
  4. d)

    Det manuelle keratometeret leser i snitt 0.34 D høyere, og for en enkelt pasient kan avviket bli opp mot 0.7 D – nesten tre styrketrinn à 0.25 D – så klinikeren må avgjøre om et så stort sprik er akseptabelt før instrumentene brukes om hverandre.

Oppgave 13.8.2

To optometrister vurderer uavhengig 50 synsnervepapiller som «glaukommistanke» (ja/nei). Begge svarer ja for 12, begge nei for 31; i 4 tilfeller sier A ja mens B sier nei, og i 3 tilfeller sier A nei mens B sier ja.

  1. a)

    Regn ut den rå prosentenigheten po.

  2. b)

    Regn ut den forventede enigheten pe og deretter Cohens κ=(po−pe)/(1−pe).

  3. c)

    Forklar hvorfor de to tallene gir så ulikt inntrykk, og hvilket du ville rapportert.

Løsningsforslag

Oppgave 13.8.2: Vi setter opp de fire cellene (12 ja/ja, 31 nei/nei, 4 A-ja/B-nei, 3 A-nei/B-ja; n=50) og bruker κ=(po−pe)/(1−pe).

  1. a)

    po=(12+31)/50=43/50=0.86.

  2. b)

    A sier ja i 16/50=0.32 av tilfellene, B i 15/50=0.30. Den forventede enigheten ved uavhengig gjetting er

    pe=0.32⋅0.30+0.68⋅0.70=0.096+0.476=0.572,

    så

    κ=0.86−0.5721−0.572=0.2880.428≈0.67.
  3. c)

    Den rå enigheten på 86 % ser imponerende ut, men 57 prosentpoeng av den ville kommet av ren tilfeldighet – begge sier oftest nei, så de er «enige» om de fleste papillene uansett. Kappa måler bare enigheten ut over dette og lander på 0.67, betydelig men ikke nær perfekt etter referanseskalaen. Rapporter κ – gjerne med po ved siden av – siden den ikke lar seg blåse opp av tilfeldig enighet.

Oppgave 13.8.3

En forsker måler 25 utfallsvariabler mellom to grupper og kjører 25 uavhengige hypotesetester på nivå α=0.05. Anta at alle 25 nullhypotesene i virkeligheten er sanne.

  1. a)

    Hvor mange falske positive forventer man i snitt?

  2. b)

    Sannsynligheten for minst én falsk positiv er 1−0.9525≈0.72. Bruk dette til å forklare hvorfor ett funn med p=0.03 ikke uten videre er en oppdagelse.

  3. c)

    Hvilket per-test-nivå gir Bonferroni-idéen her, og holder funnet med p=0.03 etter den korreksjonen?

Løsningsforslag

Oppgave 13.8.3: Multiplisitetsregnestykket fra brødteksten, med 25 tester i stedet for 20.

  1. a)

    Forventet antall falske positive er 25⋅0.05=1.25.

  2. b)

    Når alle nullhypotesene er sanne, gir de 25 testene minst én falsk positiv med sannsynlighet om lag 0.72 – det er altså mer sannsynlig enn ikke at noe slår ut ved ren tilfeldighet. Ett enkeltfunn med p=0.03 er nøyaktig det mønsteret man da venter å se, og kan derfor ikke uten videre kalles en oppdagelse.

  3. c)

    Bonferroni-idéen gir per-test-nivået 0.05/25=0.002, og siden 0.03>0.002 holder funnet ikke etter korreksjonen.

Oppgave 13.8.4

Les følgende sammendrag kritisk: «Vi målte trykket på begge øyne hos 40 pasienter (80 øyne) med et nytt tonometer og med Goldmann. Instrumentene korrelerte sterkt (r=0.93, p<0.001), og forskjellen i gjennomsnittstrykk mellom instrumentene var ikke signifikant (p=0.21). Vi konkluderer med at det nye tonometeret trygt kan erstatte Goldmann.»

  1. a)

    Pek ut minst tre metodiske eller statistiske svakheter i resonnementet.

  2. b)

    Forklar særskilt hvorfor en ikke-signifikant forskjell ikke er et bevis for at metodene er like.

  3. c)

    Skriv om konklusjonen slik den burde ha vært formulert med de opplysningene som faktisk er gitt.

Løsningsforslag

Oppgave 13.8.4: Vi holder sammendraget opp mot sjekklisten i seksjonen.

  1. a)

    Tre svakheter: (1) Analyseenheten er gal – 80 øyne fra 40 pasienter behandles som n=80 uavhengige observasjoner, men høyre og venstre øye hos samme person er som regel positivt korrelerte, så standardfeilen undervurderes og p-verdiene blir kunstig små. (2) Korrelasjon brukes som bevis for samsvar – r=0.93 viser bare at instrumentene rangerer pasientene likt; en konstant forskyvning ville gitt like høy r, og ingen Bland-Altman-analyse med bias og samsvarsgrenser er rapportert. (3) «Ikke signifikant» tolkes som «like» – p=0.21 er fravær av bevis for en forskjell, ikke bevis for at forskjellen er null. Dessuten sies ingenting om hvor store avvik en enkelt pasient kan få.

  2. b)

    p=0.21 betyr bare at dataene ikke gir grunnlag for å forkaste nullhypotesen om lik middelverdi – det kan like gjerne skyldes for lite utvalg eller stor spredning som en reelt liten forskjell. Og selv med bias nær null kan samsvarsgrensene være vide, slik at enkeltpasienter får klinisk viktige avvik – kapittelets eget berøringsfrie tonometer mot Goldmann er nettopp et slikt tilfelle (p=0.20, men samsvarsgrenser på om lag −4.0 til 3.4 mmHg); å vise at metodene er utbyttbare krever at hele det aktuelle avviksområdet ligger innenfor en forhåndsbestemt klinisk akseptgrense, ikke at én test lot være å slå ut.

  3. c)

    For eksempel: «Det nye tonometeret samvarierer sterkt med Goldmann (r=0.93), og vi fant ingen signifikant forskjell i gjennomsnittstrykk (p=0.21). Om instrumentene samsvarer godt nok til å brukes om hverandre, kan disse tallene ikke avgjøre: det krever en Bland-Altman-analyse med bias og samsvarsgrenser, basert på ett øye per pasient eller en analyse som tar hensyn til korrelasjonen mellom øynene, vurdert mot en klinisk akseptgrense.»

Konklusjon: sammendragets tall bærer ikke konklusjonen; utbyttbarhet må vises med samsvarsanalyse på riktig analyseenhet.

Alle løsningsforslag til kapittel 13