Kapittel 13 · Statistikk · 13.8
Metodesamsvar, reliabilitet og kritisk lesing
Denne siste seksjonen samler trådene, og som alltid begynner den med spørsmålet hva vil du oppnå? Nå er formålet et litt annet enn i de foregående. Du vil ikke lenger bare beskrive, sammenligne eller forklare – du vil vite om et måleverktøy er til å stole på: gir det samme svar når du gjentar målingen, gir to instrumenter samme svar på det samme øyet, og er to graderes vurdering av det samme bildet enige? Og til slutt vil du kunne snu blikket utover, mot en publisert studie, og avgjøre om tallene den bygger på faktisk bærer konklusjonen den trekker. De to spørsmålene henger sammen: den som forstår hva som skal til for at en måling er pålitelig, ser også raskt hvor en artikkel svikter.
Repeterbarhet og reproduserbarhet
To beslektede begreper skiller hvordan en måling kan gjenta seg selv. Repeterbarhet er samsvaret mellom gjentatte målinger under så like forhold som mulig – samme instrument, samme observatør, samme pasient, kort tid mellom målingene. Den fanger den rene tilfeldige variasjonen i selve målehandlingen. Reproduserbarhet er samsvaret når forholdene varierer systematisk – ulike observatører, ulike instrumenter, ulike dager eller klinikker. Den er alltid dårligere enn repeterbarheten, fordi den slipper til flere kilder til variasjon. Legg merke til at begge tallfestes gjennom spredningen i gjentakene, ikke gjennom en korrelasjon. Det er et poeng vi kommer tilbake til med en gang.
Metodedatasettet vi bruker gjennom seksjonen, er trykkolonnene fra klinikkdatasettet: de 71 høyre øynene målt samme dag med Goldmann (GAT), berøringsfritt tonometer (NCT) og Corvis ST (ukorrigert Corvis og biomekanisk korrigert bIOP) [181]. Tabell 13.3 viser de tolv første; hele settet står i Tillegg A, der GAT bare er et nytt navn på IOP-kolonnen. Datasettet har ingen gjentak å regne på – fila har én verdi per instrument per øye – så repeterbarheten til ett instrument kan vi ikke måle her. Reproduserbarheten på tvers av to instrumenter kan vi. Vi tar NCT mot GAT, som i snitt leser omtrent likt: for hvert øye er differansen NCT GAT uten fast fortegn, og middeldifferansen er bare , nær null og ikke signifikant ( i den parede t-testen fra forrige seksjon). Det som betyr noe, er hvor mye de to spriker tilfeldig fra øye til øye. Det tallfestes med innen-individ-standardavviket (within-subject SD) , som her er . Ut fra det defineres en koeffisient: to avlesninger på det samme øyet forventes å avvike mindre enn
i av tilfellene [192]. Er de to avlesningene gjort med det samme instrumentet, kalles tallet repeterbarhetskoeffisienten; er de gjort med to ulike instrumenter, som her, reproduserbarhetskoeffisienten – samme formel, hvert sitt begrep. Faktoren er den samme som ga -dekningen i normalfordelingen (husk 68–95–99.7-regelen fra seksjonen om fordelinger), og kommer av at en differanse mellom to like usikre målinger har ganger så stor spredning som én måling. Her blir koeffisienten : en NCT- og en Goldmann-avlesning på samme øye ligger med sannsynlighet nærmere hverandre enn . Er de lenger fra hverandre, er det mer enn tilfeldig måletukling – noe ved øyet eller målingen skiller seg ut. Formelen for forutsetter at det ikke er noen systematisk forskjell mellom de to avlesningene; finnes det en, blåser den opp. Her er biasen liten mot spredningen i differansene (), så og er nesten like, og forutsetningen holder godt nok.
| id | GAT () | NCT () | Corvis () | bIOP () |
|---|---|---|---|---|
| 1 | 16.0 | 18 | 17.0 | 16.0 |
| 2 | 11.3 | 12 | 8.3 | 8.7 |
| 3 | 15.0 | 17 | 13.7 | 14.1 |
| 4 | 16.0 | 16 | 14.5 | 13.4 |
| 5 | 11.0 | 10 | 7.2 | 8.8 |
| 6 | 11.3 | 12 | 10.0 | 9.6 |
| 7 | 15.0 | 15 | 12.0 | 11.3 |
| 8 | 10.0 | 9 | 8.5 | 9.3 |
| 9 | 16.0 | 20 | 15.7 | 15.2 |
| 10 | 17.0 | 16 | 11.7 | 10.4 |
| 11 | 12.0 | 12 | 8.5 | 8.3 |
| 12 | 14.0 | 13 | 9.7 | 9.9 |
R-kode
Eksempel 13.8.1
Et keratometer måler hornhinnekrumningen på det samme øyet to ganger hos en rekke pasienter, og innen-individ-standardavviket blir . Hvor mye kan to gjentatte avlesninger på det samme øyet forventes å avvike i av tilfellene?
Løsning: Samme instrument, gjentatt – dette er repeterbarhet, og vi setter inn i repeterbarhetskoeffisienten .
To krumningsavlesninger på samme øye bør altså ligge nærmere hverandre enn omtrent ; et større sprik tyder på at noe utenom den rene måleusikkerheten har endret seg.
Samsvar er ikke samvariasjon
Nå til det egentlige spørsmålet, stilt til det tredje instrumentet: gir Corvis ST og Goldmann samme trykk? Det er fristende å svare med en korrelasjon, og gjør du det, ser svaret oppmuntrende ut – Pearsons mellom Corvis ST og Goldmann er , etter holdepunktene fra forrige seksjon en sterk sammenheng (). Men her er korrelasjonen feil verktøy, og forskjellen er kapittelets siste store poeng.
Samvariasjon – det korrelasjonen måler – er om de to instrumentene rangerer pasientene likt: om et øye som Corvis ST finner høyt, også er høyt hos Goldmann. Samsvar er noe strengere: om de gir samme tallverdi. De to er ikke det samme. Tenk deg et instrument som alltid leser nøyaktig for lavt. Det følger det andre instrumentet perfekt oppover – høyt der det andre er høyt, lavt der det er lavt – så blir nær . Likevel er de to systematisk uenige om hver eneste verdi. Korrelasjonen er blind for en slik konstant forskyvning, og den blåses dessuten opp av et bredt måleområde: jo mer trykkene spriker mellom pasientene, desto større blir nesten uansett hvor godt instrumentene samsvarer. En høy korrelasjon er derfor ikke et bevis på at to metoder kan brukes om hverandre.
Bland-Altman-analyse
Verktøyet som faktisk svarer på samsvarsspørsmålet, er Bland-Altman-analysen. Ideen er enkel og direkte: se på forskjellen mellom de to metodene, ikke på hvordan de rangerer. For hvert øye regner du differansen mellom metodene og gjennomsnittet av dem:
Så plotter du differansen (loddrett) mot gjennomsnittet (vannrett) – ett punkt per øye. Gjennomsnittet brukes på den vannrette aksen fordi ingen av de to metodene er en fasit å måle avviket fra; deres eget snitt er det beste anslaget på den sanne verdien.
To tall oppsummerer plottet. Systematisk forskjell (bias) er middeldifferansen – hvor mye den ene metoden i snitt ligger over den andre. Samsvarsgrensene (limits of agreement, LoA) er
der er standardavviket til differansene. Er differansene tilnærmet normalfordelte, ligger om lag av dem innenfor disse grensene – så de forteller hvor stort avvik du kan vente for en enkelt pasient, ikke bare i snitt [193]. Faktoren er igjen -dekningen fra normalfordelingen.
For Corvis ST mot Goldmann blir biasen – Corvis ST leser i dette datasettet systematisk lavere, akkurat som den parede t-testen i seksjonen om inferens viste – og med blir grensene .
Nå ser du hva korrelasjonen skjulte. Instrumentene samvarierer sterkt (), men Corvis ST leser i dette datasettet i snitt lavere enn Goldmann, og for en enkelt pasient kan avviket ligge hvor som helst fra til . Om det er akseptabelt, er en klinisk avgjørelse, ikke en statistisk: et sprik på – kan flytte en pasient over eller under den grensen britisk nasjonal retningslinje bruker når trykket er forhøyet uten påvist glaukomskade – et ubehandlet trykk på eller mer [187, punkt 1.4.4]; en Corvis-avlesning på kan svare til en Goldmann-avlesning på . Poenget er at det er samsvarsgrensene, ikke korrelasjonen, som gir klinikeren grunnlaget for å bestemme det. Plottet er dessuten stedet der du oppdager en proporsjonal bias – at forskjellen endrer seg med trykknivået – ved å se etter en skråning i punktskyen i stedet for en vannrett sky. Her er den til stede: skyen skrår oppover, så forskjellen krymper (blir mindre negativ) ved høyere trykk, om lag per i gjennomsnitt, og pasienten øverst til høyre (gjennomsnitt , differanse ) er den med det høyeste Goldmann-trykket. En fast bias på beskriver derfor de lave trykkene bedre enn de høye – enda en grunn til å se på plottet, ikke bare på de to tallene.
R-kode
Eksempel 13.8.2
To tonometre måles mot hverandre på seks øyne. Differansene (instrument 2 instrument 1, i ) er . (a) Finn biasen. (b) Finn standardavviket til differansene. (c) Oppgi samsvarsgrensene. (d) Si i én setning hva grensene betyr klinisk.
Løsning: Vi regner middeldifferansen, standardavviket til differansene, og setter inn i . For (a): . For (b): avvikene fra er ; summen av kvadratene er , og
For (c): , så grensene er
For (d): instrument 2 leser i snitt høyere, og for en enkelt pasient kan de to avvike med fra om lag til – klinikeren må avgjøre om et sprik på nær er til å leve med.
Eksempel 13.8.3
En kollega regner ut fra metodedatasettet at korrelasjonen mellom Corvis ST og Goldmann er () og konkluderer at «instrumentene er utbyttbare». (a) Forklar hvorfor en sterk korrelasjon ikke støtter den konklusjonen. (b) Hvilke to tall fra Bland-Altman-analysen svarer på det kollegaen egentlig lurer på, og hva sier de? (c) Er instrumentene utbyttbare?
Løsning: Vi knytter sammen samvariasjon, systematisk forskjell og valget av metode. For (a): måler bare at instrumentene rangerer pasientene likt – høyt trykk hos den ene svarer stort sett til høyt hos den andre. Fordi Corvis ST systematisk leser om lag lavere, følger den Goldmann oppover og får en sterk , samtidig som de er uenige om nesten hver verdi. Korrelasjonen er ufølsom for en konstant forskyvning. For (b): biasen og samsvarsgrensene . Den første sier at Corvis ST i snitt leser lavt; de to andre at avviket for en enkelt pasient kan bli nær . For (c): nei – ikke uten videre. Et sprik på inntil kan endre en klinisk beslutning, så instrumentene kan ikke uten videre erstatte hverandre; om biasen kan korrigeres for og grensene er akseptable, er en klinisk vurdering korrelasjonen aldri kunne gitt.
Ett tall for samsvar: ICC og kappa
Bland-Altman gir to tall og et bilde. Noen ganger vil du i stedet ha ett tall å rapportere, og da avhenger valget av datatypen.
For kontinuerlige mål brukes intraklassekorrelasjonen (ICC): andelen av den totale variasjonen som skyldes ekte forskjeller mellom pasienter snarere enn målefeil, som et tall mellom og . I motsetning til Pearsons straffer ICC en systematisk bias, så den kan ikke lures av det eksempelet over. En grov tolkning – en tommelfingerregel for å lese reliabilitetsstudier, ikke en validert standard – er at under er dårlig, – moderat, – god og over utmerket reliabilitet [194]. Grensene bør legges på -konfidensintervallet til ICC-estimatet og ikke på punktestimatet alene, for estimatet er bare en forventningsverdi for den sanne ICC-en. Ulike varianter av ICC (om en også korrigerer for observatør, om en måler absolutt samsvar eller bare konsistens) gir ulike tall, så hvilken variant du bruker, må alltid oppgis.
For kategoriske bedømminger – to graderes ja/nei-vurdering av det samme funnet – måler Cohens kappa enigheten korrigert for det som ville kommet av ren tilfeldighet:
der er den observerte andelen enighet og andelen enighet du ville forvente om de to gjettet uavhengig. Korreksjonen er poenget: når et funn er sjeldent, er de to nesten alltid enige om at det ikke er der, og en stor del av den rå enigheten er da tilfeldig. En vanlig referanseskala er Landis og Kochs: – rimelig, – moderat, – betydelig og over nær perfekt [195]. Den hjelper tolkningen, men er en konvensjon, ikke en naturlov – og kappa presses ned av lav prevalens selv når enigheten er høy.
Analyseenhet: øyne eller pasienter?
En feil er så vanlig i optometrisk forskning at den fortjener sitt eget avsnitt: å telle øyne som om de var uavhengige. Husk fra den første seksjonen at analyseenheten må velges bevisst. Høyre og venstre øye hos den samme personen er som regel positivt korrelerte, så målinger fra begge øynene kan ikke slås sammen som om de var uavhengige [196, 197] – to øyne fra én person bærer mindre enn dobbelt så mye informasjon som ett. Behandler du 60 øyne fra 30 personer som uavhengige observasjoner, bryter du uavhengighetsforutsetningen som nesten alle testene i forrige seksjon hviler på. Følgen er konkret: standardfeilen undervurderes, konfidensintervallene blir kunstig smale og p-verdiene kunstig små [197] – du «finner» sammenhenger som ikke tåler et ærlig regnestykke. Løsningen er enten å analysere ett øye per person (gjerne tilfeldig valgt) eller å bruke en metode som modellerer korrelasjonen mellom øynene. Den riktige -en er som regel antallet pasienter, ikke antallet øyne.
Å velge riktig analyse
Metodene fra forrige seksjon og denne kan settes opp mot spørsmålet hver av dem svarer på. Tavlen nedenfor er ikke en oppskrift å følge blindt, men en påminnelse om at metodevalget følger av formålet, datatypen og designet – hver rad peker tilbake til metoden slik den ble innført.
| Spørsmålet du stiller | Parametrisk metode | Rangbasert alternativ | Nøkkelforutsetning |
|---|---|---|---|
| Henger to kontinuerlige mål sammen? | Pearson-korrelasjon / regresjon | Spearmans | Lineær sammenheng, få uteliggere |
| Skiller to uavhengige grupper seg? | Uparet t-test | Mann-Whitney | Normalfordeling (og lik varians) |
| Skiller to mål på samme enhet seg? | Paret t-test | Paret Wilcoxon | Normalfordelte differanser |
| Skiller tre eller flere grupper seg? | Enveis-ANOVA | Kruskal-Wallis | Normalfordeling, lik varians |
| Henger to kategoriske variabler sammen? | Kji-kvadrat-test | Fishers eksakte test | Forventede celletall i minst av cellene |
| Gir to metoder samme tallverdi? | Bland-Altman (bias + grenser) | – | Normalfordelte differanser, uavhengige enheter |
Å lese forskning med et kritisk blikk
Alt dette munner ut i den ferdigheten kapittelet ble til for: å lese en forskningsartikkel og se om tallene bærer konklusjonen. Du trenger ikke å regne noe på nytt for å gjøre det – du trenger å stille de riktige spørsmålene. En kort sjekkliste fanger de fleste:
-
•
Spørsmål og design. Hva er forskningsspørsmålet, og er studien lagt opp til å svare på det? Er utvalget representativt, og er analyseenheten riktig – pasienter eller øyne?
-
•
Metode mot data. Passer den statistiske metoden til datatypen og designet? Er samsvar undersøkt med Bland-Altman eller ICC der det trengs, i stedet for med en korrelasjon?
-
•
Effekt, ikke bare p. Rapporteres en effektstørrelse og et konfidensintervall ved siden av p-verdien, så du ser hvor stor og hvor presis forskjellen er?
-
•
Hvor mange tester? Hvor mange hypoteser ble prøvd, og støtter konklusjonen seg på én som «tilfeldigvis» ble signifikant?
-
•
Skjevhet og konfundering. Kunne utvalget vært skjevt valgt eller skjevt målt? Finnes en tredje variabel som henger sammen med både den antatte årsaken og virkningen – hornhinnetykkelsen bak en forskjell i avlest trykk, for eksempel – og er det i så fall justert for den?
-
•
Konklusjonen mot dataene. Sier funnene faktisk det forfatteren hevder, eller er en korrelasjon fremstilt som en årsak?
To av fallgruvene er verdt å utdype. Den første er multiplisitet. Tester du mange hypoteser samtidig, stiger sjansen for minst én falsk positiv. Med uavhengige tester der alle nullhypoteser i virkeligheten er sanne og , er det forventede antallet falske alarmer , og sannsynligheten for minst én er . Den enkleste motgiften er Bonferroni-idéen: deler du signifikansnivået på antall tester () og krever den strengere grensen, holder du den samlede feilraten nede. Den er konservativ, men lett å forstå og lett å be om. Den andre er p-fisking: å prøve mange analyser, undergrupper eller utfallsmål og bare rapportere dem som ble signifikante – eller å formulere hypotesen etter at dataene er sett. Da mister p-verdien sin mening, for den forutsetter én forhåndsbestemt test. Forsvaret er å skille den bekreftende analysen (bestemt på forhånd) fra den utforskende (som leter etter hypoteser å teste siden), og å rapportere alt som ble gjort, ikke bare det som slo ut.
Og over det hele hviler skillet fra seksjonen om inferens: statistisk signifikans er ikke det samme som klinisk betydning. Et stort nok utvalg gjør selv en forskjell på «signifikant»; et lite utvalg kan la en klinisk viktig forskjell forbli upåvist. Det er derfor effektstørrelsen og konfidensintervallet, ikke p-verdien alene, som avgjør om et resultat betyr noe for en pasient.
Oppgaver
Oppgave 13.8.1
To keratometre måler gjennomsnittlig hornhinnekrumning (i ) på åtte pasienter. Differansene manuell automatisk er .
-
a)
Regn ut biasen (middeldifferansen).
-
b)
Regn ut standardavviket til differansene.
-
c)
Oppgi de nedre og øvre samsvarsgrensene, .
-
d)
Forklar i én setning hva grensene betyr for en kliniker som vurderer om de to instrumentene kan brukes om hverandre.
Løsningsforslag
Oppgave 13.8.1: Samme oppsett som i eksempelet med de to tonometrene: middeldifferanse, standardavvik til differansene, og .
-
a)
Summen av differansene er , så .
-
b)
Avvikene fra er (tre ganger), (fire ganger) og (én gang); summen av kvadratene er , og
-
c)
, så grensene er
-
d)
Det manuelle keratometeret leser i snitt høyere, og for en enkelt pasient kan avviket bli opp mot – nesten tre styrketrinn à – så klinikeren må avgjøre om et så stort sprik er akseptabelt før instrumentene brukes om hverandre.
Oppgave 13.8.2
To optometrister vurderer uavhengig synsnervepapiller som «glaukommistanke» (ja/nei). Begge svarer ja for , begge nei for ; i tilfeller sier A ja mens B sier nei, og i tilfeller sier A nei mens B sier ja.
-
a)
Regn ut den rå prosentenigheten .
-
b)
Regn ut den forventede enigheten og deretter Cohens .
-
c)
Forklar hvorfor de to tallene gir så ulikt inntrykk, og hvilket du ville rapportert.
Løsningsforslag
Oppgave 13.8.2: Vi setter opp de fire cellene ( ja/ja, nei/nei, A-ja/B-nei, A-nei/B-ja; ) og bruker .
-
a)
.
-
b)
A sier ja i av tilfellene, B i . Den forventede enigheten ved uavhengig gjetting er
så
-
c)
Den rå enigheten på ser imponerende ut, men prosentpoeng av den ville kommet av ren tilfeldighet – begge sier oftest nei, så de er «enige» om de fleste papillene uansett. Kappa måler bare enigheten ut over dette og lander på , betydelig men ikke nær perfekt etter referanseskalaen. Rapporter – gjerne med ved siden av – siden den ikke lar seg blåse opp av tilfeldig enighet.
Oppgave 13.8.3
En forsker måler utfallsvariabler mellom to grupper og kjører uavhengige hypotesetester på nivå . Anta at alle nullhypotesene i virkeligheten er sanne.
-
a)
Hvor mange falske positive forventer man i snitt?
-
b)
Sannsynligheten for minst én falsk positiv er . Bruk dette til å forklare hvorfor ett funn med ikke uten videre er en oppdagelse.
-
c)
Hvilket per-test-nivå gir Bonferroni-idéen her, og holder funnet med etter den korreksjonen?
Løsningsforslag
Oppgave 13.8.3: Multiplisitetsregnestykket fra brødteksten, med tester i stedet for .
-
a)
Forventet antall falske positive er .
-
b)
Når alle nullhypotesene er sanne, gir de testene minst én falsk positiv med sannsynlighet om lag – det er altså mer sannsynlig enn ikke at noe slår ut ved ren tilfeldighet. Ett enkeltfunn med er nøyaktig det mønsteret man da venter å se, og kan derfor ikke uten videre kalles en oppdagelse.
-
c)
Bonferroni-idéen gir per-test-nivået , og siden holder funnet ikke etter korreksjonen.
Oppgave 13.8.4
Les følgende sammendrag kritisk: «Vi målte trykket på begge øyne hos pasienter ( øyne) med et nytt tonometer og med Goldmann. Instrumentene korrelerte sterkt (, ), og forskjellen i gjennomsnittstrykk mellom instrumentene var ikke signifikant (). Vi konkluderer med at det nye tonometeret trygt kan erstatte Goldmann.»
-
a)
Pek ut minst tre metodiske eller statistiske svakheter i resonnementet.
-
b)
Forklar særskilt hvorfor en ikke-signifikant forskjell ikke er et bevis for at metodene er like.
-
c)
Skriv om konklusjonen slik den burde ha vært formulert med de opplysningene som faktisk er gitt.
Løsningsforslag
Oppgave 13.8.4: Vi holder sammendraget opp mot sjekklisten i seksjonen.
-
a)
Tre svakheter: (1) Analyseenheten er gal – øyne fra pasienter behandles som uavhengige observasjoner, men høyre og venstre øye hos samme person er som regel positivt korrelerte, så standardfeilen undervurderes og p-verdiene blir kunstig små. (2) Korrelasjon brukes som bevis for samsvar – viser bare at instrumentene rangerer pasientene likt; en konstant forskyvning ville gitt like høy , og ingen Bland-Altman-analyse med bias og samsvarsgrenser er rapportert. (3) «Ikke signifikant» tolkes som «like» – er fravær av bevis for en forskjell, ikke bevis for at forskjellen er null. Dessuten sies ingenting om hvor store avvik en enkelt pasient kan få.
-
b)
betyr bare at dataene ikke gir grunnlag for å forkaste nullhypotesen om lik middelverdi – det kan like gjerne skyldes for lite utvalg eller stor spredning som en reelt liten forskjell. Og selv med bias nær null kan samsvarsgrensene være vide, slik at enkeltpasienter får klinisk viktige avvik – kapittelets eget berøringsfrie tonometer mot Goldmann er nettopp et slikt tilfelle (, men samsvarsgrenser på om lag til ); å vise at metodene er utbyttbare krever at hele det aktuelle avviksområdet ligger innenfor en forhåndsbestemt klinisk akseptgrense, ikke at én test lot være å slå ut.
-
c)
For eksempel: «Det nye tonometeret samvarierer sterkt med Goldmann (), og vi fant ingen signifikant forskjell i gjennomsnittstrykk (). Om instrumentene samsvarer godt nok til å brukes om hverandre, kan disse tallene ikke avgjøre: det krever en Bland-Altman-analyse med bias og samsvarsgrenser, basert på ett øye per pasient eller en analyse som tar hensyn til korrelasjonen mellom øynene, vurdert mot en klinisk akseptgrense.»
Konklusjon: sammendragets tall bærer ikke konklusjonen; utbyttbarhet må vises med samsvarsanalyse på riktig analyseenhet.