Hopp til innholdet

Kapittel 13 · Statistikk · 13.7

Statistiske analyser: å velge og tolke metoden

Nå er verktøykassen ferdig, og spørsmålet blir hvilket verktøy du skal ta opp. Som alltid begynner du ikke med metoden, men med formålet: hva vil du oppnå? Denne seksjonen dekker de to formålene forrige seksjon ennå ikke har gjort til metode – å sammenligne grupper eller betingelser, og å forklare eller predikere en sammenheng. Valget av analyse følger nesten mekanisk av to spørsmål: hva slags spørsmål stiller du (leter du etter samvariasjon, en forskjell mellom grupper, en sammenheng du vil tallfeste, eller en assosiasjon mellom kategorier?), og hva slags data har du (kontinuerlige, ordinale eller kategoriske; parede eller uparede; to grupper eller flere?). For hver metode oppgir vi regneteknikken og motiverer den, men den faktiske utregningen overlater vi til R – forståelsen av hva testen svarer på, og under hvilke forutsetninger, er det bærende. Den siste seksjonen samler alt dette i en beslutningstavle; her møter du metodene én etter én.

Samvariasjon mellom to kontinuerlige variabler: korrelasjon

Det første formålet er å måle om to kontinuerlige variabler varierer sammen – om høye verdier av den ene følges av høye (eller lave) verdier av den andre. Spørsmålet er ikke om den ene forårsaker den andre, bare om de henger sammen tallmessig, og hvor sterkt.

Målet på dette er Pearsons korrelasjonskoeffisient r. Den bygger på de samme kvadrat- og kryssummene som spredningen i forrige seksjon. Skriv

Sx⁢y=∑i=1n(xi−x¯)⁢(yi−y¯),Sx⁢x=∑i=1n(xi−x¯)2,Sy⁢y=∑i=1n(yi−y¯)2,

der Sx⁢x og Sy⁢y er de kjente kvadratsummene og Sx⁢y er kryssproduktsummen. Da er

r=Sx⁢ySx⁢x⁢Sy⁢y.

Telleren fanger fortegnet: et punkt over gjennomsnittet på begge variablene (eller under på begge) gir et positivt bidrag, et punkt som ligger høyt på den ene og lavt på den andre et negativt. Nevneren normerer, slik at r alltid ligger mellom −1 og +1. Verdien r=+1 betyr at alle punktene ligger på en stigende rett linje, r=−1 på en synkende, og r=0 at det ikke finnes noen lineær sammenheng. To ting følger av at r måler nettopp lineær samvariasjon: den ser ikke krumme mønstre (to variabler kan henge tett sammen langs en bue og likevel gi r nær 0), og den er følsom for enkeltstående uteliggere som kan trekke linja mot seg. Som grove holdepunkter – også her konvensjoner Cohen satte skjønnsmessig – regnes |r|≈0.1 som en svak sammenheng, 0.3 som moderat og 0.5 som sterk [189, tab. 1, s. 157].

Det er lett å lese mer inn i r enn tallet bærer, og et enkelt kvadrat holder tolkningen ærlig. Determinasjonskoeffisienten r2 er andelen av variasjonen i den ene variabelen som den lineære sammenhengen statistisk forklarer. En korrelasjon på r=0.7 ser sterk ut, men r2=0.49 betyr at under halvparten av variasjonen er forklart – resten ligger andre steder. Kvadratet demper alltid inntrykket, og det er r2, ikke r, som forteller hvor mye av det ene som følger med det andre.

Pearsons r forutsetter at sammenhengen er tilnærmet lineær og at dataene er rimelig fri for ekstreme uteliggere. Er ikke det tilfellet – eller er den ene variabelen ordinal, som en symptomskår – finnes et robust alternativ: Spearmans ρ (den greske bokstaven rho). Spearmans ρ er ganske enkelt Pearsons r regnet på rangene i stedet for på rådataene: hver observasjon erstattes av sin plassnummer i den sorterte rekka, og korrelasjonen regnes på plassnumrene. Fordi den bare bryr seg om rekkefølgen, måler den monoton samvariasjon – om den ene stiger når den andre stiger, uansett om forholdet er lineært – og den er robust mot uteliggere på samme måte som medianen.

Vi ser begge målene på biometridatasettet, som spredningsdiagrammet i seksjonen om deskriptiv statistikk pekte fram mot: 74 friske voksne fra en norsk studie ved USN, snittalder 22.8 år, 16 av dem menn [183]. Sfærisk ekvivalent (SER) er målt med autorefraksjon i cykloplegi – med akkommodasjonen slått ut av dråper, så tallet ikke forstyrres av at øyet fokuserer – og aksiallengden (AL) optisk med Myopia Master, et instrument som samler optisk biometri (aksiallengde målt med lys, i motsetning til A-skannets ultralyd fra seksjonen om måling og usikkerhet), autorefraksjon og keratometri i ett apparat. Studien sammenlignet det med IOLMaster 700, et etablert optisk biometer som brukes til å velge kunstig linse før kataraktkirurgi, og fant at de to måler aksiallengden så godt som likt – middeldifferansen var −0.004 mm [183]. Studien målte begge øyne, men boken bruker bare høyre øye, slik at hver person bidrar med én rad og radene er uavhengige – husk fra første seksjon at analyseenheten må velges bevisst; den siste seksjonen forklarer hvorfor to øyne fra samme person ikke er to uavhengige observasjoner. Tabell 13.2 viser de tolv første personene; hele settet står i Tillegg A. Aksiallengde og sfærisk ekvivalent henger tett sammen: lange øyne er mer nærsynte.

Tabell 13.2: Biometridatasettet, de tolv første av 74 personer (høyre øye); hele settet står i Tillegg A. Data fra [183].
id Alder (år) Kjønn SER (D) AL (mm)
1 21 K -2.375 25.155
2 21 K -4.125 25.803
3 28 M 1.250 22.414
4 22 K -1.125 24.403
5 20 K 1.250 22.191
6 20 K -1.000 23.091
7 19 K -13.875 26.983
8 20 K -6.250 24.132
9 19 K -6.125 23.875
10 22 K 0.750 23.915
11 19 K 0.250 22.643
12 29 K -0.500 23.443
De 74 høyre øynene i biometridatasettet med SER vannrett og AL loddrett; den nedadgående punktskyen med regresjonslinja gjennom viser den negative sammenhengen, og de fleste øynene ligger samlet nær null dioptrier.
Figur 13.10: De 74 høyre øynene i biometridatasettet med SER vannrett og AL loddrett; den nedadgående punktskyen med regresjonslinja gjennom viser den negative sammenhengen, og de fleste øynene ligger samlet nær null dioptrier.

R-kode

# Korrelasjon mellom aksiallengde og refraksjon (biometridatasettet)
with(biometri, cor.test(AL, SER)) # Pearson (standard)
#> t = -9.4934, df = 72, p-value = 2.536e-14
#> cor -0.7455843
with(biometri, cor.test(AL, SER, method = "spearman", exact = FALSE))
#> rho -0.728709, p-value = 1.844e-13
# r = -0.75 -> r^2 = 0.56: 56 % av variasjonen i AL foelger med refraksjonen

Pearson gir r=−0.75 (sterk, negativ), Spearman ρ=−0.73 – samme retning, litt svakere fordi rangene demper de mest ekstreme punktene. Det ene høymyope øyet (−13.875 D) øverst til venstre i figuren bærer ikke sammenhengen alene: uten det er r=−0.72. Kvadratet r2≈0.56 sier at 56 % av variasjonen i aksiallengde følger med refraksjonen; de resterende 44 % skyldes andre ting – først og fremst hornhinnens og linsens styrke, som kapittelet om øyets fysikk og anatomi viste kan gjøre et langt øye emmetropt. Til sammenligning gir hornhinnetykkelsen og forskjellen mellom det berøringsfrie tonometeret og Goldmann i klinikkdatasettet (CCT mot NCT − GAT) r=0.41 – moderat – men r2=0.17: bare 17 % forklart. En moderat r «forklarer» altså langt mindre enn den ser ut til. Sammenhengen selv kjenner du fra kapittelet om mekanikk: hornhinnetykkelsen påvirker applanasjonsavlesningen [56], og i dette materialet slår den sterkere inn på det berøringsfrie tonometeret enn på Goldmann [181] – en tykk hornhinne gir høyere avlesning på NCT enn på GAT, i snitt om lag 0.23 mmHg per 10 µ⁢m. Mot Goldmann-trykket selv er hornhinnetykkelsen bare svakt korrelert i dette materialet (r=0.18, ikke signifikant).

Eksempel 13.7.1

I klinikkdatasettet er korrelasjonen mellom hornhinnetykkelse (CCT) og differansen mellom det berøringsfrie tonometeret og Goldmann (NCT − GAT) r=0.41. Hva forteller fortegnet og størrelsen, og hvor stor andel av variasjonen i differansen er statistisk forklart av tykkelsen?

Løsning: Vi leser av fortegnet og størrelsen, og kvadrerer for å få den forklarte andelen. Fortegnet er positivt, så tykkere hornhinner går sammen med at det berøringsfrie tonometeret leser høyere enn Goldmann; størrelsen 0.41 er en moderat sammenheng. Den forklarte andelen er

r2=0.412≈0.17,

altså at bare om lag 17 % av variasjonen i forskjellen mellom instrumentene følger med hornhinnetykkelsen – en påminnelse om at en moderat r forklarer mindre enn den kan se ut til.

Eksempel 13.7.2

Nærtillegget (den ekstra plusstyrken en presbyop pasient trenger til nærarbeid) øker med alderen. Seks pasienter gir (alder i år, add i D): (42,1.00), (47,1.25), (50,1.75), (54,2.00), (58,2.25), (63,2.50). Regn ut Pearsons r for hånd, oppgi r2, og avgjør hva du ville forvente av Spearmans ρ.

Løsning: Vi finner gjennomsnittene, bygger de tre summene, og setter inn i formelen for r. Med x¯≈52.33 år og y¯≈1.792 D blir

Sx⁢y =∑(xi−x¯)⁢(yi−y¯)≈21.667,
Sx⁢x =∑(xi−x¯)2≈289.333,Sy⁢y=∑(yi−y¯)2≈1.6771,

og dermed

r=Sx⁢ySx⁢x⁢Sy⁢y=21.667289.333⋅1.6771≈0.984.

Kvadratet er r2≈0.97: nesten all variasjonen i nærtillegget følger lineært med alderen. Fordi de seks punktene er strengt stigende – eldre pasient, alltid høyere add – er sammenhengen perfekt monoton, så Spearmans ρ ville blitt nøyaktig 1.00. Merk likevel at den sterke korrelasjonen bekrefter samvariasjon, ikke at alderen i seg selv «lager» tillegget; mekanismen er den tapte akkommodasjonsamplituden A fra kapittelet om øyets fysikk og anatomi.

Å forklare og predikere: enkel lineær regresjon

Korrelasjonen sier hvor sterkt to variabler henger sammen, men ikke hvordan. Vil du ha selve linja – for å tolke hvor bratt den ene endrer seg med den andre, eller for å anslå en verdi du ikke har målt – er verktøyet enkel lineær regresjon.

Modellen tilpasser en rett linje

y^=b0+b1⁢x,

der b0 er skjæringen (verdien av y^ når x=0) og b1 er stigningen (endringen i y^ per enhets økning i x). Taket «hatten» på y^ minner om at dette er en predikert verdi på linja, ikke en observert. For hver observasjon er avstanden loddrett fra punktet ned til linja, yi−y^i, et residual. Metoden velger b0 og b1 som gjør summen av de kvadrerte residualene minst mulig – derav navnet minste kvadraters metode. Vi kvadrerer av samme grunn som i variansen: for at fortegn ikke skal oppheve hverandre, og for at store bom skal veie tungt. Å løse dette minimeringsproblemet gir to enkle uttrykk (vi oppgir dem; utledningen hører ikke hjemme her):

b1=Sx⁢ySx⁢x,b0=y¯−b1⁢x¯.

Legg merke til at stigningen bygger på de samme summene som korrelasjonen. Det er ingen tilfeldighet: i enkel lineær regresjon er andelen forklart variasjon R2 nøyaktig lik kvadratet av Pearsons r.

For aksiallengde og refraksjon i biometridatasettet gir dette AL^=23.658−0.305⋅SER (den samme linja som i figur 13.10), med R2=0.56. Stigningen −0.305 tolkes klinisk: for hver dioptri mer myop refraksjon er øyet i snitt 0.305 mm lengre. Skjæringen 23.66 mm er linjas anslag på aksiallengden til et emmetropt øye (SER=0) i dette materialet.

En modell er bare verdt noe hvis forutsetningene holder, og for regresjonen er de fire: sammenhengen skal være tilnærmet lineær; observasjonene skal være uavhengige; residualene skal være tilnærmet normalfordelte; og de skal ha konstant spredning langs linja (homoskedastisitet). De to siste sjekkes best ved å se på residualene: et residualplott (residual mot predikert verdi) skal vise en strukturløs sky uten trakt eller bue, og et QQ-plott – residualenes observerte verdier plottet mot de verdiene en normalfordeling ville gitt – skal ligge nær en rett linje. Regelen er å se på residualene før du stoler på p-verdien.

R-kode

# Enkel lineaer regresjon: aksiallengde forklart av refraksjon
fit <- lm(AL ~ SER, data = biometri)
summary(fit)
#> Coefficients:
#> Estimate Std. Error t value Pr(>|t|)
#> (Intercept) 23.65804 0.09264 255.365 < 2e-16
#> SER -0.30517 0.03215 -9.493 2.54e-14
#> Multiple R-squared: 0.5559
plot(fit, which = 1) # residual mot predikert: linearitet + konstant spredning
plot(fit, which = 2) # QQ-plott: normalfordelte residualer

Regresjon kan brukes to veier. Du kan predikere – sette inn en x-verdi og lese av y^ – eller forklare ved å tolke stigningen som en rate. Begge er trygge bare innenfor området dataene dekker. Å strekke linja langt utenfor det, ekstrapolasjon, er utrygt: modellen er belagt bare der du har observasjoner.

Eksempel 13.7.3

Bruk de seks presbyopi-punktene fra forrige eksempel (alder mot add). (a) Finn regresjonslinja med minste kvadraters metode. (b) Tolk stigningen klinisk. (c) Prediker nærtillegget for en pasient på 55 år. (d) Hvorfor bør du ikke bruke linja til å anslå tillegget for et barn på 10 år?

Løsning: Vi gjenbruker summene fra korrelasjonseksemplet og setter inn i uttrykkene for b1 og b0. For (a): b1=Sx⁢y/Sx⁢x=21.667/289.333≈0.0749 D per år, og b0=y¯−b1⁢x¯≈1.792−0.0749⋅52.33≈−2.127 D, altså

add^=−2.127+0.0749⋅alder.

For (b): i disse seks punktene øker nærtillegget med om lag 0.075 D per leveår – rundt 0.75 D per tiår. Det er stigningen til linja gjennom dette datasettet, ikke en normtabell for aldersgruppen. For (c): add^⁢(55)=−2.127+0.0749⋅55≈1.99 D, altså nær 2.00 D. For (d): et barn på 10 år ligger langt utenfor dataområdet (42–63 år) – det ville vært ekstrapolasjon. Modellen er ikke belagt der, og et barn har full akkommodasjon og trenger ikke noe tillegg i det hele tatt; linja ville gitt et meningsløst negativt tall.

Å sammenligne to grupper: t-tester

Neste formål er å sammenligne. Vil du vite om et gjennomsnitt skiller seg fra noe annet, er t-testen standardverktøyet – men hvilken av tre varianter du bruker, avgjøres av designet, ikke av smak. Husk skillet mellom paret og uparet data fra den første seksjonen; det er nettopp det som styrer valget.

Den én-utvalgs t-testen sammenligner ett gjennomsnitt mot en fast referanseverdi – for eksempel om gjennomsnittstrykket i et materiale avviker fra en kjent normalverdi. Den uparede (to-utvalgs) t-testen sammenligner gjennomsnittene i to uavhengige grupper – myope mot ikke-myope, brukere mot ikke-brukere. Den parede t-testen sammenligner to målinger på den samme enheten – samme øye med to instrumenter, eller før og etter en behandling. Den regner differansen for hvert par og tester om gjennomsnittsdifferansen er 0; ved å arbeide på differansene fjerner den variasjonen mellom pasienter og blir dermed langt mer følsom.

Alle tre forutsetter tilnærmet normalfordelte data (eller et utvalg stort nok til at sentralgrenseteoremet trår til), og den uparede Students-varianten forutsetter i tillegg lik varians i de to gruppene; er variansene ulike, brukes Welch-varianten, som R gir som standard. Og som alltid hører en effektstørrelse og et konfidensintervall ved siden av p-verdien: Cohens d fra forrige seksjon tallfester hvor stor forskjellen er, ikke bare om den er påvisbar.

R-kode

# Samme verktoey, tre design -- valget foelger av dataene
myop <- SER <= -0.50
biometri$myop <- biometri$SER <= -0.50
t.test(IOP, mu = 16) # en-utvalgs: Goldmann-snitt mot referanse 16
#> t = -10.139, df = 70, p-value = 2.247e-15 mean of x 13.46338
t.test(AL ~ myop, data = biometri) # uparet: to uavhengige grupper (Welch)
#> t = -6.49, df = 47.706, p-value = 4.57e-08 # fortegn: FALSE minus TRUE
t.test(NCT, GAT, paired = TRUE) # paret: to instrumenter paa samme oeye
#> t = -1.2991, df = 70, p-value = 0.1982 # ingen paavist systematisk forskjell

Én-utvalgsraden tester Goldmann-snittet i klinikkdatasettet mot referansen 16 mmHg – det stipulerte befolkningstallet fra seksjonen om normalfordelingen – og finner det klart lavere (13.46 mot 16, p<0.001). Det er ingen overraskelse, men en påminnelse om kohorten: et behandlet trykk hos glaukompasienter skal ligge under det man venter i en ubehandlet befolkning. Den uparede sammenligningen av aksiallengde mellom myope og ikke-myope så du tolket i forrige seksjon (p<0.001, stor effekt): det er nettopp en to-utvalgs t-test. Den parede raden sammenligner det berøringsfrie tonometeret med Goldmann på de samme øynene og finner ingen påvist systematisk forskjell (p=0.20; middeldifferanse −0.29 mmHg, KI [−0.75, 0.16] mmHg) – to instrumenter som i snitt leser omtrent likt. Husk at fravær av signifikans ikke er bevis for likhet; hvor mye det enkelte øyet kan sprike med, tar den siste seksjonen opp.

Tre eller flere grupper: enveis-ANOVA

Skal du sammenligne gjennomsnittet i tre eller flere grupper samtidig, kan du ikke bare kjøre alle de parvise t-testene. Hver test bærer sin egen risiko for en falsk alarm (type I-feil), og jo flere tester du kjører, desto større blir den samlede sjansen for at minst én av dem slår ut ved ren tilfeldighet. Dette multiplisitetsproblemet er grunnen til at vi trenger én samlet test.

Den testen er enveis-ANOVA (analysis of variance). Ideen er å dele opp den totale variasjonen i to: variasjonen mellom gruppegjennomsnittene og variasjonen innen gruppene. Testobservatoren er forholdet mellom de to, målt som gjennomsnittlige kvadratsummer:

F=MSBMSW=variasjon mellom gruppenevariasjon innen gruppene.

Er alle gruppegjennomsnittene like, sprer de seg bare like mye som tilfeldighetene innad skulle tilsi, og F ligger nær 1. Skiller minst én gruppe seg ut, blir telleren stor og F stor – og en stor F taler mot at alle gjennomsnittene er like. Effektstørrelsen ved siden av er η2 («eta-kvadrat»), andelen av den totale variasjonen som skyldes gruppetilhørighet – en ANOVA-analog til r2, med grovgrensene 0.01 (liten), 0.06 (middels) og 0.14 (stor) – avrundet fra Cohens f-konvensjoner 0.10, 0.25 og 0.40, som gir η2=0.0099, 0.0588 og 0.1379 [190].

En viktig begrensning: en signifikant F sier bare at minst ett gruppepar skiller seg – ikke hvilke. Å finne ut hvilke krever oppfølgende parvise sammenligninger med en korreksjon for multiplisitet, noe vi kommer kort tilbake til i den siste seksjonen. (For nøyaktig to grupper er ANOVA og den uparede t-testen for øvrig samme test, med F=t2.)

R-kode

# Enveis-ANOVA over tre grupper (seks pasienter hver) + effektstoerrelse
trykk <- c(12.5, 13.5, 13.5, 15.0, 15.0, 15.0, # gruppe A
14.5, 15.0, 15.0, 15.5, 17.0, 17.0, # gruppe B
17.5, 17.5, 18.5, 18.5, 18.5, 19.5) # gruppe C
gruppe <- factor(rep(c("A", "B", "C"), each = 6))
summary(aov(trykk ~ gruppe))
#> Df Sum Sq Mean Sq F value Pr(>F)
#> gruppe 2 55.36 27.681 28.88 7.18e-06
#> Residuals 15 14.38 0.958
# eta^2 = 55.36 / (55.36 + 14.37) = 0.79 (stor effekt)

Eksempel 13.7.4

Trykket (mmHg) ble målt i tre grupper på seks pasienter hver. En enveis-ANOVA gir kvadratsummen mellom gruppene SSB=55.36 (fg =2) og innen gruppene SSW=14.37 (fg =15). Regn ut MSB, MSW, F-observatoren og η2, og tolk effektstørrelsen.

Løsning: Vi deler hver kvadratsum på sine frihetsgrader for å få de gjennomsnittlige kvadratsummene, tar forholdet og finner så η2 som andel av totalen.

MSB =55.362=27.68,MSW=14.3715=0.958,
F =MSBMSW=27.680.958≈28.9.

Med total kvadratsum SST=55.36+14.37=69.73 blir

η2=SSBSST=55.3669.73≈0.79.

En F på nær 29 er langt over 1, så gruppene skiller seg klart, og η2=0.79 (langt over 0.14) sier at hele 79 % av variasjonen i trykk henger sammen med gruppetilhørigheten – en stor effekt. Testen forteller likevel bare at minst ett gruppepar skiller seg, ikke hvilke.

Når forutsetningene svikter: ikke-parametriske tester

T-testene og ANOVA hviler på at dataene er tilnærmet normalfordelte. Er de klart ikke det – sterkt skjeve, med grove uteliggere, rent ordinale, eller fra et svært lite utvalg – svikter grunnlaget for p-verdien. Da bytter du til en ikke-parametrisk test. Disse rangerer observasjonene og tester på rangene i stedet for på rådataene, akkurat som Spearmans ρ, og arver dermed robustheten mot skjevhet og uteliggere.

Hver parametrisk test har et ikke-parametrisk motstykke: Mann-Whitney (rangsumtesten) svarer til den uparede t-testen, paret Wilcoxon (fortegnsrangtesten, med observatoren W) til den parede t-testen, og Kruskal-Wallis til enveis-ANOVA. Det er verdt å understreke når du velger dem: det er forutsetningsbruddet som er beslutningsgrunnen, ikke en generell forsiktighet. Det er fristende å tenke at den ikke-parametriske testen alltid er det «trygge» valget, men det stemmer ikke – når forutsetningene faktisk holder, har den parametriske testen mer statistisk styrke, altså større sjanse til å oppdage en reell forskjell. Å velge ikke-parametrisk av vane kaster bort den styrken.

R-kode

# Rangbaserte motstykker naar normalitet ikke holder
wilcox.test(AL ~ myop, data = biometri) # Mann-Whitney: p = 5.056e-09
wilcox.test(Corvis, GAT, paired = TRUE) # paret Wilcoxon: p = 3.011e-12
kruskal.test(trykk ~ gruppe) # Kruskal-Wallis: p = 0.001215

På aksiallengde-sammenligningen gir Mann-Whitney p=5.1⋅10−9 – samme konklusjon som t-testen. Det er det vanlige når begge er anvendelige; den ikke-parametriske testen er reserven for når t-testens forutsetninger ikke holder, ikke en erstatning som alltid er bedre.

Kategoriske data: kji-kvadrat, Fisher og McNemar

Til nå har utfallet vært kontinuerlig. Vil du i stedet undersøke om to kategoriske variabler henger sammen – er myopi vanligere blant menn enn blant kvinner i klinikkdatasettet? – setter du dataene i en krysstabell og bruker en kji-kvadrat-test for uavhengighet. Ideen er å sammenligne de observerte celletallene med de tallene du ville forventet om variablene var uavhengige. Forventet celletall regnes fra rad- og kolonnesummene: E=(radsum⋅kolonnesum)/N. Testobservatoren summerer det relative avviket over alle cellene:

χ2=∑(O−E)2E,

der O er observert og E forventet. Store avvik fra det uavhengighet skulle gi, gjør χ2 stor. En tommelfingerregel sikrer at tilnærmingen holder: minst 80 % av de forventede celletallene bør være 5 eller mer, og ingen celle bør ha et forventet tall under 1 [191]. I en 2×2-tabell er det i praksis et krav om at alle fire cellene når 5.

For en 2×2-tabell er det to fallgruver verdt å kjenne. Den ene er teknisk: chisq.test() i R bruker som standard Yates’ kontinuitetskorreksjon på 2×2-tabeller, som gir en litt større p-verdi enn den ukorrigerte Pearson-testen; vil du ha den rene Pearson-observatoren, må du be om correct = FALSE. Den andre er prinsipiell: er de forventede celletallene små (<5), er kji-kvadrat-tilnærmingen upålitelig, og du bør bruke Fishers eksakte test i stedet. Den regner ut den nøyaktige sannsynligheten for tabeller minst så skjeve som den observerte, uten å lene seg på en tilnærming.

R-kode

# Henger myopi sammen med kjoenn? (2x2 fra klinikkdatasettet)
tab <- table(kjonn, myopi)
tab
#> myopi
#> kjonn ja nei
#> K 19 12
#> M 33 7
chisq.test(tab, correct = FALSE) # Pearson: X-squared 4.0086, p = 0.04527
chisq.test(tab) # Yates (standard): X-squared 2.9995, p = 0.08329
fisher.test(tab) # eksakt: p = 0.06023, OR 0.3413

Forventede celletall er 22.7, 8.3, 29.3 og 10.7 – alle over 5, så kji-kvadrat er tillatt. De tre testene peker samme vei, men bare den ukorrigerte Pearson-testen kommer under 0.05; Yates-korreksjonen (p=0.083) og Fishers eksakte test (p=0.060) gjør det ikke – et ærlig eksempel på hvor følsom en 2×2-test er nær grensen, og på at valget av test og korreksjon skal oppgis, ikke skjules. Oddsforholdet 0.34 sier at oddsen for myopi er om lag en tredel så stor hos kvinnene som hos mennene i dette materialet (61 % mot 83 % myope) – men med et konfidensintervall [ 0.10, 1.13] som dekker 1. Og skulle noen lese dette som at «kjønn påvirker myopi», er det på sin plass å minne om gjennomgangstråden: det er en samvariasjon i et selektert glaukommateriale, ikke en påstand om befolkningen.

Er dataene parede – to tester eller to tidspunkt på de samme individene – passer verken kji-kvadrat eller Fisher, for da er cellene ikke uavhengige. Da brukes McNemars test, som bare ser på de to diskordante cellene (der de to testene er uenige), med telletallene b og c:

χ2=(|b−c|−1)2b+c.

Den svarer på om de to testene systematisk er uenige i én retning, ikke på hvor ofte de er enige.

Risikomål fra en 2×2-tabell

Når den ene kategorien er en eksponering (behandlet eller ikke) og den andre et utfall (hendelse ja eller nei), vil du ofte tallfeste hvor mye eksponeringen endrer risikoen. Fra en 2×2-tabell med celler a,b,c,d (eksponert med og uten utfall over ueksponert med og uten utfall) regnes flere mål, og de svarer på litt ulike spørsmål.

Relativ risiko RR er forholdet mellom risikoen i de to gruppene, og oddsforholdet OR mellom oddsene; begge er multiplikative, med 1 som «ingen effekt». Absolutt risikoreduksjon ARR er differansen i risiko, relativ risikoreduksjon RRR den samme differansen som andel av utgangsrisikoen, og antallet som må behandles NNT=1/ARR er hvor mange du må behandle for å hindre ett tilfelle (rund alltid opp til nærmeste hele pasient). De relative målene kan blåse opp en beskjeden gevinst – en halvering høres mye ut selv om den absolutte forskjellen er liten – mens ARR og NNT er de klinisk mest ærlige. Et siste forbehold: OR er tilnærmet lik RR bare når utfallet er sjeldent; ved vanlige utfall ligger OR lenger fra 1 enn RR og overdriver effekten.

R-kode

# Risikomaal fra et behandlingsforsoek: 15/100 mot 30/100 progredierer
Rt <- 15/100; Rc <- 30/100
RR <- Rt / Rc #> 0.50 (halvert relativ risiko)
ARR <- Rc - Rt #> 0.15
NNT <- 1 / ARR #> 6.67 -> behandle 7 for aa hindre ett tilfelle
prop.test(c(15, 30), c(100, 100), correct = FALSE) #> X-squared 6.45, p = 0.011

Eksempel 13.7.5

En kollega skriver: «Vi målte trykket med to tonometre på 40 pasienter og fant r=0.94 (p<0.001), så instrumentene er utbyttbare.» Vurder påstanden kritisk. (a) Hva viser r=0.94 faktisk, og hva viser den ikke? (b) Hvilken analyse svarer på det kollegaen egentlig spør om? (c) Skisser hvilke tall den analysen ville gitt dersom det ene tonometeret systematisk leser om lag 2.9 mmHg lavere enn det andre, slik Corvis ST gjorde mot Goldmann i den parede t-testen i forrige seksjon.

Løsning: Vi skiller samvariasjon fra samsvar, velger metode etter formålet, og anslår tallene. For (a): r=0.94 viser sterk samvariasjon – leser det ene instrumentet høyt, gjør det andre det også – men ikke samsvar. To instrumenter der det ene alltid leser 2.9 mmHg lavere enn det andre, kan ha r nær 1 og likevel være systematisk uenige. En korrelasjon nær 1 er nettopp ikke det samme som at instrumentene er enige. For (b): spørsmålet «er de utbyttbare?» handler om samsvar, ikke samvariasjon, og besvares med en Bland-Altman-analyse (og gjerne en paret t-test på differansene) – en metode vi bygger ut i neste seksjon. Poenget her er bare at riktig metode følger av formålet. For (c): en paret t-test ville avslørt en systematisk forskjell (bias) på om lag −2.9 mmHg, med et konfidensintervall som ikke dekker 0; Bland-Altman ville gitt den samme middeldifferansen og grenser for samsvar på om lag bias ±3.8 mmHg – for Corvis ST mot Goldmann blir det, som neste seksjon viser, fra om lag −6.7 til +0.9 mmHg. Om et slikt sprik er akseptabelt, er en klinisk vurdering – men konklusjonen «utbyttbare» kan uansett ikke trekkes fra r alene. Kort: r måler samvariasjon, ikke samsvar; bruk Bland-Altman.

Oppgaver

Oppgave 13.7.1

Fra biometridatasettet er r=−0.75 for aksiallengde mot refraksjon (AL mot SER), og fra klinikkdatasettet er r=0.41 for hornhinnetykkelse mot forskjellen mellom det berøringsfrie tonometeret og Goldmann (CCT mot NCT − GAT).

  1. a)

    Regn ut r2 for hvert par og formuler for hvert av dem én setning om «andel forklart variasjon».

  2. b)

    Hvilken av de to sammenhengene forklarer mest av variasjonen, og med hvor mange prosentpoengs margin?

  3. c)

    Regresjonslinja for nærtillegg mot alder er add^=−2.127+0.0749⋅alder (add i D). Prediker tillegget for en pasient på 48 år, og forklar i én setning hvorfor du ikke bør bruke linja for en pasient på 25 år.

Løsningsforslag

Oppgave 13.7.1:

  1. a)

    Vi kvadrerer korrelasjonene: r2=(−0.75)2=0.5625≈0.56 for AL mot SER – om lag 56 % av variasjonen i aksiallengde følger lineært med refraksjonen. For CCT mot NCT − GAT er r2=0.412=0.1681≈0.17 – bare om lag 17 % av variasjonen i forskjellen mellom de to trykkavlesningene følger med hornhinnetykkelsen; den positive r sier at en tykk hornhinne gir høyere avlesning på det berøringsfrie tonometeret enn på Goldmann, men sammenhengen er svak.

  2. b)

    AL mot SER forklarer klart mest; marginen er 56−17=39 prosentpoeng.

  3. c)

    Innsetting i linja gir

    add^⁢(48)=−2.127+0.0749⋅48≈1.47 D

    (kontroll: 1.99 D ved 55 år minus 7⋅0.0749 D≈1.47 D). En pasient på 25 år ligger langt utenfor dataområdet 42–63 år, så prediksjonen ville vært ekstrapolasjon – linja er ikke belagt der, og den ville gitt et meningsløst negativt tillegg.

Oppgave 13.7.2

Avgjør for hvert spørsmål hvilken analyse som passer, og begrunn kort ut fra datatype, paring og antall grupper:

  1. a)

    Henger aksiallengde og hornhinnekrumning sammen hos 71 pasienter?

  2. b)

    Er gjennomsnittstrykket ulikt hos myope og ikke-myope (to uavhengige grupper)?

  3. c)

    Skiller trykket seg mellom tre ulike aldersgrupper?

  4. d)

    Leser Corvis ST og Goldmann ulikt på de samme 71 øynene?

  5. e)

    Er myopi (ja/nei) knyttet til kjønn?

Løsningsforslag

Oppgave 13.7.2: Vi går fram etter seksjonens to spørsmål – hva slags spørsmål, og hva slags data.

  1. a)

    To kontinuerlige variabler, spørsmål om samvariasjon: korrelasjon (Pearsons r) – Spearmans ρ dersom sammenhengen ikke er lineær eller uteliggere forstyrrer.

  2. b)

    Kontinuerlig utfall i to uavhengige grupper: uparet to-utvalgs t-test.

  3. c)

    Kontinuerlig utfall i tre grupper: enveis-ANOVA – parvise t-tester ville gitt multiplisitetsproblemet.

  4. d)

    To målinger på de samme 71 øynene, altså paret design: paret t-test på differansene Corvis − GAT (paret Wilcoxon ved brudd på normalitet).

  5. e)

    To kategoriske variabler – myopi (ja/nei) og kjønn – i en 2×2-tabell: kji-kvadrat-test for uavhengighet – Fishers eksakte test dersom noen forventede celletall er under 5.

Oppgave 13.7.3

Et randomisert forsøk følger progresjon av en øyesykdom: 15 av 100 progredierer med et nytt dråpepreparat, 30 av 100 i kontrollgruppen.

  1. a)

    Regn ut relativ risiko (RR), absolutt risikoreduksjon (ARR), relativ risikoreduksjon (RRR) og antallet som må behandles (NNT).

  2. b)

    Tolk NNT-tallet i én klinisk setning.

  3. c)

    Regn ut oddsforholdet (OR) og forklar hvorfor det avviker fra RR nettopp her.

Løsningsforslag

Oppgave 13.7.3: Risikoene er Rt=15/100=0.15 i behandlingsgruppen og Rk=30/100=0.30 i kontrollgruppen.

  1. a)

    Vi setter inn i de fire målene:

    RR=0.150.30=0.50,ARR=0.30−0.15=0.15,
    RRR=0.150.30=0.50,NNT=10.15≈6.67→7

    (NNT rundes alltid opp til nærmeste hele pasient).

  2. b)

    Man må behandle 7 pasienter med dråpepreparatet for å hindre at én progredierer.

  3. c)

    Oddsforholdet er

    OR=15/8530/70=15⋅7085⋅30=10502550≈0.41.

    Det avviker fra RR=0.50 fordi utfallet her er vanlig – 30 % progredierer i kontrollgruppen. OR≈RR gjelder bare når utfallet er sjeldent; ved et så vanlig utfall ligger OR lenger fra 1 enn RR og overdriver effekten.

Oppgave 13.7.4

En student vil sammenligne gjennomsnittstrykket i fire pasientgrupper og kjører alle de seks parvise uparede t-testene. Én av dem gir p=0.04, og studenten konkluderer med at «gruppene er forskjellige».

  1. a)

    Forklar hva som er statistisk galt med å kjøre seks separate tester og så plukke ut den ene som ble signifikant.

  2. b)

    Foreslå den analysen studenten burde ha brukt i stedet, og forklar i én setning hva en signifikant utgang av den ville og ikke ville fortalt.

  3. c)

    Skisser hva som bør rapporteres ved siden av p-verdien for at konklusjonen skal være til å stole på.

Løsningsforslag

Oppgave 13.7.4:

  1. a)

    Hver test bærer sin egen 5 % risiko for falsk alarm (type I-feil). Med seks tester vokser den samlede sjansen for minst én falsk alarm kraftig – var testene uavhengige, ville den vært 1−0.956≈0.26. Å kjøre alle seks og så trekke fram den ene med p=0.04 er nettopp multiplisitetsproblemet: en enkelt p like under 0.05 er da godt forenlig med ren tilfeldighet, og konklusjonen «gruppene er forskjellige» er ikke belagt.

  2. b)

    Studenten burde kjørt enveis-ANOVA – én samlet test over de fire gruppene. En signifikant F ville fortalt at minst ett gruppepar skiller seg, men ikke hvilke; det krever oppfølgende parvise sammenligninger med korreksjon for multiplisitet.

  3. c)

    Ved siden av p-verdien hører effektstørrelsen η2 med tolkning mot grovgrensene, gruppenes n, gjennomsnitt og spredning (gjerne med konfidensintervall), en kontroll av forutsetningene (tilnærmet normalfordelte data – ellers Kruskal-Wallis), og en ærlig redegjørelse for alle testene som ble kjørt, ikke bare den som slo ut.

Alle løsningsforslag til kapittel 13