Kapittel 13 · Statistikk · 13.7
Statistiske analyser: å velge og tolke metoden
Nå er verktøykassen ferdig, og spørsmålet blir hvilket verktøy du skal ta opp. Som alltid begynner du ikke med metoden, men med formålet: hva vil du oppnå? Denne seksjonen dekker de to formålene forrige seksjon ennå ikke har gjort til metode – å sammenligne grupper eller betingelser, og å forklare eller predikere en sammenheng. Valget av analyse følger nesten mekanisk av to spørsmål: hva slags spørsmål stiller du (leter du etter samvariasjon, en forskjell mellom grupper, en sammenheng du vil tallfeste, eller en assosiasjon mellom kategorier?), og hva slags data har du (kontinuerlige, ordinale eller kategoriske; parede eller uparede; to grupper eller flere?). For hver metode oppgir vi regneteknikken og motiverer den, men den faktiske utregningen overlater vi til R – forståelsen av hva testen svarer på, og under hvilke forutsetninger, er det bærende. Den siste seksjonen samler alt dette i en beslutningstavle; her møter du metodene én etter én.
Samvariasjon mellom to kontinuerlige variabler: korrelasjon
Det første formålet er å måle om to kontinuerlige variabler varierer sammen – om høye verdier av den ene følges av høye (eller lave) verdier av den andre. Spørsmålet er ikke om den ene forårsaker den andre, bare om de henger sammen tallmessig, og hvor sterkt.
Målet på dette er Pearsons korrelasjonskoeffisient . Den bygger på de samme kvadrat- og kryssummene som spredningen i forrige seksjon. Skriv
der og er de kjente kvadratsummene og er kryssproduktsummen. Da er
Telleren fanger fortegnet: et punkt over gjennomsnittet på begge variablene (eller under på begge) gir et positivt bidrag, et punkt som ligger høyt på den ene og lavt på den andre et negativt. Nevneren normerer, slik at alltid ligger mellom og . Verdien betyr at alle punktene ligger på en stigende rett linje, på en synkende, og at det ikke finnes noen lineær sammenheng. To ting følger av at måler nettopp lineær samvariasjon: den ser ikke krumme mønstre (to variabler kan henge tett sammen langs en bue og likevel gi nær ), og den er følsom for enkeltstående uteliggere som kan trekke linja mot seg. Som grove holdepunkter – også her konvensjoner Cohen satte skjønnsmessig – regnes som en svak sammenheng, som moderat og som sterk [189, tab. 1, s. 157].
Det er lett å lese mer inn i enn tallet bærer, og et enkelt kvadrat holder tolkningen ærlig. Determinasjonskoeffisienten er andelen av variasjonen i den ene variabelen som den lineære sammenhengen statistisk forklarer. En korrelasjon på ser sterk ut, men betyr at under halvparten av variasjonen er forklart – resten ligger andre steder. Kvadratet demper alltid inntrykket, og det er , ikke , som forteller hvor mye av det ene som følger med det andre.
Pearsons forutsetter at sammenhengen er tilnærmet lineær og at dataene er rimelig fri for ekstreme uteliggere. Er ikke det tilfellet – eller er den ene variabelen ordinal, som en symptomskår – finnes et robust alternativ: Spearmans (den greske bokstaven rho). Spearmans er ganske enkelt Pearsons regnet på rangene i stedet for på rådataene: hver observasjon erstattes av sin plassnummer i den sorterte rekka, og korrelasjonen regnes på plassnumrene. Fordi den bare bryr seg om rekkefølgen, måler den monoton samvariasjon – om den ene stiger når den andre stiger, uansett om forholdet er lineært – og den er robust mot uteliggere på samme måte som medianen.
Vi ser begge målene på biometridatasettet, som spredningsdiagrammet i seksjonen om deskriptiv statistikk pekte fram mot: 74 friske voksne fra en norsk studie ved USN, snittalder 22.8 år, 16 av dem menn [183]. Sfærisk ekvivalent (SER) er målt med autorefraksjon i cykloplegi – med akkommodasjonen slått ut av dråper, så tallet ikke forstyrres av at øyet fokuserer – og aksiallengden (AL) optisk med Myopia Master, et instrument som samler optisk biometri (aksiallengde målt med lys, i motsetning til A-skannets ultralyd fra seksjonen om måling og usikkerhet), autorefraksjon og keratometri i ett apparat. Studien sammenlignet det med IOLMaster 700, et etablert optisk biometer som brukes til å velge kunstig linse før kataraktkirurgi, og fant at de to måler aksiallengden så godt som likt – middeldifferansen var [183]. Studien målte begge øyne, men boken bruker bare høyre øye, slik at hver person bidrar med én rad og radene er uavhengige – husk fra første seksjon at analyseenheten må velges bevisst; den siste seksjonen forklarer hvorfor to øyne fra samme person ikke er to uavhengige observasjoner. Tabell 13.2 viser de tolv første personene; hele settet står i Tillegg A. Aksiallengde og sfærisk ekvivalent henger tett sammen: lange øyne er mer nærsynte.
| id | Alder (år) | Kjønn | SER () | AL () |
|---|---|---|---|---|
| 1 | 21 | K | -2.375 | 25.155 |
| 2 | 21 | K | -4.125 | 25.803 |
| 3 | 28 | M | 1.250 | 22.414 |
| 4 | 22 | K | -1.125 | 24.403 |
| 5 | 20 | K | 1.250 | 22.191 |
| 6 | 20 | K | -1.000 | 23.091 |
| 7 | 19 | K | -13.875 | 26.983 |
| 8 | 20 | K | -6.250 | 24.132 |
| 9 | 19 | K | -6.125 | 23.875 |
| 10 | 22 | K | 0.750 | 23.915 |
| 11 | 19 | K | 0.250 | 22.643 |
| 12 | 29 | K | -0.500 | 23.443 |
R-kode
Pearson gir (sterk, negativ), Spearman – samme retning, litt svakere fordi rangene demper de mest ekstreme punktene. Det ene høymyope øyet () øverst til venstre i figuren bærer ikke sammenhengen alene: uten det er . Kvadratet sier at av variasjonen i aksiallengde følger med refraksjonen; de resterende skyldes andre ting – først og fremst hornhinnens og linsens styrke, som kapittelet om øyets fysikk og anatomi viste kan gjøre et langt øye emmetropt. Til sammenligning gir hornhinnetykkelsen og forskjellen mellom det berøringsfrie tonometeret og Goldmann i klinikkdatasettet (CCT mot NCT GAT) – moderat – men : bare forklart. En moderat «forklarer» altså langt mindre enn den ser ut til. Sammenhengen selv kjenner du fra kapittelet om mekanikk: hornhinnetykkelsen påvirker applanasjonsavlesningen [56], og i dette materialet slår den sterkere inn på det berøringsfrie tonometeret enn på Goldmann [181] – en tykk hornhinne gir høyere avlesning på NCT enn på GAT, i snitt om lag per . Mot Goldmann-trykket selv er hornhinnetykkelsen bare svakt korrelert i dette materialet (, ikke signifikant).
Eksempel 13.7.1
I klinikkdatasettet er korrelasjonen mellom hornhinnetykkelse (CCT) og differansen mellom det berøringsfrie tonometeret og Goldmann (NCT GAT) . Hva forteller fortegnet og størrelsen, og hvor stor andel av variasjonen i differansen er statistisk forklart av tykkelsen?
Løsning: Vi leser av fortegnet og størrelsen, og kvadrerer for å få den forklarte andelen. Fortegnet er positivt, så tykkere hornhinner går sammen med at det berøringsfrie tonometeret leser høyere enn Goldmann; størrelsen er en moderat sammenheng. Den forklarte andelen er
altså at bare om lag av variasjonen i forskjellen mellom instrumentene følger med hornhinnetykkelsen – en påminnelse om at en moderat forklarer mindre enn den kan se ut til.
Eksempel 13.7.2
Nærtillegget (den ekstra plusstyrken en presbyop pasient trenger til nærarbeid) øker med alderen. Seks pasienter gir (alder i år, add i ): , , , , , . Regn ut Pearsons for hånd, oppgi , og avgjør hva du ville forvente av Spearmans .
Løsning: Vi finner gjennomsnittene, bygger de tre summene, og setter inn i formelen for . Med år og blir
og dermed
Kvadratet er : nesten all variasjonen i nærtillegget følger lineært med alderen. Fordi de seks punktene er strengt stigende – eldre pasient, alltid høyere add – er sammenhengen perfekt monoton, så Spearmans ville blitt nøyaktig . Merk likevel at den sterke korrelasjonen bekrefter samvariasjon, ikke at alderen i seg selv «lager» tillegget; mekanismen er den tapte akkommodasjonsamplituden fra kapittelet om øyets fysikk og anatomi.
Å forklare og predikere: enkel lineær regresjon
Korrelasjonen sier hvor sterkt to variabler henger sammen, men ikke hvordan. Vil du ha selve linja – for å tolke hvor bratt den ene endrer seg med den andre, eller for å anslå en verdi du ikke har målt – er verktøyet enkel lineær regresjon.
Modellen tilpasser en rett linje
der er skjæringen (verdien av når ) og er stigningen (endringen i per enhets økning i ). Taket «hatten» på minner om at dette er en predikert verdi på linja, ikke en observert. For hver observasjon er avstanden loddrett fra punktet ned til linja, , et residual. Metoden velger og som gjør summen av de kvadrerte residualene minst mulig – derav navnet minste kvadraters metode. Vi kvadrerer av samme grunn som i variansen: for at fortegn ikke skal oppheve hverandre, og for at store bom skal veie tungt. Å løse dette minimeringsproblemet gir to enkle uttrykk (vi oppgir dem; utledningen hører ikke hjemme her):
Legg merke til at stigningen bygger på de samme summene som korrelasjonen. Det er ingen tilfeldighet: i enkel lineær regresjon er andelen forklart variasjon nøyaktig lik kvadratet av Pearsons .
For aksiallengde og refraksjon i biometridatasettet gir dette (den samme linja som i figur 13.10), med . Stigningen tolkes klinisk: for hver dioptri mer myop refraksjon er øyet i snitt lengre. Skjæringen er linjas anslag på aksiallengden til et emmetropt øye () i dette materialet.
En modell er bare verdt noe hvis forutsetningene holder, og for regresjonen er de fire: sammenhengen skal være tilnærmet lineær; observasjonene skal være uavhengige; residualene skal være tilnærmet normalfordelte; og de skal ha konstant spredning langs linja (homoskedastisitet). De to siste sjekkes best ved å se på residualene: et residualplott (residual mot predikert verdi) skal vise en strukturløs sky uten trakt eller bue, og et QQ-plott – residualenes observerte verdier plottet mot de verdiene en normalfordeling ville gitt – skal ligge nær en rett linje. Regelen er å se på residualene før du stoler på p-verdien.
R-kode
Regresjon kan brukes to veier. Du kan predikere – sette inn en -verdi og lese av – eller forklare ved å tolke stigningen som en rate. Begge er trygge bare innenfor området dataene dekker. Å strekke linja langt utenfor det, ekstrapolasjon, er utrygt: modellen er belagt bare der du har observasjoner.
Eksempel 13.7.3
Bruk de seks presbyopi-punktene fra forrige eksempel (alder mot add). (a) Finn regresjonslinja med minste kvadraters metode. (b) Tolk stigningen klinisk. (c) Prediker nærtillegget for en pasient på år. (d) Hvorfor bør du ikke bruke linja til å anslå tillegget for et barn på år?
Løsning: Vi gjenbruker summene fra korrelasjonseksemplet og setter inn i uttrykkene for og . For (a): per år, og , altså
For (b): i disse seks punktene øker nærtillegget med om lag per leveår – rundt per tiår. Det er stigningen til linja gjennom dette datasettet, ikke en normtabell for aldersgruppen. For (c): , altså nær . For (d): et barn på år ligger langt utenfor dataområdet (– år) – det ville vært ekstrapolasjon. Modellen er ikke belagt der, og et barn har full akkommodasjon og trenger ikke noe tillegg i det hele tatt; linja ville gitt et meningsløst negativt tall.
Å sammenligne to grupper: t-tester
Neste formål er å sammenligne. Vil du vite om et gjennomsnitt skiller seg fra noe annet, er t-testen standardverktøyet – men hvilken av tre varianter du bruker, avgjøres av designet, ikke av smak. Husk skillet mellom paret og uparet data fra den første seksjonen; det er nettopp det som styrer valget.
Den én-utvalgs t-testen sammenligner ett gjennomsnitt mot en fast referanseverdi – for eksempel om gjennomsnittstrykket i et materiale avviker fra en kjent normalverdi. Den uparede (to-utvalgs) t-testen sammenligner gjennomsnittene i to uavhengige grupper – myope mot ikke-myope, brukere mot ikke-brukere. Den parede t-testen sammenligner to målinger på den samme enheten – samme øye med to instrumenter, eller før og etter en behandling. Den regner differansen for hvert par og tester om gjennomsnittsdifferansen er ; ved å arbeide på differansene fjerner den variasjonen mellom pasienter og blir dermed langt mer følsom.
Alle tre forutsetter tilnærmet normalfordelte data (eller et utvalg stort nok til at sentralgrenseteoremet trår til), og den uparede Students-varianten forutsetter i tillegg lik varians i de to gruppene; er variansene ulike, brukes Welch-varianten, som R gir som standard. Og som alltid hører en effektstørrelse og et konfidensintervall ved siden av p-verdien: Cohens fra forrige seksjon tallfester hvor stor forskjellen er, ikke bare om den er påvisbar.
R-kode
Én-utvalgsraden tester Goldmann-snittet i klinikkdatasettet mot referansen – det stipulerte befolkningstallet fra seksjonen om normalfordelingen – og finner det klart lavere ( mot , ). Det er ingen overraskelse, men en påminnelse om kohorten: et behandlet trykk hos glaukompasienter skal ligge under det man venter i en ubehandlet befolkning. Den uparede sammenligningen av aksiallengde mellom myope og ikke-myope så du tolket i forrige seksjon (, stor effekt): det er nettopp en to-utvalgs t-test. Den parede raden sammenligner det berøringsfrie tonometeret med Goldmann på de samme øynene og finner ingen påvist systematisk forskjell (; middeldifferanse , KI ) – to instrumenter som i snitt leser omtrent likt. Husk at fravær av signifikans ikke er bevis for likhet; hvor mye det enkelte øyet kan sprike med, tar den siste seksjonen opp.
Tre eller flere grupper: enveis-ANOVA
Skal du sammenligne gjennomsnittet i tre eller flere grupper samtidig, kan du ikke bare kjøre alle de parvise t-testene. Hver test bærer sin egen risiko for en falsk alarm (type I-feil), og jo flere tester du kjører, desto større blir den samlede sjansen for at minst én av dem slår ut ved ren tilfeldighet. Dette multiplisitetsproblemet er grunnen til at vi trenger én samlet test.
Den testen er enveis-ANOVA (analysis of variance). Ideen er å dele opp den totale variasjonen i to: variasjonen mellom gruppegjennomsnittene og variasjonen innen gruppene. Testobservatoren er forholdet mellom de to, målt som gjennomsnittlige kvadratsummer:
Er alle gruppegjennomsnittene like, sprer de seg bare like mye som tilfeldighetene innad skulle tilsi, og ligger nær . Skiller minst én gruppe seg ut, blir telleren stor og stor – og en stor taler mot at alle gjennomsnittene er like. Effektstørrelsen ved siden av er («eta-kvadrat»), andelen av den totale variasjonen som skyldes gruppetilhørighet – en ANOVA-analog til , med grovgrensene (liten), (middels) og (stor) – avrundet fra Cohens -konvensjoner , og , som gir , og [190].
En viktig begrensning: en signifikant sier bare at minst ett gruppepar skiller seg – ikke hvilke. Å finne ut hvilke krever oppfølgende parvise sammenligninger med en korreksjon for multiplisitet, noe vi kommer kort tilbake til i den siste seksjonen. (For nøyaktig to grupper er ANOVA og den uparede t-testen for øvrig samme test, med .)
R-kode
Eksempel 13.7.4
Trykket (mmHg) ble målt i tre grupper på seks pasienter hver. En enveis-ANOVA gir kvadratsummen mellom gruppene (fg ) og innen gruppene (fg ). Regn ut MSB, MSW, F-observatoren og , og tolk effektstørrelsen.
Løsning: Vi deler hver kvadratsum på sine frihetsgrader for å få de gjennomsnittlige kvadratsummene, tar forholdet og finner så som andel av totalen.
| MSB | |||
Med total kvadratsum blir
En på nær er langt over , så gruppene skiller seg klart, og (langt over ) sier at hele av variasjonen i trykk henger sammen med gruppetilhørigheten – en stor effekt. Testen forteller likevel bare at minst ett gruppepar skiller seg, ikke hvilke.
Når forutsetningene svikter: ikke-parametriske tester
T-testene og ANOVA hviler på at dataene er tilnærmet normalfordelte. Er de klart ikke det – sterkt skjeve, med grove uteliggere, rent ordinale, eller fra et svært lite utvalg – svikter grunnlaget for p-verdien. Da bytter du til en ikke-parametrisk test. Disse rangerer observasjonene og tester på rangene i stedet for på rådataene, akkurat som Spearmans , og arver dermed robustheten mot skjevhet og uteliggere.
Hver parametrisk test har et ikke-parametrisk motstykke: Mann-Whitney (rangsumtesten) svarer til den uparede t-testen, paret Wilcoxon (fortegnsrangtesten, med observatoren ) til den parede t-testen, og Kruskal-Wallis til enveis-ANOVA. Det er verdt å understreke når du velger dem: det er forutsetningsbruddet som er beslutningsgrunnen, ikke en generell forsiktighet. Det er fristende å tenke at den ikke-parametriske testen alltid er det «trygge» valget, men det stemmer ikke – når forutsetningene faktisk holder, har den parametriske testen mer statistisk styrke, altså større sjanse til å oppdage en reell forskjell. Å velge ikke-parametrisk av vane kaster bort den styrken.
R-kode
På aksiallengde-sammenligningen gir Mann-Whitney – samme konklusjon som t-testen. Det er det vanlige når begge er anvendelige; den ikke-parametriske testen er reserven for når t-testens forutsetninger ikke holder, ikke en erstatning som alltid er bedre.
Kategoriske data: kji-kvadrat, Fisher og McNemar
Til nå har utfallet vært kontinuerlig. Vil du i stedet undersøke om to kategoriske variabler henger sammen – er myopi vanligere blant menn enn blant kvinner i klinikkdatasettet? – setter du dataene i en krysstabell og bruker en kji-kvadrat-test for uavhengighet. Ideen er å sammenligne de observerte celletallene med de tallene du ville forventet om variablene var uavhengige. Forventet celletall regnes fra rad- og kolonnesummene: . Testobservatoren summerer det relative avviket over alle cellene:
der er observert og forventet. Store avvik fra det uavhengighet skulle gi, gjør stor. En tommelfingerregel sikrer at tilnærmingen holder: minst av de forventede celletallene bør være eller mer, og ingen celle bør ha et forventet tall under [191]. I en -tabell er det i praksis et krav om at alle fire cellene når .
For en -tabell er det to fallgruver verdt å kjenne. Den ene er teknisk: chisq.test() i R bruker som standard Yates’ kontinuitetskorreksjon på -tabeller, som gir en litt større p-verdi enn den ukorrigerte Pearson-testen; vil du ha den rene Pearson-observatoren, må du be om correct = FALSE. Den andre er prinsipiell: er de forventede celletallene små (), er kji-kvadrat-tilnærmingen upålitelig, og du bør bruke Fishers eksakte test i stedet. Den regner ut den nøyaktige sannsynligheten for tabeller minst så skjeve som den observerte, uten å lene seg på en tilnærming.
R-kode
Forventede celletall er , , og – alle over , så kji-kvadrat er tillatt. De tre testene peker samme vei, men bare den ukorrigerte Pearson-testen kommer under ; Yates-korreksjonen () og Fishers eksakte test () gjør det ikke – et ærlig eksempel på hvor følsom en -test er nær grensen, og på at valget av test og korreksjon skal oppgis, ikke skjules. Oddsforholdet sier at oddsen for myopi er om lag en tredel så stor hos kvinnene som hos mennene i dette materialet ( mot myope) – men med et konfidensintervall som dekker . Og skulle noen lese dette som at «kjønn påvirker myopi», er det på sin plass å minne om gjennomgangstråden: det er en samvariasjon i et selektert glaukommateriale, ikke en påstand om befolkningen.
Er dataene parede – to tester eller to tidspunkt på de samme individene – passer verken kji-kvadrat eller Fisher, for da er cellene ikke uavhengige. Da brukes McNemars test, som bare ser på de to diskordante cellene (der de to testene er uenige), med telletallene og :
Den svarer på om de to testene systematisk er uenige i én retning, ikke på hvor ofte de er enige.
Risikomål fra en -tabell
Når den ene kategorien er en eksponering (behandlet eller ikke) og den andre et utfall (hendelse ja eller nei), vil du ofte tallfeste hvor mye eksponeringen endrer risikoen. Fra en -tabell med celler (eksponert med og uten utfall over ueksponert med og uten utfall) regnes flere mål, og de svarer på litt ulike spørsmål.
Relativ risiko RR er forholdet mellom risikoen i de to gruppene, og oddsforholdet OR mellom oddsene; begge er multiplikative, med som «ingen effekt». Absolutt risikoreduksjon ARR er differansen i risiko, relativ risikoreduksjon RRR den samme differansen som andel av utgangsrisikoen, og antallet som må behandles er hvor mange du må behandle for å hindre ett tilfelle (rund alltid opp til nærmeste hele pasient). De relative målene kan blåse opp en beskjeden gevinst – en halvering høres mye ut selv om den absolutte forskjellen er liten – mens ARR og NNT er de klinisk mest ærlige. Et siste forbehold: OR er tilnærmet lik RR bare når utfallet er sjeldent; ved vanlige utfall ligger OR lenger fra enn RR og overdriver effekten.
R-kode
Eksempel 13.7.5
En kollega skriver: «Vi målte trykket med to tonometre på pasienter og fant (), så instrumentene er utbyttbare.» Vurder påstanden kritisk. (a) Hva viser faktisk, og hva viser den ikke? (b) Hvilken analyse svarer på det kollegaen egentlig spør om? (c) Skisser hvilke tall den analysen ville gitt dersom det ene tonometeret systematisk leser om lag lavere enn det andre, slik Corvis ST gjorde mot Goldmann i den parede t-testen i forrige seksjon.
Løsning: Vi skiller samvariasjon fra samsvar, velger metode etter formålet, og anslår tallene. For (a): viser sterk samvariasjon – leser det ene instrumentet høyt, gjør det andre det også – men ikke samsvar. To instrumenter der det ene alltid leser lavere enn det andre, kan ha nær og likevel være systematisk uenige. En korrelasjon nær er nettopp ikke det samme som at instrumentene er enige. For (b): spørsmålet «er de utbyttbare?» handler om samsvar, ikke samvariasjon, og besvares med en Bland-Altman-analyse (og gjerne en paret t-test på differansene) – en metode vi bygger ut i neste seksjon. Poenget her er bare at riktig metode følger av formålet. For (c): en paret t-test ville avslørt en systematisk forskjell (bias) på om lag , med et konfidensintervall som ikke dekker ; Bland-Altman ville gitt den samme middeldifferansen og grenser for samsvar på om lag bias – for Corvis ST mot Goldmann blir det, som neste seksjon viser, fra om lag til . Om et slikt sprik er akseptabelt, er en klinisk vurdering – men konklusjonen «utbyttbare» kan uansett ikke trekkes fra alene. Kort: r måler samvariasjon, ikke samsvar; bruk Bland-Altman.
Oppgaver
Oppgave 13.7.1
Fra biometridatasettet er for aksiallengde mot refraksjon (AL mot SER), og fra klinikkdatasettet er for hornhinnetykkelse mot forskjellen mellom det berøringsfrie tonometeret og Goldmann (CCT mot NCT GAT).
-
a)
Regn ut for hvert par og formuler for hvert av dem én setning om «andel forklart variasjon».
-
b)
Hvilken av de to sammenhengene forklarer mest av variasjonen, og med hvor mange prosentpoengs margin?
-
c)
Regresjonslinja for nærtillegg mot alder er (add i ). Prediker tillegget for en pasient på år, og forklar i én setning hvorfor du ikke bør bruke linja for en pasient på år.
Løsningsforslag
Oppgave 13.7.1:
-
a)
Vi kvadrerer korrelasjonene: for AL mot SER – om lag av variasjonen i aksiallengde følger lineært med refraksjonen. For CCT mot NCT GAT er – bare om lag av variasjonen i forskjellen mellom de to trykkavlesningene følger med hornhinnetykkelsen; den positive sier at en tykk hornhinne gir høyere avlesning på det berøringsfrie tonometeret enn på Goldmann, men sammenhengen er svak.
-
b)
AL mot SER forklarer klart mest; marginen er prosentpoeng.
-
c)
Innsetting i linja gir
(kontroll: ved år minus ). En pasient på år ligger langt utenfor dataområdet – år, så prediksjonen ville vært ekstrapolasjon – linja er ikke belagt der, og den ville gitt et meningsløst negativt tillegg.
Oppgave 13.7.2
Avgjør for hvert spørsmål hvilken analyse som passer, og begrunn kort ut fra datatype, paring og antall grupper:
-
a)
Henger aksiallengde og hornhinnekrumning sammen hos pasienter?
-
b)
Er gjennomsnittstrykket ulikt hos myope og ikke-myope (to uavhengige grupper)?
-
c)
Skiller trykket seg mellom tre ulike aldersgrupper?
-
d)
Leser Corvis ST og Goldmann ulikt på de samme øynene?
-
e)
Er myopi (ja/nei) knyttet til kjønn?
Løsningsforslag
Oppgave 13.7.2: Vi går fram etter seksjonens to spørsmål – hva slags spørsmål, og hva slags data.
-
a)
To kontinuerlige variabler, spørsmål om samvariasjon: korrelasjon (Pearsons ) – Spearmans dersom sammenhengen ikke er lineær eller uteliggere forstyrrer.
-
b)
Kontinuerlig utfall i to uavhengige grupper: uparet to-utvalgs t-test.
-
c)
Kontinuerlig utfall i tre grupper: enveis-ANOVA – parvise t-tester ville gitt multiplisitetsproblemet.
-
d)
To målinger på de samme øynene, altså paret design: paret t-test på differansene Corvis GAT (paret Wilcoxon ved brudd på normalitet).
-
e)
To kategoriske variabler – myopi (ja/nei) og kjønn – i en -tabell: kji-kvadrat-test for uavhengighet – Fishers eksakte test dersom noen forventede celletall er under .
Oppgave 13.7.3
Et randomisert forsøk følger progresjon av en øyesykdom: av progredierer med et nytt dråpepreparat, av i kontrollgruppen.
-
a)
Regn ut relativ risiko (RR), absolutt risikoreduksjon (ARR), relativ risikoreduksjon (RRR) og antallet som må behandles (NNT).
-
b)
Tolk NNT-tallet i én klinisk setning.
-
c)
Regn ut oddsforholdet (OR) og forklar hvorfor det avviker fra RR nettopp her.
Løsningsforslag
Oppgave 13.7.3: Risikoene er i behandlingsgruppen og i kontrollgruppen.
-
a)
Vi setter inn i de fire målene:
(NNT rundes alltid opp til nærmeste hele pasient).
-
b)
Man må behandle pasienter med dråpepreparatet for å hindre at én progredierer.
-
c)
Oddsforholdet er
Det avviker fra fordi utfallet her er vanlig – progredierer i kontrollgruppen. gjelder bare når utfallet er sjeldent; ved et så vanlig utfall ligger OR lenger fra enn RR og overdriver effekten.
Oppgave 13.7.4
En student vil sammenligne gjennomsnittstrykket i fire pasientgrupper og kjører alle de seks parvise uparede t-testene. Én av dem gir , og studenten konkluderer med at «gruppene er forskjellige».
-
a)
Forklar hva som er statistisk galt med å kjøre seks separate tester og så plukke ut den ene som ble signifikant.
-
b)
Foreslå den analysen studenten burde ha brukt i stedet, og forklar i én setning hva en signifikant utgang av den ville og ikke ville fortalt.
-
c)
Skisser hva som bør rapporteres ved siden av p-verdien for at konklusjonen skal være til å stole på.
Løsningsforslag
Oppgave 13.7.4:
-
a)
Hver test bærer sin egen risiko for falsk alarm (type I-feil). Med seks tester vokser den samlede sjansen for minst én falsk alarm kraftig – var testene uavhengige, ville den vært . Å kjøre alle seks og så trekke fram den ene med er nettopp multiplisitetsproblemet: en enkelt like under er da godt forenlig med ren tilfeldighet, og konklusjonen «gruppene er forskjellige» er ikke belagt.
-
b)
Studenten burde kjørt enveis-ANOVA – én samlet test over de fire gruppene. En signifikant ville fortalt at minst ett gruppepar skiller seg, men ikke hvilke; det krever oppfølgende parvise sammenligninger med korreksjon for multiplisitet.
-
c)
Ved siden av p-verdien hører effektstørrelsen med tolkning mot grovgrensene, gruppenes , gjennomsnitt og spredning (gjerne med konfidensintervall), en kontroll av forutsetningene (tilnærmet normalfordelte data – ellers Kruskal-Wallis), og en ærlig redegjørelse for alle testene som ble kjørt, ikke bare den som slo ut.