Kapittel 13 · Statistikk · 13.2
Deskriptiv statistikk
Det første du gjør med et ferskt datasett, er å beskrive det: å presse en uoversiktlig kolonne med tall sammen til noen få størrelser som fanger hvor tyngdepunktet ligger, hvor mye tallene spriker, og hvilken form fordelingen har. Dette er det første av de fire formålene fra forrige seksjon – å beskrive; å sammenligne, forklare og vurdere samsvar kommer senere. Men selv en ren beskrivelse krever at du velger riktig: et gjennomsnitt kan villede når fordelingen er skjev, og ett enkelt tall skjuler ofte det et bilde ville avslørt. Vi bygger verktøyene i tur – først en kompakt skrivemåte for summer, så sentralmålene og spredningsmålene, og til slutt måtene å se fordelingen på.
Summetegnet
Nesten alt som følger, bygger på å legge sammen mange tall, og for det trenger vi en kompakt skrivemåte. Den store greske bokstaven sigma, , brukes som et summetegn – en operator som sier «legg sammen». Skriver vi
leser vi det som «summen av når løper fra til ». Bokstaven under tegnet er indeksen (tellevariabelen); tallet er den nedre grensen og den øvre; og er leddet som legges til for hver verdi av . Indeksen er bare et navn – betyr nøyaktig det samme.
Et konkret tilfelle gjør notasjonen ufarlig. Fem trykkmålinger (mmHg) er , , , og . Da er
Tegnet gjør ikke noe mystisk; det er en instruks om å legge sammen, skrevet én gang i stedet for at alle leddene ramses opp.
To regneregler kommer vi til å bruke uten videre. En konstant faktor kan settes utenfor summen,
fordi er den distributive loven fra kapittelet om de vanlige regneoperasjonene. Og en sum av to ledd kan deles i to summer,
siden addisjonen kan omordnes fritt. Overbevis deg om begge ved å skrive ut noen få ledd.
Legg merke til at det er den store som er summetegnet – en operator med indeks og grenser. Den lille , som dukker opp litt senere som populasjonens standardavvik, er noe helt annet; hold de to fra hverandre.
Sentralmål: gjennomsnitt, median og typetall
Et sentralmål er ett tall som skal representere «midten» av dataene. Det finnes flere, de er ikke like, og valget mellom dem er et av seksjonens hovedpoenger.
Det vanligste er gjennomsnittet (det aritmetiske middelet). For et utvalg på observasjoner skrives det («x-strek») og er summen delt på antallet:
Gjennomsnittet har samme enhet som dataene. Denne regneoperasjonen har du gjort før: den gjennomsnittlige keratometriverdien fra kapittelet om regnerekkefølgen er nettopp et gjennomsnitt av to tall. Her formaliserer vi den som et sentralmål for vilkårlig mange tall.
Gjennomsnittet har en svakhet: det trekkes mot ekstreme verdier. Ett uvanlig høyt trykk i et ellers normalt materiale drar oppover, selv om det ikke er representativt for den typiske pasienten. Her hjelper medianen: den midterste verdien når observasjonene sorteres i stigende rekkefølge. Er et oddetall, er medianen den midterste observasjonen; er et partall, er den gjennomsnittet av de to midterste. Medianen bryr seg bare om rekkefølgen, ikke om hvor ekstreme halene er, og er derfor robust mot uteliggere og skjevhet.
Et tredje mål, typetallet (modus), er den verdien som forekommer hyppigst. Det er det eneste sentralmålet som gir mening for rene kategoriske data – du kan snakke om den vanligste øyenfargen, men ikke om noen «gjennomsnittsfarge».
Eksempel 13.2.1
Fem trykkmålinger (mmHg) er , , , og . Skriv summen ledd for ledd, regn ut gjennomsnittet, og finn medianen.
Løsning: Vi bruker definisjonene av gjennomsnitt og median direkte. Summen er
så gjennomsnittet blir . Tallene er allerede sortert; med (oddetall) er medianen den tredje verdien, . Gjennomsnitt og median faller sammen her – et første tegn på at fordelingen er nokså symmetrisk.
Spredning: varians, standardavvik og kvartilbredde
Et sentralmål alene sier ingenting om hvor mye dataene spriker. To klinikker kan ha samme gjennomsnittstrykk, den ene med tallene tett samlet og den andre med stor spredning – og den forskjellen er ofte det klinisk interessante.
Utgangspunktet er avviket : hvor langt hver observasjon ligger fra gjennomsnittet. Å summere avvikene direkte fører ingen vei, for de summerer alltid til null – de positive og negative opphever hverandre, og det er nettopp en egenskap ved gjennomsnittet. Vi kvadrerer derfor hvert avvik før vi summerer, slik at fortegnet forsvinner og store avvik veier tyngre. Størrelsen kalles kvadratsummen.
Utvalgsvariansen er kvadratsummen delt på :
At vi deler på og ikke på , overrasker de fleste. Grunnen er at avvikene ikke er fritt varierende: siden de summerer til null, ligger det siste avviket fast så snart de første er kjent. Det er altså bare frihetsgrader (forkortet fg) i kvadratsummen, og å dele på antallet frihetsgrader gir et forventningsrett estimat – i snitt verken for stort eller for lite – av den sanne variansen i populasjonen. Delte vi på , ville vi systematisk underestimere den. Denne justeringen kalles Bessels korreksjon.
Variansen har kvadrert enhet (), som er tungvint å tolke. Derfor tar vi kvadratroten og får utvalgsstandardavviket, forkortet SD (av engelsk standard deviation):
Standardavviket har igjen samme enhet som dataene og måler en typisk avstand fra gjennomsnittet. Én finesse følger med kvadratroten: det er som er forventningsrett for populasjonsvariansen, ikke for populasjonsstandardavviket – kvadratroten er ikke en lineær operasjon, så underestimerer så vidt. Skjevheten er liten og krymper raskt med , og i praksis brukes uten korreksjon.
Standardavviket bygger på gjennomsnittet og arver dermed dets følsomhet for uteliggere. To robuste spredningsmål bygger i stedet på rekkefølgen. Variasjonsbredden (range) er ganske enkelt største minus minste verdi; den er lettfattelig, men svært følsom, siden den bruker bare de to mest ekstreme observasjonene. Kvartilene deler den sorterte rekka i fire like store deler: en fjerdedel av observasjonene ligger under den første kvartilen , halvparten under den andre (som er nettopp medianen), og tre fjerdedeler under den tredje . Kvartilbredden (interkvartilbredden),
fanger spennet til de midtre av dataene og er robust mot uteliggere på samme måte som medianen.
Eksempel 13.2.2
De fem avlesningene , , , og har gjennomsnitt . Regn ut utvalgsvariansen og standardavviket for hånd, og oppgi kvartilbredden. Hvorfor har enheten , mens har ?
Løsning: Vi setter opp avvikene, kvadrerer dem, summerer og deler på .
Med er , og . Kvartilene er og , så kvartilbredden er . Variansen er et gjennomsnitt av kvadrerte avvik og har derfor kvadrert enhet; standardavviket tar kvadratroten og bringer målet tilbake til dataenes egen enhet, .
R-kode
Funksjonene var() og sd() i R deler på som standard, akkurat som håndregningen over – tallene og er de samme.
Utvalg og populasjon
Forrige seksjon skilte utvalget (det du målte) fra populasjonen (det du vil uttale deg om). Nå som gjennomsnitt, varians og standardavvik er definert, kan vi feste hele symbolsettet. De to nivåene bruker ulike bokstaver og – for variansen – ulik nevner.
| Utvalg (statistikk) | Populasjon (parameter) | |
|---|---|---|
| Størrelse | ||
| Gjennomsnitt | ||
| Varians | ||
| Standardavvik |
Regelen bak bokstavvalget er verdt å merke seg: latinske bokstaver (, , ) står for statistikker – tall du regner ut fra utvalget – mens greske bokstaver (, ) står for parametere, de sanne, ukjente tallene for populasjonen. Populasjonsvariansen deler på fordi gjennomsnittet da er en kjent, fast størrelse; utvalgsvariansen deler på fordi er regnet ut fra de samme dataene og koster én frihetsgrad. Nesten alltid er det utvalgsstørrelsene du har, og populasjonsstørrelsene du er ute etter.
Klinikkdatasettet
Gjennom resten av kapittelet vender vi tilbake til ett gjennomgående datasett fra en glaukomklinikk: 71 pasienter med primær åpenvinkelglaukom under trykksenkende behandling, ett høyre øye per pasient, publisert som åpne data sammen med en japansk studie av tonometre [181]. Hver pasient er registrert med alder, kjønn, sfærisk ekvivalent (SER), aksiallengde (AL), gjennomsnittlig keratometri (, regnet fra hornhinnens krumningsradius i millimeter som , altså med keratometerindeksen fra kapittelet om geometrisk optikk), hornhinnens sentraltykkelse (CCT) og trykket målt med tre instrumenter på det samme øyet samme dag. Referansen er Goldmann-applanasjon (kolonnen IOP), som du kjenner fra kapittelet om mekanikk. Et berøringsfritt tonometer (NCT, av engelsk non-contact tonometer) flater hornhinnen med en kort luftstråle og leser trykket av hvor kraftig strålen må være for å flate den – uten kontakt med øyet og uten bedøvelse. Corvis ST er også berøringsfritt, men filmer hornhinnens deformasjon under luftstrålen med et høyhastighetskamera; det gir et ukorrigert trykk (kolonnen Corvis) og en biomekanisk korrigert verdi (bIOP), der programvaren har justert for hornhinnens tykkelse og dynamiske respons og for pasientens alder, og det måler CCT i samme omgang. Tabell 13.1 viser de tolv første pasientene; hele settet står som kjørbar R-kode i Tillegg A, slik at alt som regnes her, kan gjøres om igjen. Verdiene er målte, publiserte forskningsdata utgitt med åpen lisens (CC BY 4.0), ikke tall valgt for et pent regnestykke – og det forplikter: trykktallene er målt hos pasienter under trykksenkende behandling, så fordelingen viser et behandlet og kontrollert trykk, ikke trykkfordelingen i en ubehandlet befolkning. Det kommer vi tilbake til flere ganger. For denne seksjonen er det Goldmann-kolonnen (IOP) vi skal se nærmere på.
| id | Alder (år) | Kjønn | SER () | AL () | () | IOP | NCT | Corvis | bIOP | CCT () |
|---|---|---|---|---|---|---|---|---|---|---|
| 1 | 43 | M | -5.75 | 24.79 | 45.36 | 16.0 | 18 | 17.0 | 16.0 | 560 |
| 2 | 44 | M | -7.75 | 27.98 | 44.44 | 11.3 | 12 | 8.3 | 8.7 | 532 |
| 3 | 44 | K | -10.125 | 29.21 | 41.26 | 15.0 | 17 | 13.7 | 14.1 | 513 |
| 4 | 49 | K | -10.75 | 27.02 | 45.64 | 16.0 | 16 | 14.5 | 13.4 | 559 |
| 5 | 49 | K | -0.125 | 23.56 | 43.27 | 11.0 | 10 | 7.2 | 8.8 | 463 |
| 6 | 49 | M | -8.00 | 27.06 | 43.66 | 11.3 | 12 | 10.0 | 9.6 | 553 |
| 7 | 50 | M | -6.75 | 24.95 | 45.98 | 15.0 | 15 | 12.0 | 11.3 | 557 |
| 8 | 50 | M | -5.375 | 26.34 | 43.41 | 10.0 | 9 | 8.5 | 9.3 | 501 |
| 9 | 50 | M | -9.50 | 28.26 | 42.40 | 16.0 | 20 | 15.7 | 15.2 | 534 |
| 10 | 51 | M | -5.00 | 25.48 | 43.86 | 17.0 | 16 | 11.7 | 10.4 | 580 |
| 11 | 52 | M | -5.25 | 26.81 | 42.86 | 12.0 | 12 | 8.5 | 8.3 | 549 |
| 12 | 53 | K | -6.375 | 25.70 | 46.68 | 14.0 | 13 | 9.7 | 9.9 | 523 |
Utdraget er de tolv første radene slik fila er publisert (de første radene i fila ligger ordnet etter alder, derfor ser kolonnen sortert ut); hele settet spenner fra 31 til 79 år, med 31 kvinner og 40 menn.
Å se på dataene: histogram, boksplott og spredningsdiagram
Før du regner ut et eneste sammendragstall, bør du se på fordelingen. Et bilde avslører form, skjevhet og uteliggere som et gjennomsnitt og et standardavvik alene skjuler. Tre figurtyper dekker de fleste behovene, og hvilken du velger, følger av spørsmålet du stiller.
Et histogram deler tallområdet i like brede intervaller og tegner en stolpe for hvor mange observasjoner som faller i hvert. Det viser fordelingens form – hvor tyngdepunktet ligger, og om den er symmetrisk eller har en hale til én side. Histogrammet av trykket i klinikkdatasettet har tyngdepunktet rundt – og ingen hale å snakke om – fordelingen er om lag symmetrisk:
Et boksplott (etter Tukey) komprimerer fordelingen til fem tall. Boksen strekker seg fra til , så bredden er kvartilbredden IQR, og en strek inni boksen markerer medianen. Fra boksen går «værhår» ut til den mest ekstreme observasjonen som fortsatt ligger innenfor fra nærmeste kvartil; observasjoner utenfor tegnes som enkeltpunkter og flagges som mulige uteliggere [182]. For trykket er , medianen og , så , og grensene for værhårene ligger ved og . Alle 71 avlesningene ligger innenfor (laveste , høyeste ), så ingen tegnes som uteligger:
Værhårene er omtrent like lange – nedover og oppover – og ingen avlesning faller utenfor, så boksplottet viser ingen skjevhet å snakke om. Det er langt fra alltid slik, og seksjonen kommer straks tilbake til hvordan et skjevt materiale ser ut og hva du gjør med det.
Den tredje figurtypen, spredningsdiagrammet, tegner ett punkt per enhet med den ene variabelen langs den vannrette og den andre langs den loddrette aksen, og brukes til å se om to kontinuerlige variabler henger sammen. Vi bruker det for fullt i seksjonen om korrelasjon og regresjon – på et annet datasett, biometridatasettet: 74 friske voksne fra en norsk studie, ett høyre øye per person, med refraksjon og aksiallengde [183], som innføres for fullt der; her plasserer vi figurtypen bare i oversikten. Grunnregelen er å se på dataene før du tester – tavlen nedenfor knytter de tre figurtypene til spørsmålet hver av dem svarer på.
| Spørsmålet du stiller | Figurtype | Hva den viser |
|---|---|---|
| Hvordan er fordelingen til én variabel? | Histogram | Form, skjevhet og topper |
| Hvordan sammenligne median og spredning mellom grupper, og se uteliggere? | Boksplott | Median, kvartilbredde og ekstremer |
| Henger to kontinuerlige variabler sammen? | Spredningsdiagram | Retning og styrke på samvariasjonen |
I R gjøres dette med korte kommandoer.
summary() gir de fem tallene i boksplottet pluss gjennomsnittet, mens hist() og boxplot() tegner figur 13.2 og 13.3.
R-kode
R-kode
R-kode
Skjevhet og log-transformasjon
Formen på en fordeling avgjør hvilket sentralmål som er ærligst. I en symmetrisk fordeling faller gjennomsnitt og median omtrent sammen. I en høyreskjev (positivt skjev) fordeling – med en hale av høye verdier – trekkes gjennomsnittet oppover av halen mens medianen står imot, så . I en venstreskjev fordeling er det motsatt, . En praktisk regel følger: ligger gjennomsnittet merkbart over medianen, mistenk en høyreskjev hale, og rapporter da median med kvartilbredde heller enn gjennomsnitt med standardavvik.
Trykket i klinikkdatasettet er ikke et slikt tilfelle, og det er lærerikt i seg selv. Gjennomsnittet er og medianen – de faller nesten sammen, og 36 av de 71 pasientene ligger på eller over gjennomsnittet. Et tallmål på asymmetrien, utvalgsskjevheten (positiv ved en høyre hale, negativ ved en venstre), er her , nær null. Gjennomsnitt med standardavvik er da et ærlig sammendrag. Husk hvem tallene kommer fra: 71 pasienter med åpenvinkelglaukom under trykksenkende behandling [181]. Et behandlet og kontrollert trykk har ikke nødvendigvis den halen av høye verdier du kan vente i et ubehandlet materiale – de høye verdiene er nettopp dem behandlingen retter seg mot – så formen forteller like mye om kohorten som om trykk i sin alminnelighet.
Eksempel 13.2.3
Åtte pasienters trykk (mmHg), sortert, er , , , , , , og . Regn ut gjennomsnitt og median, tell hvor mange pasienter som ligger på eller over gjennomsnittet, og avgjør ut fra dette og formen på et boksplott hvilket sentralmål som beskriver den typiske pasienten best.
Løsning: Vi knytter sammen sentralmål, opptelling og form. Summen er , så . De to midterste (fjerde og femte) verdiene er og , så medianen er . Bare tre av de åtte – , og – ligger på eller over gjennomsnittet; flertallet ligger under det. At , forteller at fordelingen er høyreskjev: den ene høye verdien () drar gjennomsnittet opp. I et boksplott ville medianstreken ligge lavt i boksen med et langt øvre værhår. Medianen beskriver den typiske pasienten best og bør rapporteres sammen med kvartilbredden: median ; høyreskjev, så median er mest representativ.
Mange positive kliniske størrelser er høyreskjeve på nettopp denne måten. Et grep som ofte hjelper, er å log-transformere dataene – å erstatte hver verdi med tierlogaritmen sin. Husk fra kapittelet om eksponentialfunksjoner og logaritmer at logaritmen komprimerer store tall mer enn små; en hale av høye verdier trekkes derfor innover, og fordelingen blir mer symmetrisk. Det er den samme tierlogaritmen som ligger bak LogMAR-skalaen og optisk tetthet. Betrakt det høyreskjeve settet : her er gjennomsnittet og medianen , og utvalgsskjevheten er . Tar vi tierlogaritmen av hver verdi, faller skjevheten til – fordelingen er blitt nesten symmetrisk, og gjennomsnitt og median har rykket sammen.
R-kode
Eksempel 13.2.4
Du skal oppsummere trykket (IOP) for alle 71 pasientene i klinikkdatasettet før noen videre analyse settes i gang. Med sammendragstallene og figur 13.2 og 13.3 for hånden: hvilket sentralmål og hvilket spredningsmål bør du rapportere, og hvilke figurer forsvarer valget?
Løsning: Vi leser av summary() og de to figurene og bruker beslutningstavlen.
Sammendraget gir gjennomsnitt og median , kvartilbredde og standardavvik ; at gjennomsnitt og median nesten faller sammen, peker mot en symmetrisk fordeling.
Histogrammet bekrefter det – ingen hale til noen side – og boksplottet viser omtrent like lange værhår og ingen uteliggere.
For én kontinuerlig variabels form er histogrammet riktig figur, og for median, spredning og uteliggere er boksplottet det – akkurat de to første radene i beslutningstavlen.
Fordi fordelingen er om lag symmetrisk, kan du trygt rapportere gjennomsnitt med SD ; median med IQR er like forsvarlig, og de to sier her det samme.
For høyreskjeve, positive størrelser er log-transformasjonen det naturlige neste grepet – her trengs den ikke. At symmetrien ikke er noen selvfølge, viser Corvis-kolonnen i det samme datasettet: der er , og én avlesning på står mot en median på , så «se på dataene før du velger sentralmål» gjelder kolonne for kolonne.
Oppgaver
Oppgave 13.2.1
Sju pasienters trykk (mmHg) er , , , , , og .
-
a)
Skriv summen ledd for ledd og regn den ut.
-
b)
Bruk resultatet til å finne gjennomsnittet .
-
c)
Finn medianen.
Løsningsforslag
Oppgave 13.2.1: Vi bruker definisjonene av summetegn, gjennomsnitt og median direkte.
-
a)
.
-
b)
.
-
c)
Tallene er allerede sortert; med (oddetall) er medianen den fjerde verdien, . At gjennomsnitt og median faller sammen, tyder på en nokså symmetrisk fordeling.
Oppgave 13.2.2
Fem trykkmålinger (mmHg) er , , , og .
-
a)
Regn ut gjennomsnittet.
-
b)
Sett opp avvikene , kvadrer dem, og finn utvalgsvariansen og standardavviket . Husk å dele på .
-
c)
Finn , og kvartilbredden.
-
d)
Forklar kort hvorfor har enheten , mens har .
Løsningsforslag
Oppgave 13.2.2: Vi følger samme oppsett som i seksjonens eksempel: avvik, kvadrering, sum, og deling på .
-
a)
, så .
-
b)
Avvikene er ; kvadrert gir de , med kvadratsum . Med er og .
-
c)
Som i seksjonens eksempel med fem sorterte verdier er den andre og den fjerde: , , så .
-
d)
Variansen er et gjennomsnitt av kvadrerte avvik og arver derfor den kvadrerte enheten ; kvadratroten i bringer målet tilbake til dataenes egen enhet, .
Oppgave 13.2.3
Åtte pasienters trykk (mmHg) er , , , , , , og ; én av pasientene er glaukommistenkt.
-
a)
Regn ut både gjennomsnitt og median.
-
b)
Hvor mange av de åtte ligger på eller over gjennomsnittet?
-
c)
Er fordelingen høyre- eller venstreskjev, og hvilket sentralmål beskriver den typiske pasienten best? Begrunn.
Løsningsforslag
Oppgave 13.2.3: Vi regner begge sentralmålene og leser formen ut av dem.
-
a)
Summen er , så . Med (partall) er medianen gjennomsnittet av de to midterste (fjerde og femte) verdiene: .
-
b)
Bare , og ligger på eller over gjennomsnittet – 3 av 8; flertallet ligger under det.
-
c)
At , viser at fordelingen er høyreskjev: den ene høye verdien (, den glaukommistenkte) drar gjennomsnittet opp uten å være representativ. Medianen beskriver den typiske pasienten best og bør rapporteres med kvartilbredden.
Oppgave 13.2.4
En kollega oppsummerer trykkdataene fra forrige oppgave slik: «Gjennomsnittet er , så omtrent halvparten av pasientene ligger over .»
-
a)
Er påstanden riktig for disse dataene? Bruk tallene til å vise det.
-
b)
To sammendrag foreslås: « (gjennomsnitt SD)» og «median (IQR –)». Hvilket bør rapporteres for denne fordelingen, og hvorfor?
Løsningsforslag
Oppgave 13.2.4: Påstanden blander sammen gjennomsnitt og median; vi bruker tallene fra forrige oppgave (, , , , , , og ).
-
a)
Nei. Bare og ligger over – 2 av 8, en fjerdedel, ikke halvparten. Det er medianen som deler materialet i to like halvdeler: over medianen ligger nøyaktig fire av de åtte. Kollegaen har tillagt gjennomsnittet en egenskap som tilhører medianen; i denne høyreskjeve fordelingen ligger gjennomsnittet over medianen, så færre enn halvparten ligger over det.
-
b)
Median (IQR –) bør rapporteres. Fordelingen er høyreskjev, og den ene avlesningen på blåser opp både gjennomsnittet og standardavviket – SD-en på skyldes i stor grad denne ene verdien. Median og kvartilbredde er robuste mot uteliggeren og beskriver de typiske pasientene ærlig, i tråd med seksjonens regel: ligger gjennomsnittet merkbart over medianen, rapporter median med kvartilbredde.
Oppgave 13.2.5
-
a)
Velg riktig figurtype (histogram, boksplott eller spredningsdiagram) for hvert spørsmål, og begrunn i én setning: (i) «Er hornhinnetykkelsen forbundet med målt trykk?» (ii) «Er trykkfordelingen i klinikken skjev?» (iii) «Har menn høyere eller mer spredt trykk enn kvinner?»
-
b)
Konstruer selv et datasett med seks realistiske trykkverdier (mellom og ) der gjennomsnittet ligger minst over medianen. Regn ut begge, og oppgi hvilken vei fordelingen er skjev.
Løsningsforslag
Oppgave 13.2.5:
-
a)
Vi bruker beslutningstavlen fra seksjonen. (i) Spredningsdiagram – spørsmålet gjelder samvariasjon mellom to kontinuerlige variabler (CCT og IOP). (ii) Histogram – spørsmålet gjelder formen på fordelingen til én variabel. (iii) Boksplott – spørsmålet sammenligner median og spredning mellom to grupper (menn og kvinner), gjerne som ett boksplott per gruppe side om side.
-
b)
Åpen deloppgave; ingen entydig fasit. Vurderingsmoment: datasettet godkjennes når alle seks verdiene ligger mellom og og differansen , regnet ut av studenten selv, er minst – det krever typisk flere lave verdier tett samlet og én eller to høye, og fordelingen skal da oppgis som høyreskjev.