Hopp til innholdet

Kapittel 13 · Statistikk · 13.2

Deskriptiv statistikk

Det første du gjør med et ferskt datasett, er å beskrive det: å presse en uoversiktlig kolonne med tall sammen til noen få størrelser som fanger hvor tyngdepunktet ligger, hvor mye tallene spriker, og hvilken form fordelingen har. Dette er det første av de fire formålene fra forrige seksjon – å beskrive; å sammenligne, forklare og vurdere samsvar kommer senere. Men selv en ren beskrivelse krever at du velger riktig: et gjennomsnitt kan villede når fordelingen er skjev, og ett enkelt tall skjuler ofte det et bilde ville avslørt. Vi bygger verktøyene i tur – først en kompakt skrivemåte for summer, så sentralmålene og spredningsmålene, og til slutt måtene å se fordelingen på.

Summetegnet

Nesten alt som følger, bygger på å legge sammen mange tall, og for det trenger vi en kompakt skrivemåte. Den store greske bokstaven sigma, Σ, brukes som et summetegn – en operator som sier «legg sammen». Skriver vi

∑i=1nxi=x1+x2+⋯+xn,

leser vi det som «summen av xi når i løper fra 1 til n». Bokstaven i under tegnet er indeksen (tellevariabelen); tallet 1 er den nedre grensen og n den øvre; og xi er leddet som legges til for hver verdi av i. Indeksen er bare et navn – ∑j=1nxj betyr nøyaktig det samme.

Et konkret tilfelle gjør notasjonen ufarlig. Fem trykkmålinger (mmHg) er x1=13, x2=14, x3=16, x4=17 og x5=20. Da er

∑i=15xi=13+14+16+17+20=80.

Tegnet gjør ikke noe mystisk; det er en instruks om å legge sammen, skrevet én gang i stedet for at alle leddene ramses opp.

To regneregler kommer vi til å bruke uten videre. En konstant faktor kan settes utenfor summen,

∑i=1n(a⁢xi)=a⁢∑i=1nxi,

fordi a⁢x1+a⁢x2+⋯=a⁢(x1+x2+⋯) er den distributive loven fra kapittelet om de vanlige regneoperasjonene. Og en sum av to ledd kan deles i to summer,

∑i=1n(xi+yi)=∑i=1nxi+∑i=1nyi,

siden addisjonen kan omordnes fritt. Overbevis deg om begge ved å skrive ut noen få ledd.

Legg merke til at det er den store Σ som er summetegnet – en operator med indeks og grenser. Den lille σ, som dukker opp litt senere som populasjonens standardavvik, er noe helt annet; hold de to fra hverandre.

Sentralmål: gjennomsnitt, median og typetall

Et sentralmål er ett tall som skal representere «midten» av dataene. Det finnes flere, de er ikke like, og valget mellom dem er et av seksjonens hovedpoenger.

Det vanligste er gjennomsnittet (det aritmetiske middelet). For et utvalg på n observasjoner x1,x2,…,xn skrives det x¯ («x-strek») og er summen delt på antallet:

x¯=1n⁢∑i=1nxi.

Gjennomsnittet har samme enhet som dataene. Denne regneoperasjonen har du gjort før: den gjennomsnittlige keratometriverdien K=K1+K22 fra kapittelet om regnerekkefølgen er nettopp et gjennomsnitt av to tall. Her formaliserer vi den som et sentralmål for vilkårlig mange tall.

Gjennomsnittet har en svakhet: det trekkes mot ekstreme verdier. Ett uvanlig høyt trykk i et ellers normalt materiale drar x¯ oppover, selv om det ikke er representativt for den typiske pasienten. Her hjelper medianen: den midterste verdien når observasjonene sorteres i stigende rekkefølge. Er n et oddetall, er medianen den midterste observasjonen; er n et partall, er den gjennomsnittet av de to midterste. Medianen bryr seg bare om rekkefølgen, ikke om hvor ekstreme halene er, og er derfor robust mot uteliggere og skjevhet.

Et tredje mål, typetallet (modus), er den verdien som forekommer hyppigst. Det er det eneste sentralmålet som gir mening for rene kategoriske data – du kan snakke om den vanligste øyenfargen, men ikke om noen «gjennomsnittsfarge».

Eksempel 13.2.1

Fem trykkmålinger (mmHg) er 12, 14, 15, 17 og 17. Skriv summen ∑i=15xi ledd for ledd, regn ut gjennomsnittet, og finn medianen.

Løsning: Vi bruker definisjonene av gjennomsnitt og median direkte. Summen er

∑i=15xi=12+14+15+17+17=75,

så gjennomsnittet blir x¯=15⋅75=15 mmHg. Tallene er allerede sortert; med n=5 (oddetall) er medianen den tredje verdien, 15 mmHg. Gjennomsnitt og median faller sammen her – et første tegn på at fordelingen er nokså symmetrisk.

Spredning: varians, standardavvik og kvartilbredde

Et sentralmål alene sier ingenting om hvor mye dataene spriker. To klinikker kan ha samme gjennomsnittstrykk, den ene med tallene tett samlet og den andre med stor spredning – og den forskjellen er ofte det klinisk interessante.

Utgangspunktet er avviket xi−x¯: hvor langt hver observasjon ligger fra gjennomsnittet. Å summere avvikene direkte fører ingen vei, for de summerer alltid til null – de positive og negative opphever hverandre, og det er nettopp en egenskap ved gjennomsnittet. Vi kvadrerer derfor hvert avvik før vi summerer, slik at fortegnet forsvinner og store avvik veier tyngre. Størrelsen ∑i=1n(xi−x¯)2 kalles kvadratsummen.

Utvalgsvariansen er kvadratsummen delt på n−1:

s2=1n−1⁢∑i=1n(xi−x¯)2.

At vi deler på n−1 og ikke på n, overrasker de fleste. Grunnen er at avvikene ikke er fritt varierende: siden de summerer til null, ligger det siste avviket fast så snart de n−1 første er kjent. Det er altså bare n−1 frihetsgrader (forkortet fg) i kvadratsummen, og å dele på antallet frihetsgrader gir et forventningsrett estimat – i snitt verken for stort eller for lite – av den sanne variansen i populasjonen. Delte vi på n, ville vi systematisk underestimere den. Denne justeringen kalles Bessels korreksjon.

Variansen har kvadrert enhet (mmHg2), som er tungvint å tolke. Derfor tar vi kvadratroten og får utvalgsstandardavviket, forkortet SD (av engelsk standard deviation):

s=s2.

Standardavviket har igjen samme enhet som dataene og måler en typisk avstand fra gjennomsnittet. Én finesse følger med kvadratroten: det er s2 som er forventningsrett for populasjonsvariansen, ikke s for populasjonsstandardavviket – kvadratroten er ikke en lineær operasjon, så s underestimerer så vidt. Skjevheten er liten og krymper raskt med n, og i praksis brukes s uten korreksjon.

Standardavviket bygger på gjennomsnittet og arver dermed dets følsomhet for uteliggere. To robuste spredningsmål bygger i stedet på rekkefølgen. Variasjonsbredden (range) er ganske enkelt største minus minste verdi; den er lettfattelig, men svært følsom, siden den bruker bare de to mest ekstreme observasjonene. Kvartilene deler den sorterte rekka i fire like store deler: en fjerdedel av observasjonene ligger under den første kvartilen Q1, halvparten under den andre Q2 (som er nettopp medianen), og tre fjerdedeler under den tredje Q3. Kvartilbredden (interkvartilbredden),

IQR=Q3−Q1,

fanger spennet til de midtre 50 % av dataene og er robust mot uteliggere på samme måte som medianen.

Eksempel 13.2.2

De fem avlesningene 13, 14, 16, 17 og 20 mmHg har gjennomsnitt x¯=16 mmHg. Regn ut utvalgsvariansen og standardavviket for hånd, og oppgi kvartilbredden. Hvorfor har s enheten mmHg, mens s2 har mmHg2?

Løsning: Vi setter opp avvikene, kvadrerer dem, summerer og deler på n−1.

xi−x¯ :−3,−2, 0, 1, 4,
(xi−x¯)2 :9, 4, 0, 1, 16,
∑i=15(xi−x¯)2 =30.

Med n=5 er s2=305−1=304=7.5 mmHg2, og s=7.5≈2.74 mmHg. Kvartilene er Q1=14 og Q3=17, så kvartilbredden er IQR=3 mmHg. Variansen er et gjennomsnitt av kvadrerte avvik og har derfor kvadrert enhet; standardavviket tar kvadratroten og bringer målet tilbake til dataenes egen enhet, mmHg.

R-kode

# Fem GAT-avlesninger (mmHg) -- sentralmaal og spredning
iop <- c(13, 14, 16, 17, 20)
mean(iop) #> 16
median(iop) #> 16
var(iop) #> 7.5 # deler paa n - 1 (= 4)
sd(iop) #> 2.738613 # samme enhet som dataene

Funksjonene var() og sd() i R deler på n−1 som standard, akkurat som håndregningen over – tallene 7.5 og 7.5≈2.738613 er de samme.

Utvalg og populasjon

Forrige seksjon skilte utvalget (det du målte) fra populasjonen (det du vil uttale deg om). Nå som gjennomsnitt, varians og standardavvik er definert, kan vi feste hele symbolsettet. De to nivåene bruker ulike bokstaver og – for variansen – ulik nevner.

Utvalg (statistikk) Populasjon (parameter)
Størrelse n N
Gjennomsnitt x¯=1n⁢∑i=1nxi μ=1N⁢∑i=1Nxi
Varians s2=1n−1⁢∑i=1n(xi−x¯)2 σ2=1N⁢∑i=1N(xi−μ)2
Standardavvik s=s2 σ=σ2

Regelen bak bokstavvalget er verdt å merke seg: latinske bokstaver (x¯, s, n) står for statistikker – tall du regner ut fra utvalget – mens greske bokstaver (μ, σ) står for parametere, de sanne, ukjente tallene for populasjonen. Populasjonsvariansen deler på N fordi gjennomsnittet μ da er en kjent, fast størrelse; utvalgsvariansen deler på n−1 fordi x¯ er regnet ut fra de samme dataene og koster én frihetsgrad. Nesten alltid er det utvalgsstørrelsene du har, og populasjonsstørrelsene du er ute etter.

Klinikkdatasettet

Gjennom resten av kapittelet vender vi tilbake til ett gjennomgående datasett fra en glaukomklinikk: 71 pasienter med primær åpenvinkelglaukom under trykksenkende behandling, ett høyre øye per pasient, publisert som åpne data sammen med en japansk studie av tonometre [181]. Hver pasient er registrert med alder, kjønn, sfærisk ekvivalent (SER), aksiallengde (AL), gjennomsnittlig keratometri (K, regnet fra hornhinnens krumningsradius r i millimeter som K=337.5/r, altså med keratometerindeksen nk=1.3375 fra kapittelet om geometrisk optikk), hornhinnens sentraltykkelse (CCT) og trykket målt med tre instrumenter på det samme øyet samme dag. Referansen er Goldmann-applanasjon (kolonnen IOP), som du kjenner fra kapittelet om mekanikk. Et berøringsfritt tonometer (NCT, av engelsk non-contact tonometer) flater hornhinnen med en kort luftstråle og leser trykket av hvor kraftig strålen må være for å flate den – uten kontakt med øyet og uten bedøvelse. Corvis ST er også berøringsfritt, men filmer hornhinnens deformasjon under luftstrålen med et høyhastighetskamera; det gir et ukorrigert trykk (kolonnen Corvis) og en biomekanisk korrigert verdi (bIOP), der programvaren har justert for hornhinnens tykkelse og dynamiske respons og for pasientens alder, og det måler CCT i samme omgang. Tabell 13.1 viser de tolv første pasientene; hele settet står som kjørbar R-kode i Tillegg A, slik at alt som regnes her, kan gjøres om igjen. Verdiene er målte, publiserte forskningsdata utgitt med åpen lisens (CC BY 4.0), ikke tall valgt for et pent regnestykke – og det forplikter: trykktallene er målt hos pasienter under trykksenkende behandling, så fordelingen viser et behandlet og kontrollert trykk, ikke trykkfordelingen i en ubehandlet befolkning. Det kommer vi tilbake til flere ganger. For denne seksjonen er det Goldmann-kolonnen (IOP) vi skal se nærmere på.

Tabell 13.1: Klinikkdatasettet, de tolv første av 71 pasienter (ett høyre øye per pasient); de fire trykkolonnene IOP (Goldmann), NCT, Corvis og bIOP er i mmHg. Hele settet står i Tillegg A. Data fra [181].
id Alder (år) Kjønn SER (D) AL (mm) K (D) IOP NCT Corvis bIOP CCT (µ⁢m)
1 43 M -5.75 24.79 45.36 16.0 18 17.0 16.0 560
2 44 M -7.75 27.98 44.44 11.3 12 8.3 8.7 532
3 44 K -10.125 29.21 41.26 15.0 17 13.7 14.1 513
4 49 K -10.75 27.02 45.64 16.0 16 14.5 13.4 559
5 49 K -0.125 23.56 43.27 11.0 10 7.2 8.8 463
6 49 M -8.00 27.06 43.66 11.3 12 10.0 9.6 553
7 50 M -6.75 24.95 45.98 15.0 15 12.0 11.3 557
8 50 M -5.375 26.34 43.41 10.0 9 8.5 9.3 501
9 50 M -9.50 28.26 42.40 16.0 20 15.7 15.2 534
10 51 M -5.00 25.48 43.86 17.0 16 11.7 10.4 580
11 52 M -5.25 26.81 42.86 12.0 12 8.5 8.3 549
12 53 K -6.375 25.70 46.68 14.0 13 9.7 9.9 523

Utdraget er de tolv første radene slik fila er publisert (de første radene i fila ligger ordnet etter alder, derfor ser kolonnen sortert ut); hele settet spenner fra 31 til 79 år, med 31 kvinner og 40 menn.

Å se på dataene: histogram, boksplott og spredningsdiagram

Før du regner ut et eneste sammendragstall, bør du se på fordelingen. Et bilde avslører form, skjevhet og uteliggere som et gjennomsnitt og et standardavvik alene skjuler. Tre figurtyper dekker de fleste behovene, og hvilken du velger, følger av spørsmålet du stiller.

Et histogram deler tallområdet i like brede intervaller og tegner en stolpe for hvor mange observasjoner som faller i hvert. Det viser fordelingens form – hvor tyngdepunktet ligger, og om den er symmetrisk eller har en hale til én side. Histogrammet av trykket i klinikkdatasettet har tyngdepunktet rundt 12–16 mmHg og ingen hale å snakke om – fordelingen er om lag symmetrisk:

Histogram over Goldmann-trykket hos de 71 pasientene i klinikkdatasettet, med stolpebredde 2 mmHg; legg merke til at gjennomsnittet (13.46 mmHg) og medianen (13.70 mmHg) nesten faller sammen – fordelingen har ingen hale.
Figur 13.2: Histogram over Goldmann-trykket hos de 71 pasientene i klinikkdatasettet, med stolpebredde 2 mmHg; legg merke til at gjennomsnittet (13.46 mmHg) og medianen (13.70 mmHg) nesten faller sammen – fordelingen har ingen hale.

Et boksplott (etter Tukey) komprimerer fordelingen til fem tall. Boksen strekker seg fra Q1 til Q3, så bredden er kvartilbredden IQR, og en strek inni boksen markerer medianen. Fra boksen går «værhår» ut til den mest ekstreme observasjonen som fortsatt ligger innenfor 1.5⋅IQR fra nærmeste kvartil; observasjoner utenfor tegnes som enkeltpunkter og flagges som mulige uteliggere [182]. For trykket er Q1=12.0, medianen 13.7 og Q3=15.0 mmHg, så IQR=3.0 mmHg, og grensene for værhårene ligger ved 12.0−1.5⋅3.0=7.5 og 15.0+1.5⋅3.0=19.5 mmHg. Alle 71 avlesningene ligger innenfor (laveste 8.0, høyeste 18.7 mmHg), så ingen tegnes som uteligger:

Boksplott av de samme trykkmålingene, med de fem tallene merket i figuren; ingen avlesning faller utenfor værhårene.
Figur 13.3: Boksplott av de samme trykkmålingene, med de fem tallene merket i figuren; ingen avlesning faller utenfor værhårene.

Værhårene er omtrent like lange – 4.0 mmHg nedover og 3.7 mmHg oppover – og ingen avlesning faller utenfor, så boksplottet viser ingen skjevhet å snakke om. Det er langt fra alltid slik, og seksjonen kommer straks tilbake til hvordan et skjevt materiale ser ut og hva du gjør med det.

Den tredje figurtypen, spredningsdiagrammet, tegner ett punkt per enhet med den ene variabelen langs den vannrette og den andre langs den loddrette aksen, og brukes til å se om to kontinuerlige variabler henger sammen. Vi bruker det for fullt i seksjonen om korrelasjon og regresjon – på et annet datasett, biometridatasettet: 74 friske voksne fra en norsk studie, ett høyre øye per person, med refraksjon og aksiallengde [183], som innføres for fullt der; her plasserer vi figurtypen bare i oversikten. Grunnregelen er å se på dataene før du tester – tavlen nedenfor knytter de tre figurtypene til spørsmålet hver av dem svarer på.

Spørsmålet du stiller Figurtype Hva den viser
Hvordan er fordelingen til én variabel? Histogram Form, skjevhet og topper
Hvordan sammenligne median og spredning mellom grupper, og se uteliggere? Boksplott Median, kvartilbredde og ekstremer
Henger to kontinuerlige variabler sammen? Spredningsdiagram Retning og styrke på samvariasjonen

I R gjøres dette med korte kommandoer. summary() gir de fem tallene i boksplottet pluss gjennomsnittet, mens hist() og boxplot() tegner figur 13.2 og 13.3.

R-kode

# Klinikkdatasettets IOP-kolonne (Goldmann, 71 pasienter)
summary(IOP)
#> Min. 1st Qu. Median Mean 3rd Qu. Max.
#> 8.00 12.00 13.70 13.46 15.00 18.70
IQR(IOP) #> 3
sd(IOP) #> 2.108164
# Mean 13.46 og Median 13.70 ligger naer hverandre => om lag symmetrisk

R-kode

# Se paa dataene foer du velger sentralmaal
hist(IOP, breaks = seq(8, 20, 2), right = FALSE, xlab = "IOP (mmHg)", main = "")
boxplot(IOP, ylab = "IOP (mmHg)") # kort boks, vaerhaar omtrent like lange, ingen uteliggere

R-kode

# To kontinuerlige variabler: henger de sammen? (biometridatasettet, 74 oeyne)
plot(AL ~ SER, data = biometri, xlab = "SER (D)", ylab = "Aksiallengde (mm)")
# Punktskyen faller mot hoyre -- lengre oyne er mer myope
# (samvariasjonen tallfestes i seksjonen om korrelasjon og regresjon)

Skjevhet og log-transformasjon

Formen på en fordeling avgjør hvilket sentralmål som er ærligst. I en symmetrisk fordeling faller gjennomsnitt og median omtrent sammen. I en høyreskjev (positivt skjev) fordeling – med en hale av høye verdier – trekkes gjennomsnittet oppover av halen mens medianen står imot, så x¯>median. I en venstreskjev fordeling er det motsatt, x¯<median. En praktisk regel følger: ligger gjennomsnittet merkbart over medianen, mistenk en høyreskjev hale, og rapporter da median med kvartilbredde heller enn gjennomsnitt med standardavvik.

Trykket i klinikkdatasettet er ikke et slikt tilfelle, og det er lærerikt i seg selv. Gjennomsnittet er x¯=13.46 mmHg og medianen 13.70 mmHg – de faller nesten sammen, og 36 av de 71 pasientene ligger på eller over gjennomsnittet. Et tallmål på asymmetrien, utvalgsskjevheten g1 (positiv ved en høyre hale, negativ ved en venstre), er her g1=−0.06, nær null. Gjennomsnitt med standardavvik er da et ærlig sammendrag. Husk hvem tallene kommer fra: 71 pasienter med åpenvinkelglaukom under trykksenkende behandling [181]. Et behandlet og kontrollert trykk har ikke nødvendigvis den halen av høye verdier du kan vente i et ubehandlet materiale – de høye verdiene er nettopp dem behandlingen retter seg mot – så formen forteller like mye om kohorten som om trykk i sin alminnelighet.

Eksempel 13.2.3

Åtte pasienters trykk (mmHg), sortert, er 11, 12, 13, 13, 14, 16, 17 og 24. Regn ut gjennomsnitt og median, tell hvor mange pasienter som ligger på eller over gjennomsnittet, og avgjør ut fra dette og formen på et boksplott hvilket sentralmål som beskriver den typiske pasienten best.

Løsning: Vi knytter sammen sentralmål, opptelling og form. Summen er 120, så x¯=120/8=15 mmHg. De to midterste (fjerde og femte) verdiene er 13 og 14, så medianen er 13+142=13.5 mmHg. Bare tre av de åtte – 16, 17 og 24 – ligger på eller over gjennomsnittet; flertallet ligger under det. At x¯=15>median=13.5, forteller at fordelingen er høyreskjev: den ene høye verdien (24 mmHg) drar gjennomsnittet opp. I et boksplott ville medianstreken ligge lavt i boksen med et langt øvre værhår. Medianen 13.5 mmHg beskriver den typiske pasienten best og bør rapporteres sammen med kvartilbredden: median 13.5 mmHg; høyreskjev, så median er mest representativ.

Mange positive kliniske størrelser er høyreskjeve på nettopp denne måten. Et grep som ofte hjelper, er å log-transformere dataene – å erstatte hver verdi med tierlogaritmen sin. Husk fra kapittelet om eksponentialfunksjoner og logaritmer at logaritmen komprimerer store tall mer enn små; en hale av høye verdier trekkes derfor innover, og fordelingen blir mer symmetrisk. Det er den samme tierlogaritmen som ligger bak LogMAR-skalaen og optisk tetthet. Betrakt det høyreskjeve settet {2,3,3,4,5,7,10,18}: her er gjennomsnittet 6.5 og medianen 4.5, og utvalgsskjevheten er g1=1.39. Tar vi tierlogaritmen av hver verdi, faller skjevheten til g1=0.50 – fordelingen er blitt nesten symmetrisk, og gjennomsnitt og median har rykket sammen.

R-kode

# Skjevhet og log-transformasjon (tierlogaritmen fra logaritmekapittelet)
x <- c(2, 3, 3, 4, 5, 7, 10, 18)
mean(x) #> 6.5
median(x) #> 4.5 # mean > median: hoyreskjev
mean(log10(x)) #> 0.7071 # log10 trekker den hoye halen inn
median(log10(x)) #> 0.6505 # mean og median naa naer hverandre

Eksempel 13.2.4

Du skal oppsummere trykket (IOP) for alle 71 pasientene i klinikkdatasettet før noen videre analyse settes i gang. Med sammendragstallene og figur 13.2 og 13.3 for hånden: hvilket sentralmål og hvilket spredningsmål bør du rapportere, og hvilke figurer forsvarer valget?

Løsning: Vi leser av summary() og de to figurene og bruker beslutningstavlen. Sammendraget gir gjennomsnitt 13.46 mmHg og median 13.70 mmHg, kvartilbredde 3.0 mmHg og standardavvik 2.11 mmHg; at gjennomsnitt og median nesten faller sammen, peker mot en symmetrisk fordeling. Histogrammet bekrefter det – ingen hale til noen side – og boksplottet viser omtrent like lange værhår og ingen uteliggere. For én kontinuerlig variabels form er histogrammet riktig figur, og for median, spredning og uteliggere er boksplottet det – akkurat de to første radene i beslutningstavlen. Fordi fordelingen er om lag symmetrisk, kan du trygt rapportere gjennomsnitt 13.46 mmHg med SD 2.11 mmHg; median 13.7 mmHg med IQR 3.0 mmHg er like forsvarlig, og de to sier her det samme. For høyreskjeve, positive størrelser er log-transformasjonen det naturlige neste grepet – her trengs den ikke. At symmetrien ikke er noen selvfølge, viser Corvis-kolonnen i det samme datasettet: der er g1=1.17, og én avlesning på 22.0 mmHg står mot en median på 10.2 mmHg, så «se på dataene før du velger sentralmål» gjelder kolonne for kolonne.

Oppgaver

Oppgave 13.2.1

Sju pasienters trykk (mmHg) er 11, 13, 14, 15, 16, 18 og 18.

  1. a)

    Skriv summen ∑i=17xi ledd for ledd og regn den ut.

  2. b)

    Bruk resultatet til å finne gjennomsnittet x¯.

  3. c)

    Finn medianen.

Løsningsforslag

Oppgave 13.2.1: Vi bruker definisjonene av summetegn, gjennomsnitt og median direkte.

  1. a)

    ∑i=17xi=11+13+14+15+16+18+18=105 mmHg.

  2. b)

    x¯=17⋅105=15 mmHg.

  3. c)

    Tallene er allerede sortert; med n=7 (oddetall) er medianen den fjerde verdien, 15 mmHg. At gjennomsnitt og median faller sammen, tyder på en nokså symmetrisk fordeling.

Oppgave 13.2.2

Fem trykkmålinger (mmHg) er 11, 13, 15, 17 og 19.

  1. a)

    Regn ut gjennomsnittet.

  2. b)

    Sett opp avvikene xi−x¯, kvadrer dem, og finn utvalgsvariansen s2 og standardavviket s. Husk å dele på n−1.

  3. c)

    Finn Q1, Q3 og kvartilbredden.

  4. d)

    Forklar kort hvorfor s har enheten mmHg, mens s2 har mmHg2.

Løsningsforslag

Oppgave 13.2.2: Vi følger samme oppsett som i seksjonens eksempel: avvik, kvadrering, sum, og deling på n−1.

  1. a)

    ∑i=15xi=11+13+15+17+19=75, så x¯=755=15 mmHg.

  2. b)

    Avvikene xi−x¯ er −4,−2, 0, 2, 4; kvadrert gir de 16, 4, 0, 4, 16, med kvadratsum ∑i=15(xi−x¯)2=40. Med n=5 er s2=405−1=10 mmHg2 og s=10≈3.16 mmHg.

  3. c)

    Som i seksjonens eksempel med fem sorterte verdier er Q1 den andre og Q3 den fjerde: Q1=13 mmHg, Q3=17 mmHg, så IQR=17−13=4 mmHg.

  4. d)

    Variansen er et gjennomsnitt av kvadrerte avvik og arver derfor den kvadrerte enheten mmHg2; kvadratroten i s=s2 bringer målet tilbake til dataenes egen enhet, mmHg.

Oppgave 13.2.3

Åtte pasienters trykk (mmHg) er 12, 13, 14, 14, 15, 16, 18 og 26; én av pasientene er glaukommistenkt.

  1. a)

    Regn ut både gjennomsnitt og median.

  2. b)

    Hvor mange av de åtte ligger på eller over gjennomsnittet?

  3. c)

    Er fordelingen høyre- eller venstreskjev, og hvilket sentralmål beskriver den typiske pasienten best? Begrunn.

Løsningsforslag

Oppgave 13.2.3: Vi regner begge sentralmålene og leser formen ut av dem.

  1. a)

    Summen er 12+13+14+14+15+16+18+26=128, så x¯=1288=16 mmHg. Med n=8 (partall) er medianen gjennomsnittet av de to midterste (fjerde og femte) verdiene: 14+152=14.5 mmHg.

  2. b)

    Bare 16, 18 og 26 ligger på eller over gjennomsnittet – 3 av 8; flertallet ligger under det.

  3. c)

    At x¯=16>median=14.5, viser at fordelingen er høyreskjev: den ene høye verdien (26 mmHg, den glaukommistenkte) drar gjennomsnittet opp uten å være representativ. Medianen 14.5 mmHg beskriver den typiske pasienten best og bør rapporteres med kvartilbredden.

Oppgave 13.2.4

En kollega oppsummerer trykkdataene fra forrige oppgave slik: «Gjennomsnittet er 16 mmHg, så omtrent halvparten av pasientene ligger over 16 mmHg.»

  1. a)

    Er påstanden riktig for disse dataene? Bruk tallene til å vise det.

  2. b)

    To sammendrag foreslås: «16±4.4 mmHg (gjennomsnitt ± SD)» og «median 14.5 mmHg (IQR 13.75–16.5)». Hvilket bør rapporteres for denne fordelingen, og hvorfor?

Løsningsforslag

Oppgave 13.2.4: Påstanden blander sammen gjennomsnitt og median; vi bruker tallene fra forrige oppgave (12, 13, 14, 14, 15, 16, 18 og 26 mmHg).

  1. a)

    Nei. Bare 18 og 26 ligger over 16 mmHg – 2 av 8, en fjerdedel, ikke halvparten. Det er medianen som deler materialet i to like halvdeler: over medianen 14.5 mmHg ligger nøyaktig fire av de åtte. Kollegaen har tillagt gjennomsnittet en egenskap som tilhører medianen; i denne høyreskjeve fordelingen ligger gjennomsnittet over medianen, så færre enn halvparten ligger over det.

  2. b)

    Median 14.5 mmHg (IQR 13.75–16.5) bør rapporteres. Fordelingen er høyreskjev, og den ene avlesningen på 26 mmHg blåser opp både gjennomsnittet og standardavviket – SD-en på 4.4 mmHg skyldes i stor grad denne ene verdien. Median og kvartilbredde er robuste mot uteliggeren og beskriver de typiske pasientene ærlig, i tråd med seksjonens regel: ligger gjennomsnittet merkbart over medianen, rapporter median med kvartilbredde.

Oppgave 13.2.5

  1. a)

    Velg riktig figurtype (histogram, boksplott eller spredningsdiagram) for hvert spørsmål, og begrunn i én setning: (i) «Er hornhinnetykkelsen forbundet med målt trykk?» (ii) «Er trykkfordelingen i klinikken skjev?» (iii) «Har menn høyere eller mer spredt trykk enn kvinner?»

  2. b)

    Konstruer selv et datasett med seks realistiske trykkverdier (mellom 10 og 24 mmHg) der gjennomsnittet ligger minst 2 mmHg over medianen. Regn ut begge, og oppgi hvilken vei fordelingen er skjev.

Løsningsforslag

Oppgave 13.2.5:

  1. a)

    Vi bruker beslutningstavlen fra seksjonen. (i) Spredningsdiagram – spørsmålet gjelder samvariasjon mellom to kontinuerlige variabler (CCT og IOP). (ii) Histogram – spørsmålet gjelder formen på fordelingen til én variabel. (iii) Boksplott – spørsmålet sammenligner median og spredning mellom to grupper (menn og kvinner), gjerne som ett boksplott per gruppe side om side.

  2. b)

    Åpen deloppgave; ingen entydig fasit. Vurderingsmoment: datasettet godkjennes når alle seks verdiene ligger mellom 10 og 24 mmHg og differansen x¯−median, regnet ut av studenten selv, er minst 2 mmHg – det krever typisk flere lave verdier tett samlet og én eller to høye, og fordelingen skal da oppgis som høyreskjev.

Alle løsningsforslag til kapittel 13