Kapittel 13 · Statistikk · 13.6
Statistisk inferens: konfidensintervall og hypotesetesting
De forrige seksjonene beskrev et utvalg og bygde sannsynlighetsapparatet bak variasjonen. Nå tar vi det avgjørende skrittet: fra det målte utvalget til den ukjente populasjonen bak det. Spørsmålet som styrer seksjonen, er hva du egentlig vil oppnå med en slik slutning, og det faller i to. Det ene: hvor presist anslår utvalget den størrelsen jeg er ute etter – gjennomsnittstrykket i populasjonen, andelen med et funn? Det andre: er en forskjell jeg ser i dataene – mellom to instrumenter, to grupper – mer enn det tilfeldige sprik jeg måtte vente uansett? Det første svares med et konfidensintervall, det andre med en hypotesetest, og de to viser seg å være to sider av samme sak. Dette er seksjonen der løftet fra innledningen om å kunne tolke konfidensintervaller, p-verdier og effektstørrelser korrekt blir innfridd.
Fra punktestimat til intervall
Regner du ut gjennomsnittstrykket i klinikkdatasettet, har du et punktestimat: ett tall som er ditt beste anslag på populasjonsgjennomsnittet . Andelen myope i utvalget (med myopi definert som SER [188]), – hatten markerer at tallet er et anslag regnet fra utvalget, ikke den sanne verdien – er på samme måte et punktestimat for populasjonsandelen . Et punktestimat har en god egenskap – gjennomsnittet er forventningsrett, det treffer i snitt over mange utvalg – på samme måte som -nevneren sikret at variansen ble forventningsrett i seksjonen om deskriptiv statistikk, men uten at gjennomsnittet trenger noen tilsvarende korreksjon. Punktestimatet har likevel en åpenbar svakhet: det er nesten aldri nøyaktig lik den sanne verdien, og tallet alene sier ingenting om hvor langt unna det kan ligge. Måler du et nytt utvalg, får du et litt annet gjennomsnitt. Derfor rapporterer vi ikke et punktestimat bart, men med en feilmargin rundt seg – et helt intervall av verdier som er forenlige med dataene. Det intervallet er kjernen i det som følger.
Konfidensintervall for et gjennomsnitt
Et konfidensintervall (forkortet KI) er et tallintervall som med en oppgitt grad av tillit fanger den ukjente parameteren. Graden av tillit – konfidensnivået, oftest – sier hvor ofte metoden treffer; tolkningen kommer vi tilbake til med omhu, for den er lettere å si feil enn riktig. Intervallet bygges rundt punktestimatet: i midten, pluss/minus en feilmargin satt av hvor mye gjennomsnittet spriker fra utvalg til utvalg. Og den sprikingen kjenner vi allerede – det er standardfeilen fra seksjonene om måling og om normalfordelingen.
Hvor stor feilmarginen skal være i enheter av SEM, avhenger av om vi kjenner populasjonens spredning på forhånd. Det sjeldne, enkle tilfellet er at er kjent – for eksempel en måleusikkerhet oppgitt av en instrumentprodusent. Da er gjennomsnittet tilnærmet normalfordelt (sentralgrenseteoremet), og et konfidensintervall for er
der den kritiske verdien hentes rett fra standardnormalfordelingen. Husk fra seksjonen om normalfordelingen de sentrale -verdiene: gir , gir , og gir .
Det vanlige tilfellet er derimot at er ukjent, og at vi må nøye oss med utvalgets eget standardavvik i stedet. Å bytte den faste med den tilfeldige koster noe: estimatet av spredningen er selv usikkert, mest når er lite. For å betale for det bruker vi en litt bredere fordeling enn normalfordelingen – t-fordelingen (Students t-fordeling). Den er klokkeformet og symmetrisk som normalfordelingen, men har tyngre haler, og formen avhenger av frihetsgradene – de samme frihetsgradene som variansen kostet i seksjonen om deskriptiv statistikk. Vi oppgir denne fordelingen og utleder den ikke; det du trenger å vite, er at den standardiserte størrelsen følger en t-fordeling med frihetsgrader, og at konfidensintervallet for da blir
med den kritiske verdien lest fra t-fordelingen med frihetsgrader. Fordi t-fordelingen har tyngre haler, er alltid større enn den tilsvarende – intervallet blir litt bredere, som seg hør og bør når vi vet mindre. For er ved , ved og ved ; alle ligger over , men nærmer seg den etter hvert som – og dermed frihetsgradene – vokser. For store utvalg er forskjellen mellom t og z uten praktisk betydning.
Eksempel 13.6.1
Ni hornhinner får målt sentraltykkelsen (CCT), med gjennomsnitt og standardavvik . Populasjonens spredning er ukjent. Bruk (fg ) og finn et -konfidensintervall for den gjennomsnittlige sentraltykkelsen.
Løsning: Siden er ukjent, bruker vi t-intervallet . Standardfeilen er
og feilmarginen . Intervallet blir
De ni målingene er altså forenlige med et sant gjennomsnitt hvor som helst mellom om lag og – et ganske vidt spenn, nettopp fordi er lite.
I R gjøres t-intervallet med t.test(), som skriver konfidensintervallet rett ut. Vi bruker Goldmann-kolonnen i klinikkdatasettet ().
R-kode
Bredden på et konfidensintervall styres av tre ting, alle synlige i formelen . Høyere konfidensnivå gir større og dermed bredere intervall – vil du være sikrere på å fange , må du godta et vagere anslag. Større spredning gir bredere intervall – rotete data gir et mindre presist estimat. Og større gir smalere intervall, men bare som : for å halvere bredden må du firedoble antallet målinger, den samme loven som styrte standardfeilen. Dette er den kvantitative kjernen i at «flere målinger gir et sikrere estimat».
Eksempel 13.6.2
En autorefraktor har et kjent målestandardavvik, oppgitt av produsenten og her satt til en typisk verdi . Du gjentar målingen ganger på det samme øyet og får gjennomsnitt . (a) Regn ut et -konfidensintervall for øyets sanne sfæriske ekvivalent. (b) Hvor mange målinger måtte du gjort for å halvere bredden på intervallet?
Løsning: Fordi målestandardavviket er kjent her, er det -intervallet – ikke t-intervallet – som gjelder. Vi bruker . For (a) er standardfeilen
og feilmarginen . Intervallet blir
For (b): bredden er proporsjonal med . For å halvere den må dobles, altså firedobles – fra til målinger. Merk at valget av kritisk verdi fulgte av hva vi visste: en kjent ga , mens et ukjent ville krevd (og dermed et litt bredere intervall).
Hva et konfidensintervall betyr – og ikke betyr
Konfidensnivået er lett å si feil, så det er verdt å være nøyaktig. Tenk deg at du gjentar hele studien mange ganger – nytt utvalg, nytt gjennomsnitt, nytt intervall hver gang. Et -konfidensintervall er konstruert slik at av disse intervallene fanger den sanne parameteren, og bommer. Det er metoden, ikke det enkelte intervallet, som har treffsikkerhet.
To feiltolkninger er så vanlige at de er verdt å avvise eksplisitt. Den ene: «det er sannsynlig at ligger i akkurat dette intervallet.» Det stemmer ikke i den frekventistiske rammen – er en fast (om enn ukjent) verdi, og det enkelte intervallet enten inneholder den eller ikke. Det tilfeldige er intervallet, ikke parameteren. Den andre: « av pasientene har trykk i dette intervallet.» Nei – intervallet gjelder gjennomsnittet , ikke enkeltpasientene. Intervallet for gjennomsnittet er langt smalere enn spredningen mellom individer; det er SEM, ikke , som setter bredden.
Konfidensintervall for en andel
Ofte er størrelsen du vil anslå, ikke et gjennomsnitt, men en andel – andelen syke en test fanger, andelen myope i en populasjon. Her er punktestimatet utvalgsandelen , og det enkleste konfidensintervallet, Wald-intervallet, har samme form som før:
der uttrykket under rottegnet er standardfeilen til en andel. (Den lille er her en andel, ikke en p-verdi – sammenhengen avgjør, som kapittelboksen varslet.)
Wald-intervallet er greit når er stort og ikke ligger nær eller , men det svikter når tallene er små. Anta at en test fanger av syke øyne, altså en sensitivitet på – nettopp den slags størrelse seksjonen om diagnostiske tester handlet om. Wald-intervallets øvre grense blir da
en umulig sannsynlighet over . Formelen har brutt sammen fordi normaltilnærmingen ikke holder så nær kanten.
Bedre metoder finnes – score-intervallet (Wilson) er den vanligste – og de brukes automatisk av programvare. Funksjonen prop.test() i R gir for av intervallet , som pent holder seg innenfor .
Lærdommen er praktisk: regn Wald for hånd for å se strukturen, men stol på programvarens score-intervall når er lite eller andelen ligger nær en ytterkant.
R-kode
Hypotesetesting
Den andre store slutningsoppgaven er å avgjøre om en forskjell i dataene er reell eller bare tilfeldig sprik. Formålsspørsmålet er skarpt her: du har sett en forskjell – to instrumenter som spriker, to grupper som skiller seg – og vil vite om den er større enn det tilfeldighetene alene kunne produsert. Det er hva en hypotesetest avgjør.
Apparatet starter med to konkurrerende påstander. Nullhypotesen er utgangspunktet om at det ikke er noen effekt eller forskjell – at de to instrumentene måler likt i snitt (), at de to gruppene har samme populasjonsgjennomsnitt. Alternativhypotesen er det motsatte: at det finnes en forskjell. Testen stiller de to opp mot hverandre og spør hvor godt dataene passer med .
Til det trengs et tall som måler avstanden fra : en testobservator. En testobservator (typisk , , eller , avhengig av spørsmålet) uttrykker hvor langt dataene ligger fra det forutsier, målt i antall standardfeil. Ligger observatoren langt ute i halen av fordelingen den ville hatt om var sann, taler dataene mot .
Hvor langt ute er «langt nok»? Det bestemmes av et signifikansnivå , satt på forhånd – konvensjonelt . definerer et forkastningsområde: de mest ekstreme utfallene, dem vi ville sett i bare av tilfellene om var sann. Faller testobservatoren dit, forkaster vi . Tallet som gjør dette presist, er p-verdien: sannsynligheten for å få en testobservator minst så ekstrem som den observerte, gitt at er sann. Er , ligger vi i forkastningsområdet, og vi forkaster .
P-verdien er blant de mest misforståtte tallene i faget, og to feillesninger må avvises rett ut. P-verdien er ikke sannsynligheten for at er sann, og ikke sannsynligheten for at resultatet «skyldes tilfeldighet». Den er betinget på at er sann – den regner hvor overraskende dataene er under nullhypotesen, ikke hvor sannsynlig nullhypotesen er. Og en stor p-verdi beviser ikke ; den betyr bare at dataene ikke gir nok grunnlag til å forkaste den. Fravær av bevis mot en forskjell er ikke bevis for at forskjellen er null.
Fordi en test bygger på en terskel, kan den bomme på to måter – og de to feilene er ikke likeverdige. En type I-feil er å forkaste en sann : å rope på en forskjell som ikke finnes (falsk alarm). Sannsynligheten for det er nettopp . En type II-feil er å beholde en falsk : å overse en forskjell som faktisk finnes. Sannsynligheten for det kalles . Det komplementære tallet er testens styrke – sannsynligheten for å oppdage en effekt som virkelig er der. Styrken vokser med større effekt, større , høyere og lavere spredning. For et fast er det en avveining mellom de to feiltypene: senker du for å unngå falske alarmer, øker du samtidig og overser flere reelle effekter.
Feiltypene får kjøtt på beina i en klinisk beslutning. Sett nullhypotesen til «pasienten har ikke glaukom». En type I-feil er da å stemple et friskt øye som sykt – unødig henvisning, engstelse og kostnad. En type II-feil er å la et ekte glaukom passere som friskt – ubehandlet, med fortsatt synstap. Husk fra seksjonen om diagnostiske tester at disse to henger direkte sammen med testens egenskaper: type I-feilene svarer til lav spesifisitet (friske som får positivt svar), type II-feilene til lav sensitivitet (syke som får negativt svar). Fordi synstap ved glaukom er irreversibelt, veier en oversett syk (type II) vanligvis tyngre enn en falsk alarm (type I). Derfor velges screeningtester med høy sensitivitet, selv om prisen er flere falske positive – akkurat avveiningen prevalensregnestykket i den seksjonen gjorde konkret.
*Styrke og utvalgsstørrelse
Dette underavsnittet kan hoppes over ved første gjennomlesning. Før en studie settes i gang, er det verdt å spørre om den i det hele tatt er stor nok til å oppdage en effekt av klinisk interessant størrelse – en styrkeberegning. Man fastsetter (ofte ), en ønsket styrke (, ofte ) og hvor stor en effekt man vil kunne fange, og løser for . For å oppdage en middels stor effekt (Cohens , se nedenfor) i en sammenligning av to uavhengige, like store grupper, med tosidig og styrke , trengs det om lag pasienter i hver gruppe [189]. Vil du fange en mindre effekt, trengs det brått langt flere. Vi oppgir tallet som motivasjon og går ikke inn i styrkeformelen; poenget er at utvalgsstørrelsen bør planlegges, ikke overlates til tilfeldighetene.
Konfidensintervall og test: to sider av samme sak
Konfidensintervallet og hypotesetesten er ikke to konkurrerende verktøy, men to uttrykk for det samme. Sammenhengen er presis: en tosidig test på nivå forkaster hvis og bare hvis -konfidensintervallet ikke inneholder . For en forskjell eller en effekt er nullverdien : dekker -intervallet for en differanse ikke tallet , er forskjellen signifikant på -nivå – og motsatt. Å sjekke om null ligger i konfidensintervallet er altså nøyaktig den samme avgjørelsen som å sammenligne p-verdien med . Dette er den «KI som inkluderer null»-tolkningen innledningen lovet.
Og konfidensintervallet gir mer enn p-verdien. P-verdien svarer bare ja eller nei på «finnes det en effekt?»; intervallet viser i tillegg hvilken vei effekten går og hvor stor den er. Se det på den parede sammenligningen av to av tonometrene i klinikkdatasettet – Corvis ST mot Goldmann på de samme 71 øynene (i Tillegg A heter Goldmann-kolonnen også GAT). Den parede analysen av differansen Corvis Goldmann gir middeldifferanse , med -KI og .
R-kode
De to kriteriene stemmer overens, slik de alltid gjør: , og intervallet ligger helt under null. Men intervallet forteller også det p-verdien tier om – at Corvis ST i snitt leser mellom og lavere enn Goldmann i dette materialet. Det er en retning og en størrelsesorden en kliniker kan forholde seg til, ikke bare et «ja, signifikant». (At R skriver , betyr bare at tallet er mindre enn det minste programmet bryr seg om å skrive ut; i en artikkel rapporteres det som .)
Statistisk signifikans er ikke klinisk relevans
Her ligger seksjonens viktigste advarsel. At en forskjell er statistisk signifikant, betyr bare at den neppe er ren tilfeldighet – ikke at den er stor nok til å bety noe for en pasient. De to tingene kan sprike i begge retninger. Med et stort nok utvalg blir selv en klinisk ubetydelig forskjell statistisk signifikant, fordi standardfeilen krymper mot null og den minste avstand fra til slutt havner utenfor forkastningsgrensen. Og med et lite utvalg kan en klinisk viktig forskjell forbli ikke-signifikant, rett og slett fordi det er for få data til å utelukke tilfeldighet.
Derfor skal en p-verdi aldri rapporteres alene. Ved siden av den hører alltid to ting: et konfidensintervall, som viser størrelsesorden, og en effektstørrelse, som tallfester hvor stor effekten er på en skala som ikke blåses opp av . Den vanligste effektstørrelsen for en forskjell mellom to gjennomsnitt er Cohens : differansen mellom gruppegjennomsnittene delt på deres samlede (poolede) standardavvik ,
Den er enhetsløs – en forskjell målt i antall standardavvik – så den kan sammenlignes på tvers av variabler og studier. Som grove holdepunkter – konvensjoner Cohen selv satte skjønnsmessig – regnes som en liten effekt, som middels og som stor [189]. (For parede data brukes ofte varianten , differansens gjennomsnitt delt på dens eget standardavvik.)
De to datasettene gir et lærerikt par: signifikans og effekt følges ad, og grensen er en konvensjon, ikke en naturlov. Vi deler etter samme grense (myop SER ) i to datasett – aksiallengden i biometridatasettet (de 74 friske voksne som innføres for fullt i neste seksjon) og hornhinnetykkelsen i klinikkdatasettet – og bruker Welch-varianten av t-testen, den R velger når de to gruppene kan ha ulik spredning; den gir brøkdels frihetsgrader, og neste seksjon forklarer den.
R-kode
Eksempel 13.6.3
Bruk R-utskriften over. For aksiallengden (AL) i biometridatasettet skiller myope og ikke-myope seg med (fg ), , og -KI for differansen er . For sentraltykkelsen (CCT) i klinikkdatasettet er (fg ), , og KI for differansen . Avgjør for hver variabel om forskjellen er signifikant – på to ekvivalente måter – og forklar hvorfor den store -verdien følger den store effekten.
Løsning: Vi bruker både p-verdien og KI-koblingen, og knytter til effektstørrelsen. For AL er , og konfidensintervallet ligger helt over null – begge kriteriene sier det samme: forskjellen er signifikant. Myope øyne er i snitt om lag lengre ( mot ), en stor effekt (Cohens ). For CCT er , like under , og intervallet ligger like over null – igjen samme konklusjon fra begge kanter, men nå med et tydelig forbehold: forskjellen er så vidt signifikant, effekten er middels (), og en nedre grense på sier at dataene også er forenlige med en forskjell som klinisk er null. Et litt annet utvalg kunne snudd konklusjonen; grensen er en konvensjon. At er stor for AL og beskjeden for CCT, er ingen tilfeldighet: testobservatoren er nettopp forskjellen målt i standardfeil, så en stor standardisert effekt gir en stor og dermed en liten p-verdi. Samme grense gir altså AL signifikant (stor effekt), CCT så vidt signifikant (middels effekt, KI nesten ned til null) – to tolkninger en kliniker må kunne holde fra hverandre, og et grensetilfelle det er verdt å ha sett før du møter det i en artikkel.
Eksempel 13.6.4
To studier sammenligner trykksenkningen fra to øyedråper, begge med poolet standardavvik . Studie A ( per gruppe) finner en forskjell på med . Studie B ( per gruppe) finner en forskjell på med . (a) Hvilken studie har lavest p-verdi, og hvorfor er det ikke det samme som størst effekt? (b) Regn ut Cohens for hver og klassifiser effekten. (c) Gi et kort råd til en kliniker som vurderer å bytte dråpe basert på studie B alene.
Løsning: Vi skiller p-verdi fra effektstørrelse og bruker Cohens til å veie de to studiene mot hverandre. For (a): studie B har klart lavest p-verdi ( mot ). Men det skyldes i hovedsak det mye større utvalget – mot gjør at selv en liten forskjell havner langt ute i halen. Den observerte forskjellen er faktisk mindre i B () enn i A (); lav p er ikke det samme som stor effekt. For (b) deler vi hver forskjell på :
Effekten i A er middels (), den i B under en liten () – altså er A-effekten rundt tre ganger så stor som B-effekten, stikk motsatt av det p-verdiene alene antyder. For (c): studie B er statistisk signifikant, men klinisk nesten uten betydning – en ekstra trykksenkning på () er mindre enn måleusikkerheten i én enkelt tonometeravlesning og neppe merkbar for pasienten. En liten p-verdi drevet av et stort rettferdiggjør ikke et bytte; se på effektstørrelsen og konfidensintervallet, ikke p alene. Kort: B har lavest p, men minst effekt (, ); effektstørrelsen, ikke p-verdien, må avgjøre.
Oppgaver
Oppgave 13.6.1
I klinikkdatasettet er gjennomsnittstrykket (Goldmann) med standardavvik over pasienter.
-
a)
Regn ut standardfeilen til gjennomsnittet (SEM).
-
b)
Med (fg ), finn et -konfidensintervall for populasjonens gjennomsnittlige trykk.
-
c)
Forklar i én setning hva intervallet forteller deg – og i én setning hva det ikke forteller.
Løsningsforslag
Oppgave 13.6.1:
-
a)
Standardfeilen er
-
b)
Feilmarginen er , og intervallet blir
– samme intervall som t.test(IOP) ga i brødteksten.
-
c)
Intervallet forteller at populasjonsgjennomsnitt fra til er forenlige med dataene – metoden som konstruerte intervallet, fanger i av gjentatte studier. Det forteller ikke at av pasientene har trykk i dette intervallet – det gjelder gjennomsnittet , ikke spredningen mellom enkeltpasienter. Og siden pasientene er glaukompasienter under behandling, gjelder det behandlede trykket i en slik gruppe, ikke trykket i befolkningen.
Oppgave 13.6.2
Corvis ST sammenlignes med Goldmann-applanasjon (GAT) på de samme øynene i klinikkdatasettet. Den parede analysen gir middeldifferanse (Corvis GAT) , -KI , (fg ), .
-
a)
Er forskjellen mellom instrumentene statistisk signifikant på -nivå? Begrunn ved både p-verdien og konfidensintervallet, og oppgi hvilken vei forskjellen går.
-
b)
Formuler nullhypotesen og alternativhypotesen for denne testen.
-
c)
En kollega sier: «, altså er det under sannsynlig at instrumentene egentlig er like.» Hva er galt med den formuleringen?
Løsningsforslag
Oppgave 13.6.2:
-
a)
Ja. P-verdien: , så forkastes. Konfidensintervallet: inneholder ikke , så en tosidig test på -nivå forkaster . De to kriteriene er ekvivalente og gir samme svar: forskjellen er statistisk signifikant. Retningen leses av fortegnet: middeldifferansen Corvis GAT er negativ, og hele intervallet ligger under null, så Corvis ST leser lavere enn Goldmann – i snitt om lag , med en forskjell som med sikkerhet ligger mellom og .
-
b)
: instrumentene måler likt i snitt – den sanne middeldifferansen Corvis GAT er null, . : .
-
c)
Kollegaen leser p-verdien som sannsynligheten for at er sann. Men p-verdien er betinget på at er sann: den er sannsynligheten for en minst så ekstrem testobservator () gitt like instrumenter – ikke sannsynligheten for at instrumentene er like, gitt dataene. Betingelsen er snudd; at tallet er lite, endrer ikke feilslutningen.
Oppgave 13.6.3
En optometrist bruker en screeningtest for glaukom. Sett nullhypotesen til «pasienten har ikke glaukom».
-
a)
Beskriv konkret hva en type I-feil og en type II-feil betyr for denne pasienten.
-
b)
Knytt hver feiltype til begrepene sensitivitet og spesifisitet fra seksjonen om diagnostiske tester.
-
c)
Glaukomatøst synstap er irreversibelt. Argumenter for hvordan det bør påvirke valget mellom en test med høy sensitivitet og en med høy spesifisitet, og oppgi hva prisen er.
Løsningsforslag
Oppgave 13.6.3:
-
a)
En type I-feil er å forkaste en sann : et friskt øye stemples som glaukom – falsk alarm, med unødig henvisning, engstelse og kostnad. En type II-feil er å beholde en falsk : et ekte glaukom passerer som friskt – pasienten går ubehandlet, med fortsatt synstap.
-
b)
Type I-feilene svarer til lav spesifisitet: friske som får positivt svar. Type II-feilene svarer til lav sensitivitet: syke som får negativt svar.
-
c)
Fordi glaukomatøst synstap er irreversibelt, veier en oversett syk (type II) tyngre enn en falsk alarm (type I). Screeningen bør derfor bruke en test med høy sensitivitet, slik at få ekte glaukomer slipper gjennom. Prisen er lavere spesifisitet: flere friske får falskt positivt svar og henvises unødig – en akseptabel pris, siden den feilen rettes ved videre utredning, mens tapt syn ikke kan hentes tilbake.
Oppgave 13.6.4
En forskningsartikkel melder at en ny linseløsning ga «en statistisk signifikant bedring i tårefilmstabilitet ()» i en studie med deltakere, men oppgir verken effektstørrelse eller konfidensintervall.
-
a)
Vurder kritisk hva denne påstanden kan og ikke kan fortelle deg. Hvorfor er den lille p-verdien i seg selv utilstrekkelig som grunnlag for å anbefale løsningen?
-
b)
Hvilke to tallstørrelser burde ha stått ved siden av p-verdien, og hva ville hver av dem lagt til?
-
c)
Konstruer selv et kort taleksempel – gjerne fra trykk, aksiallengde eller synsstyrke – med to grupper der forskjellen er klinisk ubetydelig, men blir statistisk signifikant fordi utvalget er stort. Oppgi gjennomsnitt, en poolet SD og gruppestørrelse, og regn ut Cohens for å vise at effekten er liten.
Løsningsforslag
Oppgave 13.6.4:
-
a)
Påstanden forteller bare at den observerte bedringen neppe er ren tilfeldighet. Den sier ingenting om hvor stor bedringen er, eller om den er merkbar for pasienten. Med krymper standardfeilen mot null, og selv en klinisk ubetydelig forskjell blir statistisk signifikant; den lille p-verdien kan derfor like gjerne speile det store utvalget som en viktig effekt, og er alene utilstrekkelig som anbefalingsgrunnlag.
-
b)
En effektstørrelse (for eksempel Cohens ), som tallfester hvor stor bedringen er på en skala som ikke blåses opp av , og et konfidensintervall for forskjellen, som viser retning og størrelsesorden – og dermed om hele intervallet ligger innenfor det klinisk ubetydelige.
-
c)
Åpen deloppgave – et skape-spørsmål uten entydig fasit. Vurderingsmoment: eksemplet må oppfylle begge krav samtidig – Cohens under om lag , mens testobservatoren – relasjonen følger direkte av t-testens definisjon for to like store grupper – likevel overstiger om lag ; med krever det rundt pasienter per gruppe.