P-värdeskalkylator

p-value
Nästa

Ange en teststatistik – z-, t- eller chi-kvadrattest – tillsammans med frihetsgrader när det är tillämpligt, och kalkylatorn returnerar p-värdet för ensidiga eller tvåsidiga hypoteser. Det är ett standardverktyg för statistikläxor och A/B-tester: när du har teststatistiken från dina data omvandlas den till sannolikheten att observera något minst lika extremt under nollhypotesen.

Hur p-värden beräknas

  1. 1

    Välj distributionen

    z för medelvärden och andelar i stora urval, t för medelvärden i små urval med känd standardavvikelse, chi-kvadrat för anpassningsgrad och kontingenstabeller.

  2. 2

    Ange statistiken

    Din uppmätta z-, t- eller chi-kvadratvärde från datan.

  3. 3

    Välj svansar

    Tvåsidigt för hypoteser om skillnad i någon riktning, ensidigt för hypoteser om större eller mindre jämförelse.

  4. 4

    Läs p-värdet

    Området i svansen av fördelningen utanför din statistik.

Referenstabell (tvåsidig)

Statistik p-värde Interpretation
z = 1,64 0,10 marginal
z = 1,96 0,05 Klassisk tröskel
z = 2,58 0,01 stark
z = 3,29 0,001 mycket stark
t(20) = 2,09 0,05 cirka 1,96 motsvarande för df = 20
t(5) = 2,57 0,05 Små urval driver upp det kritiska värdet

Vad ett p-värde betyder

Ett p-värde är sannolikheten, under antagandet att nollhypotesen gäller, att observera en teststatistik som är minst lika extrem som den du observerat. Ett litet p-värde innebär att datan sannolikt inte skulle förekomma enligt nollhypotesen – vilket innebär att antingen nollhypotesen är fel eller att du hade otur.

Vad ett p-värde inte betyder

  • Det är inte sannolikheten för att nollhypotesen är sann.
  • Det är inte sannolikheten att du kommer att upprepa fyndet.
  • Det är inte effektstorleken. En mycket liten, men inte signifikant effekt kan ge ett p-värde < 0,001 med en tillräckligt stor stickprovstorlek.
  • Det är inte en tröskel som skiljer mellan “riktigt” och “icke-riktigt” – 0,05 är en konvention, inte en lag.

Att välja en mot två svansar

Använd ensidig testmetod endast när du har en tydlig riktad hypotes redan innan du ser data (ditt läkemedel kan endast hjälpa, inte skada). Använd annars tvåsidig testmetod. Att byta till ensidig testmetod i efterhand för att få ett p-värde under 0,05 utgör p-hacking och undergräver slutsatserna.

Vanliga fallgropar

  • Flera jämförelser: Kör 20 tester och förvänta dig att en slumpmässigt ger ett p-värde < 0,05. Använd Bonferroni eller Benjamini–Hochberg.
  • Stort N, liten effekt: Ett urval av miljoner fall kommer att markera skillnader på 0,1 % som signifikanta. Ange alltid effektmått tillsammans med p-värdena.
  • Dichotomisering: Uttrycket “signifikant vs ej signifikant” förlorar information. p = 0,048 och p = 0,052 motsvarar i praktiken samma styrka av bevis.
  • Felaktig tolkning av chi-kvadrat-testet. p är en funktion av både statistiken och frihetsgraderna; ett chi-kvadrat på 10 är signifikant vid df=2 (p=0,0067), men inte vid df=20 (p=0,97).

Vanliga frågor

Enligt konvention är gränsvärdet 0,05, men dessa bör anpassas till kostnaden för att göra ett fel. Medicinska studier använder ofta 0,01 eller strängare värden. I vissa områden föreslås 0,005 som standardvärde.

Större urval minskar standardfelet, så att triviala effekter blir “signifikanta”. Ange alltid effektstorleken (Cohens d, oddskvot eller rådifferens) bredvid p-värdet.

Tvåsidig som standard. Ensidig är endast motiverad när du har en tydlig riktningshypotes fastställd innan datainsamlingen.

z antar att du känner till populationsstandardavvikelsen (sällsynt); t används när du beräknar den utifrån urvalet. För stora urval konvergerar dessa värden mot varandra.

Det innebär att data skulle vara ovanliga enligt nollhypotesen. Replikation, effektstorlek och mekanism är viktigare än ett enskilt p-värde.

Relaterade verktyg

Verktyget finns på andra språk