A/B Test Statistical Significance
VARIANT A (Control)
VARIANT B (Test)
Vad är A/B Test Calculator?
▾
En A/B-testkalkylator hjälper dig att jämföra två versioner av en sida, e-post, funktion eller produktflöde för att se om en variant presterar bättre än den andra med mer än slumpmässig variation. I digitala produktteam kan till och med en liten ökning i konverteringsfrekvens leda till meningsfulla intäkts- eller engagemangszvinster, men råa procentsatser kan vara vilseledande. Om version A konverterar med 5,0% och version B med 5,6%, kan skillnaden återspegla en verklig förbättring eller vara brus orsakat av begränsad trafik. Kalkylatorn besvarar denna osäkerhet genom att kombinera konverteringsantal, besökarantal, lyft och ett signifikanstest. Tillväxtteam, marknadsförare, produktchefer, UX-forskare och experimentationsanalytiker använder den för att avgöra om de ska lansera en förändring, fortsätta testa eller förkasta en idé. I enkla termer jämför kalkylatorn konverteringsfrekvenserna och beräknar sedan hur stor naturlig slumpmässig variation som förväntas om det inte finns någon verklig skillnad. Om det observerade gapet är mycket större än den bakgrundsvariationen är resultatet mer sannolikt statistiskt signifikant.
DigiCalcs delivers precision-engineered tools for engineers and STEM professionals.
Formel
▾
Konverteringsfrekvens = konverteringar / besökare. Poolad proportion p = (cA + cB) / (nA + nB). Standardfel SE = sqrt[p x (1 - p) x (1/nA + 1/nB)]. Z-värde = (frekvensB - frekvensA) / SE. Beräknat exempel: om A har 50/1000 = 0,05 och B har 70/1000 = 0,07, poolad p = 120/2000 = 0,06. SE = sqrt[0,06 x 0,94 x (1/1000 + 1/1000)] = ungefär 0,0106. z = (0,07 - 0,05) / 0,0106 = ungefär 1,88.Variabelbeskrivning
▾
| Symbol | Namn | Enhet | Beskrivning |
|---|---|---|---|
| Conversion rate | Beräknas som konverteringar | — | Beräknas som konverteringar / besökare; är en nyckelparameter i A/B-testberäkningen |
| Pooled proportion p | Beräknas | — | Beräknas som (cA + cB) / (nA + nB); är en nyckelparameter i A/B-testberäkningen |
| Standard error SE | Beräknas som sqrt[p | — | Beräknas som sqrt[p x (1 - p) x (1/nA + 1/nB)] |
| score | Beräknas | — | Beräknas som (frekvensB - frekvensA) / SE; är en nyckelparameter i A/B-testberäkningen |
| A | Totalt ackumulerat belopp | — | Totalt ackumulerat belopp eller annuitetsvärde; är en nyckelparameter i A/B-testberäkningen |
| x | Indatavariabel | — | Indatavariabel eller okänd att lösa för; är en nyckelparameter i A/B-testberäkningen |
Hur man A/B Test Calculator
▾
- 1Ange antalet besökare och konverteringar för variant A och variant B.
- 2Kalkylatorn beräknar varje konverteringsfrekvens genom att dela konverteringar med besökare.
- 3Den beräknar sedan den poolade proportionen och standardfelet som används i ett tvåproportions-z-test.
- 4Ett z-värde och p-värde genereras för att uppskatta om skillnaden sannolikt är mer än slumpmässig variation.
- 5Granska både den statistiska signifikansen och det praktiska lyftet, eftersom en liten men signifikant vinst kanske inte är tillräcklig för att motivera lansering.
- 6Använd resultatet bara efter att den planerade provstorleken och testets varaktighet är uppnådda, eftersom tidigt avbrytande kan öka risken för falska positiva resultat.
Lösta exempel
▾
Relativt lyft: +40%. B verkar bättre, men slutlig tolkning beror på exakt testinställning.
Det här scenariot visar ett meningsfullt lyft, men signifikansen beror på de precisa antagandena och om teamet planerade en tvåsidig eller ensidig beslutsregel.
Liten provstorlek innebär hög osäkerhet
Även om B verkar bättre är trafiken för liten för att vara säker. Det här är en av de vanligaste anledningarna till att team överdramatiserar testresultat.
Stora urval gör det lättare att detektera små skillnader
Det här är raka motsatsen till problemet med låg trafik. Ett litet lyft kan bli statistiskt övertygande när provstorleken är tillräckligt stor.
Nästan-oavgjort resultat
När frekvenserna är så nära är det ofta rätt beslut att behålla den enklare eller säkrare designen om inte en annan affärsanledning gynnar en variant.
Praktiska tillämpningar
▾
Utvärdera landningssidor, kasssidor och prisexperiment
Jämföra e-postämnesrader eller kreativa varianter
Stödja produktlanseringsbeslut med data istället för intuition
Forskning och retrospektiv analys för att validera experimentresultat
Specialfall
▾
Om ditt test mäter intäkter eller ett annat brusigt mätvärde med långa svansar
Om ditt test mäter intäkter eller ett annat brusigt mätvärde med långa svansar kan normalapproximationen bli mindre stabil och en mer robust analysmetod kan behövas.
Om användare kan se båda varianterna eller trafiken inte är korrekt randomiserad
Om användare kan se båda varianterna eller trafiken inte är korrekt randomiserad bryts antagandena bakom signifikansberäkningen ner och resultatet kan vara bias.
Negativa indatavärden
Negativa indatavärden är vanligtvis ogiltiga för A/B-testkalkylatorn. Konverteringsantal och besökarantal måste vara positiva heltal.
Vanliga konfidensnivåer och z-värden
▾
| Konfidensnivå | Z-värde (tvåsidig) | Innebörd |
|---|---|---|
| 90% | 1,645 | Högre risk för falskt positiv än standardpraxis |
| 95% | 1,960 | Vanlig experimentationströskel |
| 99% | 2,576 | Mer konservativ beslutsregel |
| 99,9% | 3,291 | Mycket hög bevisbörda |
Vanliga frågor
▾
Vad är en A/B-testkalkylator?
Det är ett verktyg som jämför två varianter med konverteringsdata och ett statistiskt test. Det hjälper team att bedöma om en observerad skillnad sannolikt är verklig snarare än slumpmässigt brus.
Hur beräknar man A/B-testets signifikans?
En vanlig metod använder ett tvåproportions-z-test. Kalkylatorn kombinerar båda gruppernas konverteringsfrekvenser, provstorlekar och poolad varians för att uppskatta ett z-värde och p-värde.
Vilken konfidensnivå bör jag använda?
Många team använder 95% konfidense som standard, men rätt tröskel beror på beslutskostnad och experimentationskultur. Högriskbeslut kan motivera en mer konservativ standard.
Varför kan ett stort lyft fortfarande vara insignifikant?
Eftersom signifikansen beror på både effektstorlek och provstorlek. Ett dramatiskt-utseende lyft från ett litet urval kan fortfarande vara för brusigt att lita på.
Varför kan ett litet lyft fortfarande vara signifikant?
Eftersom mycket stora urval minskar osäkerheten. I det fallet kan resultatet vara statistiskt övertygande även om affärseffekten är för liten för att vara viktig.
Vad är det största misstaget i A/B-testning?
Tidigt avbrytande efter upprepat tittande är ett av de största misstagen, eftersom det ökar falska positiva resultat. Dålig randomisering och byte av mätvärden mitt i testet är också vanliga problem.
När bör jag Köra om eller förlänga ett test?
Förläng eller kör om ett test när trafiken är för låg, resultatet är gränsfall eller implementeringsproblem kan ha förorenat experimentet.
Vanliga misstag att undvika
▾
- !Använda felaktiga eller inkonsekventa enheter för indatavärden
- !Glömma att beakta specialfall eller gränsvärden
- !Avrunda mellanliggande värden för tidigt i beräkningen
- !Inte verifiera att indatavärden ligger inom giltiga intervall för A/B-testkalkylatorn
Proffstips
Kör tester tills den nödvändiga provstorleken är uppnådd, eftersom upprepat pekande och avbrytning när ett diagram ser bra ut ökar risken för en falsk vinst.
Visste du?
De matematiska principerna bakom A/B-testkalkylatorn har praktiska tillämpningar i flera branscher och har förfinats under decennier av verklig användning.
Regional Guides
▾
🇺🇸 US▾
🇬🇧 UK▾
🇪🇺 EU▾
Referenser
- ›NIST/SEMATECH e-Handbook of Statistical Methods - Binomial Proportion Test
- ›American Statistical Association - Statement on Statistical Significance and P-Values
- ›Statsig Documentation - Frequentist Sequential Testing
Read the full guide on how to use this calculator effectively
Läs mer →Få mattetips varje vecka
Gå med 12 000+ prenumeranter som får räknartips varje vecka.