A/B Test Statistical Significance
VARIANT A (Control)
VARIANT B (Test)
Wat is A/B Test Calculator?
▾
Met een A/B-testcalculator kunt u twee versies van een pagina, e-mail, functie of productstroom vergelijken om te zien of de ene variant beter presteert dan de andere door meer dan willekeurige toeval. In digitale productteams kan zelfs een kleine stijging van het conversiepercentage zich vertalen in aanzienlijke omzet- of betrokkenheidswinsten, maar ruwe percentages alleen kunnen misleidend zijn. Als versie A een conversie van 5,0% heeft en versie B een conversie van 5,6%, zou het verschil een echte verbetering kunnen weerspiegelen, of eenvoudigweg ruis veroorzaakt door beperkt verkeer. Deze calculator helpt deze onzekerheid te beantwoorden door het aantal conversies, bezoekersaantallen, toename en een significantietest te combineren. Groeiteams, marketeers, productmanagers, UX-onderzoekers en experimentanalisten gebruiken het om te beslissen of ze een verandering doorvoeren, blijven testen of een idee afwijzen. In gewone taal vergelijkt de rekenmachine eerst de conversiepercentages en schat vervolgens hoeveel natuurlijke willekeurige variatie zou worden verwacht als er geen echt verschil zou zijn. Als de waargenomen kloof veel groter is dan die achtergrondvariatie, is de kans groter dat het resultaat als statistisch significant wordt beschouwd. Dat betekent niet dat de winnaar gegarandeerd voor altijd de winnaar zal blijven, en het betekent niet dat het effect groot genoeg is om er commercieel toe te doen. Het betekent eenvoudigweg dat het waargenomen verschil minder waarschijnlijk willekeurig is. Goede experimenteerpraktijken vereisen nog steeds een duidelijke hypothese, een geplande steekproefomvang, een schone toewijzing van verkeer en discipline om niet te vroeg te kijken of de statistieken te selecteren nadat de test is begonnen.
DigiCalcs delivers precision-engineered tools for engineers and STEM professionals.
Formule
▾
Conversieratio = conversies / bezoekers. Gepoolde verhouding p = (cA + cB) / (nA + nB). Standaardfout SE = sqrt[p x (1 - p) x (1/nA + 1/nB)]. Z-score = (tariefB - tariefA) / SE. Uitgewerkt voorbeeld: als A 50/1000 = 0,05 heeft en B 70/1000 = 0,07, gepoold p = 120/2000 = 0,06. SE = sqrt[0,06 x 0,94 x (1/1000 + 1/1000)] = ongeveer 0,0106. z = (0,07 - 0,05) / 0,0106 = ongeveer 1,88.Variabele uitleg
▾
| Symbool | Naam | Eenheid | Beschrijving |
|---|---|---|---|
| Conversion rate | Berekend als conversies | — | Berekend als conversies/bezoekers, wat een belangrijke parameter is in de berekening van de ab-testberekening die rechtstreeks van invloed is op het uiteindelijke berekende resultaat |
| Pooled proportion p | Berekend | — | Berekend als (cA + cB) / (nA + nB), wat een sleutelparameter is in de ab-testberekening die rechtstreeks van invloed is op het uiteindelijke berekende resultaat |
| Standard error SE | Berekend als sqrt[p | — | Berekend als sqrt[p x (1 - p) x (1/nA + 1/nB)] |
| score | Berekend | — | Berekend als (rateB - rateA) / SE, wat een sleutelparameter is in de berekening van de ab-testberekening die rechtstreeks van invloed is op het uiteindelijke berekende resultaat |
| A | Totaal opgebouwd bedrag | — | Totaal gecumuleerd bedrag of annuïteitenwaarde, wat een sleutelparameter is in de berekening van de ab-testberekening die rechtstreeks van invloed is op het uiteindelijke berekende resultaat |
| x | Invoervariabele | — | Invoervariabele of onbekend om op te lossen, wat een sleutelparameter is in de berekening van de ab-testberekening die rechtstreeks van invloed is op het uiteindelijke berekende resultaat |
Hoe A/B Test Calculator
▾
- 1Vul het aantal bezoekers en conversies in voor variant A en variant B.
- 2De rekenmachine berekent elk conversiepercentage door de conversies te delen door bezoekers.
- 3Vervolgens berekent het de gepoolde proportie en de standaardfout die wordt gebruikt in een z-test met twee proporties.
- 4Er worden een z-score en een p-waarde gegenereerd om in te schatten of het verschil waarschijnlijk groter is dan willekeurige variatie.
- 5Bekijk zowel de statistische significantie als de praktische lift, omdat een kleine maar significante overwinning er misschien niet genoeg toe doet om te verzenden.
- 6Gebruik het resultaat alleen nadat aan de geplande steekproefomvang en testduur is voldaan, omdat vroegtijdig stoppen het aantal valse positieven kan vergroten.
Uitgewerkte voorbeelden
▾
Relatieve stijging: +40%. B ziet er beter uit, maar de uiteindelijke interpretatie hangt af van de exacte testopstelling.
Dit scenario laat een betekenisvolle stijging zien, maar de betekenis hangt af van de precieze aannames en of het team een tweezijdige of eenzijdige beslissingsregel heeft gepland. Een rekenmachine houdt dat oordeel gedisciplineerd.
Een kleine steekproefomvang betekent een hoge onzekerheid
Ook al ziet B er beter uit, het verkeer is te klein om vertrouwen te hebben. Dit is een van de meest voorkomende redenen waarom teams testresultaten overschatten.
Grote monsters maken kleine verschillen gemakkelijker op te sporen
Dit is het tegenovergestelde van het probleem van weinig verkeer. Een kleine stijging kan statistisch overtuigend worden als de steekproef groot genoeg is.
Bijna gelijk resultaat
Wanneer de koersen zo dichtbij liggen, is het vaak de juiste beslissing om het eenvoudigere of veiligere ontwerp te behouden, tenzij een andere zakelijke reden de voorkeur geeft aan één variant.
Praktische toepassingen
▾
Evaluatie van landingspagina-, afreken- en prijsexperimenten - Deze applicatie wordt vaak gebruikt door professionals die nauwkeurige kwantitatieve analyses nodig hebben ter ondersteuning van besluitvorming, budgettering en strategische planning op hun respectieve vakgebieden
Vergelijking van onderwerpregels van e-mails of creatieve varianten – Beroepsbeoefenaars uit de sector vertrouwen op deze berekening om prestaties te benchmarken, alternatieven te vergelijken en naleving van gevestigde normen en wettelijke vereisten te garanderen, waardoor analisten nauwkeurige resultaten kunnen produceren die strategische planning, toewijzing van middelen en prestatiebenchmarking binnen organisaties ondersteunen
Ondersteun beslissingen over productreleases met data in plaats van alleen met intuïtie. Academische onderzoekers en studenten gebruiken deze berekening om theoretische modellen te valideren, cursusopdrachten te voltooien en een dieper inzicht in de onderliggende wiskundige principes te ontwikkelen
Onderzoekers gebruiken ab-testberekeningen om experimentele gegevens te verwerken, theoretische modellen te valideren en kwantitatieve resultaten te genereren voor publicatie in peer-reviewed onderzoeken, ter ondersteuning van datagestuurde evaluatieprocessen waarbij numerieke precisie essentieel is voor nalevings-, rapportage- en optimalisatiedoelstellingen
Bijzondere gevallen
▾
Als uw test de omzet of een andere luidruchtige maatstaf met lange staarten meet, is de
Als uw test de omzet of een andere luidruchtige maatstaf met lange staarten meet, kan de normale benadering minder stabiel worden en kan een robuustere analysemethode nodig zijn. Wanneer gebruikers dit scenario tegenkomen bij ab-testberekeningen, moeten ze verifiëren dat hun invoerwaarden binnen het verwachte bereik vallen zodat de formule betekenisvolle resultaten oplevert. Ingangen die buiten het bereik vallen, kunnen leiden tot wiskundig geldige maar praktisch betekenisloze resultaten die de werkelijke omstandigheden niet weerspiegelen.
Als gebruikers beide varianten kunnen zien of als het verkeer niet echt willekeurig is, kan de
Als gebruikers beide varianten kunnen zien of als het verkeer niet echt willekeurig is, vallen de aannames achter de significantieberekening weg en kan het resultaat vertekend zijn. Dit randgeval doet zich vaak voor bij professionele toepassingen van ab-testberekening waarbij randvoorwaarden of extreme waarden betrokken zijn. Beoefenaars moeten documenteren wanneer deze situatie zich voordoet en overwegen of alternatieve berekeningsmethoden of aanpassingsfactoren geschikter zijn voor hun specifieke gebruikssituatie.
Negatieve invoerwaarden kunnen wel of niet geldig zijn voor ab test calc, afhankelijk van de domeincontext.
Sommige formules accepteren negatieve getallen (bijvoorbeeld temperaturen, veranderingssnelheden), terwijl andere strikt positieve invoer vereisen. Gebruikers moeten controleren of hun specifieke scenario negatieve waarden toestaat voordat ze op de uitvoer vertrouwen. Professionals die met ab-testberekeningen werken, moeten vooral op dit scenario letten, omdat het tot misleidende resultaten kan leiden als het niet op de juiste manier wordt afgehandeld. Controleer altijd de randvoorwaarden en kruiscontroles met onafhankelijke methoden wanneer dit geval zich in de praktijk voordoet.
Gemeenschappelijke betrouwbaarheidsniveaus en Z-scores
▾
| Vertrouwensniveau | Z-Score (tweezijdig) | Betekenis |
|---|---|---|
| 90% | 1.645 | Grotere kans op vals-positieven dan standaardpraktijk |
| 95% | 1.960 | Gemeenschappelijke experimenteerdrempel |
| 99% | 2.576 | Meer conservatieve beslisregel |
| 99,9% | 3.291 | Zeer hoge bewijsdrempel |
Veelgestelde vragen
▾
Wat is een A/B-testcalculator?
Het is een tool die twee varianten vergelijkt met behulp van conversiegegevens en een statistische test. Het helpt teams te beoordelen of een waargenomen verschil waarschijnlijk reëel is en geen willekeurige ruis. In de praktijk staat dit concept centraal bij ab-testberekeningen, omdat het de kernrelatie tussen de invoervariabelen bepaalt. Als u dit begrijpt, kunnen gebruikers de resultaten nauwkeuriger interpreteren en deze toepassen op realistische scenario's in hun specifieke context.
Hoe bereken je de significantie van een A/B-test?
Een gebruikelijke aanpak maakt gebruik van een z-test met twee proporties. De rekenmachine combineert de conversiepercentages, steekproefomvang en gepoolde variantie van beide groepen om een z-score en p-waarde te schatten. Het proces omvat het systematisch toepassen van de onderliggende formule op de gegeven inputs. Elke variabele in de berekening draagt bij aan het eindresultaat, en het begrijpen van hun individuele rollen zorgt voor een nauwkeurige toepassing. De meeste professionals in het veld volgen een stapsgewijze aanpak, waarbij ze tussentijdse resultaten verifiëren voordat ze tot het definitieve antwoord komen.
Welk betrouwbaarheidsniveau moet ik gebruiken?
Veel teams gebruiken standaard een betrouwbaarheid van 95%, maar de juiste drempel hangt af van de beslissingskosten en de experimenteercultuur. Beslissingen met een hoog risico kunnen een conservatievere standaard rechtvaardigen. Dit is een belangrijke overweging bij het werken met ab-testberekeningen in praktische toepassingen. Het antwoord hangt af van de specifieke invoerwaarden en de context waarin de berekening wordt toegepast.
Waarom kan een grote lift nog steeds onbeduidend zijn?
Omdat significantie afhangt van zowel de effectgrootte als de steekproefomvang. Een dramatisch ogende lift van een klein monster kan nog steeds te luidruchtig zijn om te vertrouwen. Dit is van belang omdat nauwkeurige ab-testberekeningen rechtstreeks van invloed zijn op de besluitvorming in professionele en persoonlijke contexten. Zonder de juiste berekening lopen gebruikers het risico beslissingen te nemen op basis van onvolledige of onjuiste kwantitatieve analyses. Industriestandaarden en best practices benadrukken het belang van nauwkeurige berekeningen om kostbare fouten te voorkomen.
Waarom kan een kleine lift nog steeds aanzienlijk zijn?
Omdat zeer grote steekproeven de onzekerheid verminderen. In dat geval kan het resultaat statistisch overtuigend zijn, ook al is de impact op het bedrijf te klein om er toe te doen. Dit is van belang omdat nauwkeurige ab-testberekeningen rechtstreeks van invloed zijn op de besluitvorming in professionele en persoonlijke contexten. Zonder de juiste berekening lopen gebruikers het risico beslissingen te nemen op basis van onvolledige of onjuiste kwantitatieve analyses. Industriestandaarden en best practices benadrukken het belang van nauwkeurige berekeningen om kostbare fouten te voorkomen.
Wat is de grootste fout bij A/B-testen?
Vroegtijdig stoppen na herhaaldelijk gluren is een van de grootste fouten, omdat het het aantal valse positieven vergroot. Slechte randomisatie en het wisselen van statistieken tijdens de test zijn ook veelvoorkomende problemen. In de praktijk staat dit concept centraal bij ab-testberekeningen, omdat het de kernrelatie tussen de invoervariabelen bepaalt. Als u dit begrijpt, kunnen gebruikers de resultaten nauwkeuriger interpreteren en deze toepassen op realistische scenario's in hun specifieke context.
Wanneer moet ik een toets opnieuw uitvoeren of verlengen?
Verleng een test of voer deze opnieuw uit wanneer er te weinig verkeer is, het resultaat op de grens ligt of implementatieproblemen het experiment mogelijk hebben verontreinigd. Het herhalen van de test kan helpen bevestigen dat de lift stabiel is. Dit geldt voor meerdere contexten waarin ab-testberekeningswaarden met precisie moeten worden bepaald. Veel voorkomende scenario's zijn onder meer professionele analyse, academische studie en persoonlijke planning, waarbij kwantitatieve nauwkeurigheid essentieel is.
Veelgemaakte fouten om te vermijden
▾
- !Gebruik van onjuiste of niet-overeenkomende eenheden voor invoerwaarden
- !Vergeten rekening te houden met randgevallen of randvoorwaarden
- !Tussenwaarden te vroeg in de berekening afgerond
- !Niet verifiëren dat invoerwaarden binnen geldige bereiken vallen voor ab-testberekening
Pro Tip
Voer tests uit totdat u de vereiste steekproefomvang heeft bereikt, omdat gluren en stoppen wanneer een diagram er goed uitziet het risico op een valse overwinning vergroot.
Wist je dat?
De wiskundige principes achter ab test calc hebben praktische toepassingen in meerdere industrieën en zijn verfijnd door tientallen jaren van gebruik in de echte wereld.
Regional Guides
▾
🇺🇸 US▾
🇬🇧 UK▾
🇪🇺 EU▾
Referenties
Read the full guide on how to use this calculator effectively
Lees meer →Ontvang wekelijkse wiskundetips
Sluit u aan bij 12.000+ abonnees die elke week rekenmachinetips krijgen.