A/B Test Statistical Significance
VARIANT A (Control)
VARIANT B (Test)
Cos'è A/B Test Calculator?
▾
Un calcolatore di test A/B ti aiuta a confrontare due versioni di una pagina, e-mail, funzionalità o flusso di prodotto per vedere se una variante supera l'altra in modo più che casuale. Nei team che si occupano di prodotti digitali, anche un piccolo aumento del tasso di conversione può tradursi in guadagni significativi o in guadagni di coinvolgimento, ma le percentuali grezze da sole possono essere fuorvianti. Se la versione A converte al 5,0% e la versione B al 5,6%, la differenza potrebbe riflettere un miglioramento reale o potrebbe semplicemente essere un rumore causato dal traffico limitato. Questo calcolatore aiuta a rispondere a questa incertezza combinando il conteggio delle conversioni, il conteggio dei visitatori, l'incremento e un test di significatività. Team di crescita, esperti di marketing, product manager, ricercatori UX e analisti di sperimentazione lo utilizzano per decidere se apportare una modifica, continuare a testare o rifiutare un'idea. In parole povere, il calcolatore confronta prima i tassi di conversione, quindi stima la quantità di variazione casuale naturale che ci si aspetterebbe se non ci fosse una vera differenza. Se il divario osservato è molto più ampio della variazione di fondo, è più probabile che il risultato venga considerato statisticamente significativo. Ciò non significa che sia garantito che il vincitore rimanga tale per sempre, e non significa che l’effetto sia abbastanza grande da avere importanza a livello commerciale. Significa semplicemente che è meno probabile che la differenza osservata sia casuale. Una buona pratica di sperimentazione richiede ancora un'ipotesi chiara, una dimensione del campione pianificata, un'allocazione pulita del traffico e la disciplina di non sbirciare troppo presto o di scegliere i parametri dopo l'inizio del test.
DigiCalcs delivers precision-engineered tools for engineers and STEM professionals.
Formula
▾
Tasso di conversione = conversioni/visitatori. Proporzione aggregata p = (cA + cB) / (nA + nB). Errore standard SE = sqrt[p x (1 - p) x (1/nA + 1/nB)]. Punteggio Z = (tassoB - tassoA) / SE. Esempio pratico: se A ha 50/1000 = 0,05 e B ha 70/1000 = 0,07, p aggregato = 120/2000 = 0,06. SE = quadrato[0,06 x 0,94 x (1/1000 + 1/1000)] = circa 0,0106. z = (0,07 - 0,05) / 0,0106 = circa 1,88.Leggenda delle variabili
▾
| Simbolo | Nome | Unità | Descrizione |
|---|---|---|---|
| Conversion rate | Calcolato come conversioni | — | Calcolato come conversioni/visitatori, che è un parametro chiave nel calcolo del test ab che influenza direttamente il risultato finale calcolato |
| Pooled proportion p | Calcolato | — | Calcolato come (cA + cB) / (nA + nB), che è un parametro chiave nel calcolo del test ab che influenza direttamente il risultato finale calcolato |
| Standard error SE | Calcolato come sqrt[p | — | Calcolato come sqrt[p x (1 - p) x (1/nA + 1/nB)] |
| score | Calcolato | — | Calcolato come (rateB - rateA) / SE, che è un parametro chiave nel calcolo del test ab che influenza direttamente il risultato finale calcolato |
| A | Importo totale accumulato | — | Importo totale accumulato o valore della rendita, che è un parametro chiave nel calcolo del test ab che influenza direttamente il risultato finale calcolato |
| x | Variabile di ingresso | — | Variabile di input o sconosciuta da risolvere, che è un parametro chiave nel calcolo del test ab che influenza direttamente il risultato finale calcolato |
Come A/B Test Calculator
▾
- 1Inserisci il numero di visitatori e conversioni per la variante A e la variante B.
- 2Il calcolatore calcola ciascun tasso di conversione dividendo le conversioni per i visitatori.
- 3Quindi calcola la proporzione raggruppata e l'errore standard utilizzati in un test z a due proporzioni.
- 4Vengono generati un punteggio z e un valore p per stimare se è probabile che la differenza sia maggiore di una variazione casuale.
- 5Rivedi sia la significatività statistica che l'incremento pratico, perché una vincita piccola ma significativa potrebbe non essere abbastanza importante per essere spedita.
- 6Utilizzare il risultato solo dopo aver raggiunto la dimensione del campione pianificata e la durata del test, poiché un'interruzione anticipata può aumentare i falsi positivi.
Esempi risolti
▾
Sollevamento relativo: +40%. B sembra migliore, ma l'interpretazione finale dipende dall'esatta configurazione del test.
Questo scenario mostra un aumento significativo, ma il significato dipende dai presupposti precisi e dal fatto che il team abbia pianificato una regola decisionale a due o a una coda. Una calcolatrice mantiene quel giudizio disciplinato.
Una piccola dimensione del campione significa un’elevata incertezza
Anche se B sembra migliore, il traffico è troppo piccolo per essere sicuri. Questo è uno dei motivi più comuni per cui i team sopravvalutano i risultati dei test.
Campioni di grandi dimensioni facilitano il rilevamento delle piccole differenze
Questo è l’opposto del problema del basso traffico. Un piccolo incremento può diventare statisticamente convincente quando il campione è sufficientemente ampio.
Risultato vicino alla parità
Quando i prezzi sono così vicini, spesso la decisione giusta è quella di mantenere il design più semplice o più sicuro, a meno che un altro motivo aziendale non favorisca una variante.
Applicazioni pratiche
▾
Valutazione di esperimenti su pagine di destinazione, checkout e prezzi: questa applicazione è comunemente utilizzata dai professionisti che necessitano di analisi quantitative precise per supportare il processo decisionale, il budget e la pianificazione strategica nei rispettivi campi
Confronto degli oggetti delle email o delle varianti creative: i professionisti del settore si affidano a questo calcolo per valutare le prestazioni, confrontare le alternative e garantire la conformità agli standard stabiliti e ai requisiti normativi, aiutando gli analisti a produrre risultati accurati che supportano la pianificazione strategica, l'allocazione delle risorse e il benchmarking delle prestazioni tra le organizzazioni
Supportare le decisioni sul rilascio dei prodotti con i dati anziché solo con l'intuizione. Ricercatori accademici e studenti utilizzano questo calcolo per convalidare modelli teorici, completare i compiti dei corsi e sviluppare una comprensione più profonda dei principi matematici sottostanti
I ricercatori utilizzano calcoli di calcolo ab test per elaborare dati sperimentali, convalidare modelli teorici e generare risultati quantitativi da pubblicare in studi sottoposti a revisione paritaria, supportando processi di valutazione basati sui dati in cui la precisione numerica è essenziale per obiettivi di conformità, reporting e ottimizzazione
Casi speciali
▾
Se il tuo test misura le entrate o un'altra metrica rumorosa con code lunghe, il
Se il tuo test misura le entrate o un altro parametro rumoroso con code lunghe, l'approssimazione normale può diventare meno stabile e potrebbe essere necessario un metodo di analisi più robusto. Quando si verifica questo scenario nei calcoli del test ab test, gli utenti devono verificare che i valori di input rientrino nell'intervallo previsto affinché la formula produca risultati significativi. Gli input fuori range possono portare a output matematicamente validi ma praticamente privi di significato che non riflettono le condizioni del mondo reale.
Se gli utenti possono vedere entrambe le varianti o il traffico non è realmente randomizzato, il file
Se gli utenti possono vedere entrambe le varianti o il traffico non è realmente randomizzato, i presupposti alla base del calcolo della significatività vengono meno e il risultato potrebbe essere distorto. Questo caso limite si presenta spesso nelle applicazioni professionali del calcolo del test ab in cui sono coinvolte condizioni al contorno o valori estremi. I professionisti dovrebbero documentare quando si verifica questa situazione e considerare se metodi di calcolo alternativi o fattori di aggiustamento siano più appropriati per il loro caso d'uso specifico.
I valori di input negativi possono o meno essere validi per il calcolo del test ab a seconda del contesto del dominio.
Alcune formule accettano numeri negativi (ad esempio, temperature, tassi di variazione), mentre altre richiedono input strettamente positivi. Gli utenti dovrebbero verificare se il loro scenario specifico consente valori negativi prima di fare affidamento sull'output. I professionisti che lavorano con il calcolo del test ab dovrebbero prestare particolare attenzione a questo scenario perché può portare a risultati fuorvianti se non gestito correttamente. Verificare sempre le condizioni al contorno ed effettuare controlli incrociati con metodi indipendenti quando questo caso si presenta nella pratica.
Livelli di confidenza comuni e punteggi Z
▾
| Livello di fiducia | Punteggio Z (a due code) | Senso |
|---|---|---|
| 90% | 1.645 | Maggiore probabilità di falsi positivi rispetto alla pratica standard |
| 95% | 1.960 | Soglia di sperimentazione comune |
| 99% | 2.576 | Regola decisionale più conservativa |
| 99,9% | 3.291 | Soglia di evidenza molto alta |
Domande frequenti
▾
Cos'è un calcolatore per test A/B?
È uno strumento che confronta due varianti utilizzando i dati di conversione e un test statistico. Aiuta i team a giudicare se è probabile che una differenza osservata sia reale piuttosto che un rumore casuale. In pratica, questo concetto è fondamentale per il calcolo del test ab perché determina la relazione fondamentale tra le variabili di input. Comprendere questo aiuta gli utenti a interpretare i risultati in modo più accurato e ad applicarli a scenari del mondo reale nel loro contesto specifico.
Come si calcola la significatività del test A/B?
Un approccio comune utilizza uno z-test a due proporzioni. Il calcolatore combina i tassi di conversione, le dimensioni del campione e la varianza aggregata di entrambi i gruppi per stimare un punteggio z e un valore p. Il processo prevede l'applicazione sistematica della formula sottostante agli input forniti. Ciascuna variabile nel calcolo contribuisce al risultato finale e la comprensione dei rispettivi ruoli individuali aiuta a garantire un'applicazione accurata. La maggior parte dei professionisti del settore segue un approccio passo dopo passo, verificando i risultati intermedi prima di arrivare alla risposta finale.
Quale livello di confidenza dovrei usare?
Molti team utilizzano un livello di confidenza del 95% come impostazione predefinita, ma la soglia corretta dipende dai costi decisionali e dalla cultura della sperimentazione. Le decisioni ad alto rischio possono giustificare uno standard più conservatore. Questa è una considerazione importante quando si lavora con i calcoli del test ab nelle applicazioni pratiche. La risposta dipende dai valori di input specifici e dal contesto in cui viene applicato il calcolo.
Perché un grande ascensore può ancora essere insignificante?
Perché la significatività dipende sia dalla dimensione dell’effetto che dalla dimensione del campione. Un aumento apparentemente drammatico da un piccolo campione potrebbe essere ancora troppo rumoroso per fidarsi. Ciò è importante perché i calcoli accurati dei test addominali influenzano direttamente il processo decisionale in contesti professionali e personali. Senza un calcolo adeguato, gli utenti rischiano di prendere decisioni basate su analisi quantitative incomplete o errate. Gli standard e le migliori pratiche del settore sottolineano l’importanza di calcoli precisi per evitare errori costosi.
Perché un piccolo incremento può comunque essere significativo?
Perché campioni molto grandi riducono l’incertezza. In tal caso, il risultato potrebbe essere statisticamente convincente anche se l’impatto sul business è troppo piccolo per avere importanza. Ciò è importante perché i calcoli accurati dei test addominali influenzano direttamente il processo decisionale in contesti professionali e personali. Senza un calcolo adeguato, gli utenti rischiano di prendere decisioni basate su analisi quantitative incomplete o errate. Gli standard e le migliori pratiche del settore sottolineano l’importanza di calcoli precisi per evitare errori costosi.
Qual è l’errore più grande nei test A/B?
Fermarsi presto dopo aver sbirciato ripetutamente è uno degli errori più grandi, perché aumenta i falsi positivi. Anche la scarsa randomizzazione e il cambio di metriche durante il test sono problemi comuni. In pratica, questo concetto è fondamentale per il calcolo del test ab perché determina la relazione fondamentale tra le variabili di input. Comprendere questo aiuta gli utenti a interpretare i risultati in modo più accurato e ad applicarli a scenari del mondo reale nel loro contesto specifico.
Quando dovrei rieseguire o estendere un test?
Estendi o esegui nuovamente un test quando il traffico è troppo basso, il risultato è limite o i problemi di implementazione potrebbero aver contaminato l'esperimento. La ripetizione del test può aiutare a confermare che il sollevatore è stabile. Ciò si applica a più contesti in cui i valori di calcolo del test ab devono essere determinati con precisione. Gli scenari comuni includono analisi professionale, studio accademico e pianificazione personale in cui l'accuratezza quantitativa è essenziale.
Errori comuni da evitare
▾
- !Utilizzo di unità errate o non corrispondenti per i valori di input
- !Dimenticare di tenere conto dei casi limite o delle condizioni al contorno
- !Arrotondamento dei valori intermedi troppo presto nel calcolo
- !Non verificare che i valori di input rientrino negli intervalli validi per il calcolo del test ab
Consiglio Pro
Esegui i test fino a raggiungere la dimensione del campione richiesta, perché sbirciare e fermarsi quando un grafico sembra buono aumenta il rischio di una falsa vittoria.
Lo sapevi?
I principi matematici alla base del calcolo del test ab hanno applicazioni pratiche in diversi settori e sono stati perfezionati in decenni di utilizzo nel mondo reale.
Regional Guides
▾
🇺🇸 US▾
🇬🇧 UK▾
🇪🇺 EU▾
Riferimenti
Read the full guide on how to use this calculator effectively
Leggi di più →Ricevi suggerimenti matematici settimanali
Unisciti a 12.000+ abbonati che ricevono suggerimenti sulla calcolatrice ogni settimana.