Come progettare un A/B test che stimi davvero un effetto?
Prima del test vanno fissati popolazione, unità di randomizzazione, variante, metrica primaria, MDE, durata, esclusioni e analisi intention-to-treat.
Risposta diretta
Stimare un ITT con precisione nota per la popolazione eleggibile.
Prima del test vanno fissati popolazione, unità di randomizzazione, variante, metrica primaria, MDE, durata, esclusioni e analisi intention-to-treat.
01
Risposta diretta
Un A/B test credibile si dimensiona prima dell’esposizione con metrica primaria, MDE, alfa, potenza, unità e attrition. Per 8,0% contro 8,7% servono 24.516 unità per braccio, o 31.326 con attrition 10% ed effetto 1,15.
02
Domanda scientifica
Quante unità randomizzare per braccio per rilevare una differenza assoluta predefinita su esito binario?
03
Popolazione, unità e orizzonte
L’unità è quella di randomizzazione eleggibile, analizzata nel braccio assegnato in una finestra fissa. Utente, famiglia, negozio e area non sono intercambiabili.
04
Estimando e metrica
L’estimando primario è la differenza ITT assoluta p₁−p₀. L’MDE di 0,7 punti, 8,75% relativo, è una scelta, non una previsione.
05
Dati necessari
Servono popolazione, tasso base, MDE, metrica e finestra, alfa, potenza, allocazione, attrition, clustering, contaminazione e traffico.
06
Ipotesi
Due bracci indipendenti, 1:1, esito binario, test bilaterale, approssimazione normale, ITT e nessun riuso. Cluster e misure ripetute richiedono altro calcolo.
07
Formula di pianificazione
n≈[z₁₋α/2√(2p̄(1−p̄))+z₁₋β√(p₀(1−p₀)+p₁(1−p₁))]²/(p₁−p₀)², con p̄=(p₀+p₁)/2.
08
Calcolo riproducibile
Con p₀=0,08, p₁=0,087, α=0,05 e potenza 0,80: z=1,959964 e 0,841621. Il calcolo dà 24.515,438 e arrotonda in alto.
09
Risultati di pianificazione
Dimensione grezza: 24.516 per braccio. Con effetto 1,15 e attrition 10%: 31.326 per braccio, 62.652 totale.
| Baseline | Target | Raw / arm | Adjusted / arm | Total |
|---|---|---|---|---|
| 8.0% | 8.7% | 24,516 | 31,326 | 62,652 |
10
Incertezza di pianificazione
La dimensione dipende da tasso base e MDE. Ricalcolare su intervalli plausibili, arrotondare in alto e trattare traffico e attrition come rischio.
11
Protocollo pre-lancio
Fissare popolazione, unità, varianti, metrica, finestra, MDE, dimensione, stop, esclusioni, ITT, missing e sample ratio.
12
Diagnostica
Dopo il lancio: assegnazione, sample ratio, contaminazione, attrition differenziale, outcome, esposizione e registro modifiche.
13
Errori frequenti
Errori: scegliere MDE per ridurre n, peeking, molte metriche, randomizzare utenti ma analizzare sessioni, fermarsi a p<0,05 o escludere dopo assegnazione.
14
Interpretazione
Potenza 80% significa 80% di probabilità di rifiutare H0 sotto effetto e ipotesi esatti, non 80% che la variante sia migliore.
15
Decisione possibile
Decidere fattibilità, MDE utile e traffico e tempo da riservare prima del lancio.
16
Decisione impossibile
La dimensione non prova assenza di bias, rilevanza della metrica o effetto reale, né causalità se randomizzazione o ITT falliscono.
17
Implementazione
Il CSV CC0 documenta il design; Python MIT usa la normale, rifiuta parametri invalidi, arrotonda e pubblica dimensione grezza e corretta.
CSV · CC0
msc-p011-ab-design.csv ↓Python · MIT
msc-p011-reference.py ↓18
Risultato atteso
Domanda, popolazione, unità, varianti, metrica, finestra, MDE, alfa, potenza, formula, correzioni, traffico, durata, diagnostica e decisione.
19
Fonti scientifiche
Cohen fonda la potenza; CONSORT richiede dimensione, outcome, randomizzazione, numeri analizzati e precisione. Nessuna fonte predice 8,7%.
- Cohen (1992) ↗Full text verified
- Moher et al. (2010) ↗Full text verified
Dataset · Strumento
Connessioni metodologiche
