Comment concevoir un A/B test qui estime réellement un effet ?
Le protocole fixe avant le test : population, unité de randomisation, variante, métrique primaire, MDE, durée, exclusions et analyse en intention de traiter.
Réponse directe
Estimer un ITT avec une précision connue pour la population éligible.
Le protocole fixe avant le test : population, unité de randomisation, variante, métrique primaire, MDE, durée, exclusions et analyse en intention de traiter.
01
Réponse directe
Un A/B test crédible se dimensionne avant exposition sur une métrique primaire, un effet minimal détectable, α, puissance, unité de randomisation et attrition. Pour 8,0 % contre 8,7 %, MSC-P-011 requiert 24 516 unités par bras, ou 31 326 après attrition de 10 % et effet de plan 1,15.
02
Question scientifique
Combien d’unités randomiser par bras pour détecter une différence absolue préspécifiée sur un outcome binaire avec les risques d’erreur choisis ?
03
Population, unité et horizon
L’unité est l’unité de randomisation éligible, analysée dans son bras assigné pendant une fenêtre fixée. Utilisateur, foyer, magasin ou zone ne sont pas interchangeables.
04
Estimand et métrique
L’estimand primaire est la différence ITT absolue p₁−p₀ sur une conversion binaire. Le MDE de 0,7 point, soit 8,75 % relatif, est un choix décisionnel, pas un effet prédit.
05
Données nécessaires
Population éligible, taux de base crédible, MDE, métrique primaire et fenêtre, α, puissance, ratio d’allocation, attrition, clustering, contamination et contraintes de trafic.
06
Hypothèses
Deux bras indépendants, allocation 1:1, outcome binaire, test bilatéral, approximation normale adéquate, analyse ITT et aucune réutilisation d’unité. Clustering et mesures répétées exigent un calcul adapté.
07
Formule de planification
n≈[z₁₋α/2√(2p̄(1−p̄))+z₁₋β√(p₀(1−p₀)+p₁(1−p₁))]²/(p₁−p₀)², avec p̄=(p₀+p₁)/2.
08
Calcul reproductible
Avec p₀=0,08, p₁=0,087, α=0,05 et puissance 0,80 : z=1,959964 et 0,841621. Le script calcule 24 515,438 puis arrondit vers le haut.
09
Résultats de planification
Taille brute : 24 516 unités par bras. Après effet de plan 1,15 et attrition 10 % : 31 326 par bras, soit 62 652 unités au total.
| Baseline | Target | Raw / arm | Adjusted / arm | Total |
|---|---|---|---|---|
| 8.0% | 8.7% | 24,516 | 31,326 | 62,652 |
10
Incertitude de planification
La taille dépend fortement du taux de base et du MDE. Il faut recalculer sur une plage plausible, arrondir vers le haut et traiter l’incertitude de trafic et d’attrition comme un risque de faisabilité.
11
Protocole avant lancement
Figer population, unité, variantes, métrique primaire, fenêtre, MDE, taille, règle d’arrêt, exclusions, analyse ITT, gestion des données manquantes et tests de ratio d’échantillon.
12
Diagnostics
Après lancement : intégrité de l’assignation, sample-ratio mismatch, contamination, attrition différentielle, disponibilité de l’outcome, exposition et journal des changements.
13
Erreurs fréquentes
Choisir le MDE pour obtenir une petite taille, regarder les résultats avant le seuil fixé, multiplier les métriques, randomiser l’utilisateur mais analyser la session, arrêter sur p<0,05 ou exclure après assignation.
14
Interprétation
La puissance de 80 % signifie une probabilité de 80 % de rejeter H₀ sous l’effet de planification exact et les hypothèses, pas 80 % de chance que la variante soit meilleure.
15
Décision possible
Décider si le test est faisable, quel MDE est décisionnellement utile et combien de trafic et de temps réserver avant lancement.
16
Décision impossible
La taille calculée ne prouve ni absence de biais, ni pertinence de la métrique, ni effet réel. Elle ne justifie pas une conclusion causale si la randomisation ou l’ITT sont compromis.
17
Implémentation
Le CSV CC0 documente le design ; le Python MIT utilise la loi normale standard, refuse les paramètres hors domaine, arrondit vers le haut et publie taille brute et ajustée.
CSV · CC0
msc-p011-ab-design.csv ↓Python · MIT
msc-p011-reference.py ↓18
Livrable attendu
Question, population, unité, variantes, métrique et fenêtre, MDE absolu et relatif, α, puissance, formule, ajustements, trafic, durée, diagnostics, analyse et règle de décision.
19
Sources scientifiques
Cohen fonde le raisonnement de puissance ; CONSORT exige de documenter détermination de taille, outcomes, randomisation, nombres analysés et précision. Aucune source ne prédit le taux de 8,7 % du jeu synthétique.
- Cohen (1992) ↗Full text verified
- Moher et al. (2010) ↗Full text verified
Dataset · Outil
Connexions méthodologiques
