¿Cómo diseñar una prueba A/B que estime realmente un efecto?
Antes de la prueba deben fijarse población, unidad de aleatorización, variante, métrica primaria, MDE, duración, exclusiones y análisis por intención de tratar.
Respuesta directa
Estimar un ITT con precisión conocida para la población elegible.
Antes de la prueba deben fijarse población, unidad de aleatorización, variante, métrica primaria, MDE, duración, exclusiones y análisis por intención de tratar.
01
Respuesta directa
Una prueba A/B creíble se dimensiona antes de la exposición con métrica primaria, MDE, alfa, potencia, unidad y pérdida. Para 8,0% frente a 8,7% requiere 24.516 unidades por brazo, o 31.326 con 10% de pérdida y efecto 1,15.
02
Pregunta científica
¿Cuántas unidades aleatorizar por brazo para detectar una diferencia absoluta preespecificada en un resultado binario?
03
Población, unidad y horizonte
La unidad es la de aleatorización elegible, analizada en su brazo asignado durante una ventana fija. Usuario, hogar, tienda y zona no son intercambiables.
04
Estimando y métrica
El estimando primario es la diferencia ITT absoluta p₁−p₀. El MDE de 0,7 puntos, 8,75% relativo, es una elección, no una predicción.
05
Datos necesarios
Se requieren población, tasa base, MDE, métrica y ventana, alfa, potencia, asignación, pérdida, clustering, contaminación y tráfico.
06
Supuestos
Dos brazos independientes, 1:1, resultado binario, prueba bilateral, aproximación normal, ITT y sin reutilización. Clústeres y medidas repetidas requieren otro cálculo.
07
Fórmula de planificación
n≈[z₁₋α/2√(2p̄(1−p̄))+z₁₋β√(p₀(1−p₀)+p₁(1−p₁))]²/(p₁−p₀)², con p̄=(p₀+p₁)/2.
08
Cálculo reproducible
Con p₀=0,08, p₁=0,087, α=0,05 y potencia 0,80: z=1,959964 y 0,841621. El cálculo da 24.515,438 y redondea al alza.
09
Resultados de planificación
Tamaño bruto: 24.516 por brazo. Con efecto 1,15 y pérdida 10%: 31.326 por brazo, 62.652 total.
| Baseline | Target | Raw / arm | Adjusted / arm | Total |
|---|---|---|---|---|
| 8.0% | 8.7% | 24,516 | 31,326 | 62,652 |
10
Incertidumbre de planificación
El tamaño depende de la tasa base y MDE. Recalcular en rangos plausibles, redondear al alza y tratar tráfico y pérdida como riesgo.
11
Protocolo previo
Fijar población, unidad, variantes, métrica, ventana, MDE, tamaño, parada, exclusiones, ITT, datos faltantes y ratio muestral.
12
Diagnósticos
Tras el lanzamiento: asignación, ratio muestral, contaminación, pérdida diferencial, resultado, exposición y registro de cambios.
13
Errores frecuentes
Errores: elegir MDE para reducir n, mirar antes, multiplicar métricas, aleatorizar usuarios y analizar sesiones, parar en p<0,05 o excluir después.
14
Interpretación
Potencia 80% significa 80% de probabilidad de rechazar H0 bajo efecto y supuestos exactos, no 80% de que la variante sea mejor.
15
Decisión posible
Decidir viabilidad, MDE útil y tráfico y tiempo a reservar antes del lanzamiento.
16
Decisión imposible
El tamaño no prueba ausencia de sesgo, relevancia de la métrica ni efecto real, ni causalidad si fallan aleatorización o ITT.
17
Implementación
El CSV CC0 documenta el diseño; Python MIT usa la normal, rechaza parámetros inválidos, redondea y publica tamaño bruto y ajustado.
CSV · CC0
msc-p011-ab-design.csv ↓Python · MIT
msc-p011-reference.py ↓18
Entregable esperado
Pregunta, población, unidad, variantes, métrica, ventana, MDE, alfa, potencia, fórmula, ajustes, tráfico, duración, diagnósticos y decisión.
19
Fuentes científicas
Cohen fundamenta la potencia; CONSORT exige tamaño, resultados, aleatorización, números analizados y precisión. Ninguna fuente predice 8,7%.
- Cohen (1992) ↗Full text verified
- Moher et al. (2010) ↗Full text verified
Dataset · Herramienta
Conexiones metodológicas
