Significación o tamaño del efecto: ¿qué resultado debe interpretarse?
El valor p mide la compatibilidad de los datos con un modelo nulo. El tamaño del efecto describe la magnitud observada y debe acompañarse de un intervalo y un umbral de relevancia práctica.
Respuesta directa
Evaluar conjuntamente detección, magnitud y precisión.
El valor p mide la compatibilidad de los datos con un modelo nulo. El tamaño del efecto describe la magnitud observada y debe acompañarse de un intervalo y un umbral de relevancia práctica.
01
La regla de decisión
Interprete siempre cuatro objetos juntos: estimación del efecto, intervalo, valor p de la prueba declarada y umbral de importancia práctica fijado antes del resultado. Un valor p pequeño no mide magnitud ni utilidad; uno grande no demuestra ausencia.
02
Tres niveles de lectura
- 1
Responsable: pregunte si el intervalo supera el umbral de negocio, no solo si p es inferior a 0,05.
- 2
Profesional: informe diferencia absoluta, lift relativo, intervalo, valor p, tamaños y regla de multiplicidad.
- 3
Analista: defina estimando, proceso de muestreo, δ, nivel del intervalo y sensibilidad.
03
Situación de marketing concreta
Un equipo compara dos tasas de conversión y decide si la diferencia justifica el despliegue. El coste exige al menos +1 punto. La pregunta real es: ¿qué magnitudes siguen siendo compatibles con los datos y superan el umbral?
04
Pregunta científica exacta
En las poblaciones, unidades y ventanas declaradas, ¿cuál es la diferencia descriptiva Δ = πB − πA, con qué precisión, y es el intervalo compatible con cero, con un efecto útil δ o con [−δ,+δ]?
05
Por qué p < 0,05 no basta
- Con n muy grande, una diferencia mínima puede producir un valor p pequeño sin valor económico.
- Un resultado no significativo puede ser demasiado impreciso para distinguir ausencia, daño o beneficio útil.
- Elegir δ después de ver los datos convierte la regla de negocio en justificación posterior.
American Statistical Association (2016) Lakens, Scheel & Isager (2018)
06
Intuición antes de las ecuaciones
- El valor p responde a una pregunta de compatibilidad bajo un modelo nulo declarado; no da la probabilidad de que H0 sea cierta.
- El tamaño del efecto da la magnitud en una escala elegida; el intervalo muestra valores compatibles con datos y modelo.
- El umbral δ traduce coste, margen o riesgo en una diferencia mínima útil; no es una constante universal.
07
Datos necesarios
- Dos grupos binomiales independientes, nA/nB y conversiones yA/yB; no se reivindica asignación causal.
- Misma definición de conversión, misma ventana y poblaciones explícitamente comparables.
- Umbral práctico δ = 1 punto fijado antes del análisis; alfa = 5% y familia de pruebas declarada.
08
Modelo formal y símbolos
Efecto
πA,πB; Δ=πB−πAp̂A=yA/nA; p̂B=yB/nB; Δ̂=p̂B−p̂A; lift=Δ̂/p̂AnA,nB: unidades; yA,yB: conversiones; π: parámetro poblacional; p̂: tasa observada; Δ: estimando; Δ̂: estimador; δ: diferencia mínima útil fijada antes del análisis.
Incertidumbre
H0:Δ=0; p̂pool=(yA+yB)/(nA+nB); SE0=√[p̂pool(1−p̂pool)(1/nA+1/nB)]; z=Δ̂/SE0; p=2Φ(−|z|)SE=√[p̂A(1−p̂A)/nA+p̂B(1−p̂B)/nB]; CI95=Δ̂±z0.975SE; CI90=Δ̂±z0.95SETOST: H01:Δ≤−δ; H02:Δ≥+δ; max(p1,p2)<αα es el error de tipo I declarado; Φ es la CDF normal estándar; zq es su cuantil q. El IC de Wald se usa aquí solo con grandes recuentos; prefiera un método de puntuación si la aproximación es frágil.
Fagerland, Lydersen & Laake (2015) Lakens, Scheel & Isager (2018)
09
Cálculo declarado, paso a paso
- 01
Fijar población, ventana, métrica, alfa, multiplicidad y δ antes de los resultados.
- 02
Calcular tasas, Δ en puntos y lift relativo sin cambiar unidades durante la interpretación.
- 03
Calcular p bajo H0:Δ=0 e IC95 de Δ; para equivalencia, probar [−δ,+δ] con dos pruebas unilaterales.
- 04
Clasificar respecto a cero y δ, y documentar decisión y límites.
10
Cuatro resultados con significados distintos
Ilustración sintética — valores didácticos, no observados
| Escenario | Recuentos A → B | Tasas A → B | Δ̂ | Lift relativo | p | IC95 | IC90 | TOST p | Decisión |
|---|---|---|---|---|---|---|---|---|---|
detectable_negligible | 500000/50000 → 500000/51000 | 10.000% → 10.200% | 0.200 pp | 2.000% | 0.0009046 | [0.0819; 0.3181] | [0.1009; 0.2991] | 1.62e-40 | detectable-but-negligible |
inconclusive | 1000/100 → 1000/120 | 10.000% → 12.000% | 2.000 pp | 20.000% | 0.152918 | [-0.7411; 4.7411] | [-0.3004; 4.3004] | 0.762700 | inconclusive |
practically_convincing | 10000/1000 → 10000/1250 | 10.000% → 12.500% | 2.500 pp | 25.000% | 2.21e-8 | [1.6248; 3.3752] | [1.7655; 3.2345] | 0.999609 | practically-convincing-benefit |
practically_equivalent | 50000/5000 → 50000/5025 | 10.000% → 10.050% | 0.050 pp | 0.500% | 0.792373 | [-0.3223; 0.4223] | [-0.2624; 0.3624] | 2.85e-7 | practically-equivalent |
El primer escenario rechaza tanto Δ=0 como efectos de al menos 1 punto: es detectable y queda dentro de la zona de irrelevancia práctica. Este doble resultado nunca se deduce solo de la estimación puntual.
CSV Python · MIT R · MIT SPSS · MIT SAS · MIT11
Supuestos de validez
- ¿Las unidades son independientes dentro de cada grupo y entre grupos? Si no, ¿la varianza refleja la dependencia real?
- ¿Cada unidad tiene un resultado binario, una probabilidad estable en su grupo y una sola observación en la ventana?
- ¿Los recuentos bastan para la aproximación normal? Si no, ¿se usa un método binomial o de puntuación adecuado?
- ¿δ procede de una función de valor documentada y fijada antes del análisis, en vez del resultado observado?
12
Diagnósticos e incertidumbre
Comprobar los cuatro recuentos binomiales, denominadores y ausencia de duplicados.
Informar IC95 para Δ e IC90 para TOST; anchura excesiva implica información insuficiente.
Repetir para valores δ defendibles y corrección de multiplicidad predeclarada.
13
Interpretar el resultado
- Detectable pero despreciable: se excluye cero y el IC90 queda enteramente en [−δ,+δ]; la estimación puntual por sí sola no basta.
- No concluyente: el intervalo contiene cero y efectos útiles; recopilar datos o decidir con riesgo explícito.
- Prácticamente convincente: IC95 supera δ en la dirección útil bajo los supuestos declarados.
- Prácticamente equivalente: IC90 dentro de [−δ,+δ] y superan ambas pruebas unilaterales.
14
Conclusiones admisibles y prohibidas
Admisible
- Describir magnitud y precisión para poblaciones observadas.
- Indicar qué valores útiles o despreciables siguen compatibles con los datos.
Prohibido
- Convertir significación en importancia, probabilidad de H0 o causalidad.
- Interpretar p ≥ 0,05 como prueba de ausencia sin equivalencia justificada.
15
Decisión de marketing posible
- 01
Desplegar solo si el rango plausible supera el umbral de valor y los riesgos son aceptables.
- 02
Detener por futilidad solo con equivalencia práctica sustentada en un δ defendible.
- 03
En otro caso, tratar como no concluyente y elegir entre más datos, piloto acotado o decisión bajo riesgo.
16
Cuándo usar y cuándo no usar
Usar
- Comparaciones de dos proporciones independientes ya justificadas por el plan.
- Lectura decisional tras comprobar diseño, datos y multiplicidad.
No usar
- Para elegir la prueba: véase MSC-P-039.
- Para potencia y n: MSC-P-012; para causalidad: MSC-P-013.
17
Implementaciones reproducibles
Python 3.13 · referencia
python msc-p004-reference.py --csv msc-p004-significance-effect-size.csvR 4.5 · referencia
Rscript msc-p004-reference.R msc-p004-significance-effect-size.csvSPSS 31 · secundario
INSERT FILE='msc-p004-reference.sps'.SAS 9.4 · secundario
%include 'msc-p004-reference.sas';Python y R son las referencias ejecutables verificadas. Las sintaxis secundarias SPSS y SAS aplican los mismos recuentos, fórmulas y reglas de decisión; deben ejecutarse en su entorno nativo antes del uso operativo.
18
Entregable final esperado
- 01
Pregunta, población, unidad, ventana y diseño.
- 02
Δ absoluto, lift relativo, valor p, IC95 y δ predeclarado.
- 03
Clase decisional, supuestos, multiplicidad, límites y decisión imposible.
19
Fuentes científicas y nivel de evidencia
- American Statistical Association (2016)Declaración institucional
El valor p no mide tamaño ni importancia y no debe decidir solo.
- Lakens (2013)Artículo metodológico, CC BY
Los tamaños del efecto comunican magnitud y apoyan comparación, síntesis y planificación.
- Lakens, Scheel & Isager (2018)Tutorial metodológico, acceso abierto
La equivalencia exige límites basados en el menor efecto de interés y dos pruebas unilaterales.
- Fagerland, Lydersen & Laake (2015)Revisión metodológica
El IC de Wald para dos proporciones exige grandes recuentos y es menos robusto que los intervalos de puntuación.
Conexiones metodológicas
