Significativité ou taille d’effet : quel résultat faut-il interpréter ?
La p-value mesure la compatibilité des données avec un modèle nul. La taille d’effet décrit l’ampleur observée ; elle doit être accompagnée d’un intervalle et d’un seuil de pertinence pratique.
Réponse directe
Juger simultanément détection, ampleur et précision.
La p-value mesure la compatibilité des données avec un modèle nul. La taille d’effet décrit l’ampleur observée ; elle doit être accompagnée d’un intervalle et d’un seuil de pertinence pratique.
01
La règle de décision
Interprétez toujours quatre objets ensemble : l’estimation de l’effet, son intervalle, la p-value du test déclaré et un seuil d’importance pratique fixé avant de voir le résultat. Une petite p-value ne mesure ni l’ampleur ni l’utilité ; une grande p-value ne démontre pas l’absence d’effet.
02
Trois niveaux de lecture
- 1
Décideur : demandez si l’intervalle dépasse le seuil métier, pas seulement si p est inférieur à 0,05.
- 2
Praticien : rapportez différence absolue, lift relatif, intervalle, p-value, effectifs et règle de multiplicité.
- 3
Analyste : définissez l’estimand, le processus d’échantillonnage, δ, le niveau d’intervalle et l’analyse de sensibilité.
03
Situation marketing concrète
Une équipe compare deux taux de conversion et veut décider si l’écart justifie un déploiement. Elle dispose d’une p-value, mais le coût du changement exige au moins +1 point de conversion. Le vrai problème est donc : quelles ampleurs restent compatibles avec les données, et franchissent-elles ce seuil ?
04
Question scientifique exacte
Dans les populations, unités et fenêtres déclarées, quelle est la différence descriptive Δ = πB − πA, avec quelle précision, et l’intervalle est-il compatible avec zéro, avec un effet utile δ, ou avec une zone d’équivalence [−δ, +δ] ?
05
Pourquoi p < 0,05 ne suffit pas
- Avec un très grand n, un écart minuscule peut produire une petite p-value sans valeur économique.
- Un résultat non significatif peut être simplement trop imprécis pour distinguer absence, dommage ou bénéfice utile.
- Choisir δ après avoir vu les données transforme la règle métier en justification a posteriori.
American Statistical Association (2016) Lakens, Scheel & Isager (2018)
06
Intuition avant les équations
- La p-value répond à une question de compatibilité sous un modèle nul déclaré ; elle ne donne pas la probabilité que H0 soit vraie.
- La taille d’effet donne l’ampleur sur une unité choisie ; l’intervalle montre les valeurs encore compatibles avec les données et le modèle.
- Le seuil δ traduit un coût, une marge ou un risque en différence minimale utile ; ce n’est pas une constante universelle.
07
Données nécessaires
- Deux groupes binomiaux indépendants, effectifs nA/nB et conversions yA/yB ; aucune assignation causale n’est revendiquée.
- Même définition de conversion, même fenêtre d’observation et populations explicitement comparables.
- Seuil pratique δ = 1 point fixé avant l’analyse ; alpha = 5 % et famille de tests déclarée.
08
Modèle formel et symboles
Effet
πA,πB; Δ=πB−πAp̂A=yA/nA; p̂B=yB/nB; Δ̂=p̂B−p̂A; lift=Δ̂/p̂AnA,nB : unités ; yA,yB : conversions ; π : paramètre de population ; p̂ : taux observé ; Δ : estimand ; Δ̂ : estimateur ; δ : différence minimale utile fixée avant l’analyse.
Incertitude
H0:Δ=0; p̂pool=(yA+yB)/(nA+nB); SE0=√[p̂pool(1−p̂pool)(1/nA+1/nB)]; z=Δ̂/SE0; p=2Φ(−|z|)SE=√[p̂A(1−p̂A)/nA+p̂B(1−p̂B)/nB]; CI95=Δ̂±z0.975SE; CI90=Δ̂±z0.95SETOST: H01:Δ≤−δ; H02:Δ≥+δ; max(p1,p2)<αα est le risque de première espèce déclaré ; Φ est la fonction de répartition normale ; zq est son quantile q. L’IC de Wald est utilisé ici seulement pour de grands comptes ; préférer une méthode de score lorsque l’approximation est fragile.
Fagerland, Lydersen & Laake (2015) Lakens, Scheel & Isager (2018)
09
Calcul déclaré, étape par étape
- 01
Fixer population, fenêtre, métrique, alpha, multiplicité et δ avant les résultats.
- 02
Calculer les taux, Δ en points et le lift relatif, sans changer d’unité en cours d’interprétation.
- 03
Calculer p sous H0:Δ=0 et l’IC95 de Δ ; pour l’équivalence, tester aussi [−δ,+δ] avec deux tests unilatéraux.
- 04
Classer le résultat par rapport à zéro et δ, puis documenter la décision et ce qu’elle ne prouve pas.
10
Quatre résultats qui ne disent pas la même chose
Illustration synthétique — valeurs pédagogiques, non observées
| Scénario | Comptes A → B | Taux A → B | Δ̂ | Lift relatif | p | IC95 | IC90 | TOST p | Décision |
|---|---|---|---|---|---|---|---|---|---|
detectable_negligible | 500000/50000 → 500000/51000 | 10.000% → 10.200% | 0.200 pp | 2.000% | 0.0009046 | [0.0819; 0.3181] | [0.1009; 0.2991] | 1.62e-40 | detectable-but-negligible |
inconclusive | 1000/100 → 1000/120 | 10.000% → 12.000% | 2.000 pp | 20.000% | 0.152918 | [-0.7411; 4.7411] | [-0.3004; 4.3004] | 0.762700 | inconclusive |
practically_convincing | 10000/1000 → 10000/1250 | 10.000% → 12.500% | 2.500 pp | 25.000% | 2.21e-8 | [1.6248; 3.3752] | [1.7655; 3.2345] | 0.999609 | practically-convincing-benefit |
practically_equivalent | 50000/5000 → 50000/5025 | 10.000% → 10.050% | 0.050 pp | 0.500% | 0.792373 | [-0.3223; 0.4223] | [-0.2624; 0.3624] | 2.85e-7 | practically-equivalent |
Le premier scénario rejette à la fois Δ=0 et les effets d’au moins 1 point : il est détectable statistiquement et contenu dans la zone de négligibilité pratique. Ce double résultat ne se déduit jamais de la seule estimation ponctuelle.
CSV Python · MIT R · MIT SPSS · MIT SAS · MIT11
Hypothèses de validité
- Les unités sont-elles indépendantes au sein et entre groupes ? Sinon, la variance tient-elle compte de la dépendance réelle ?
- Chaque unité a-t-elle une issue binaire, une probabilité stable dans son groupe et une seule observation dans la fenêtre ?
- Les comptes sont-ils assez grands pour l’approximation normale ? Sinon, une méthode binomiale ou de score adaptée est-elle utilisée ?
- δ provient-il d’une fonction de valeur documentée et fixée avant l’analyse, plutôt que du résultat observé ?
12
Diagnostics et incertitude
Vérifier les quatre comptes binomiaux, les dénominateurs et l’absence de doublons d’unité.
Rapporter IC95 pour Δ et IC90 pour TOST ; une largeur excessive signifie information insuffisante.
Refaire la lecture pour plusieurs δ justifiables et selon la correction de multiplicité pré-déclarée.
13
Interpréter le résultat
- Détectable mais négligeable : zéro est exclu et l’IC90 est entièrement contenu dans [−δ,+δ] ; l’estimation ponctuelle seule ne suffit pas.
- Indécis : l’intervalle contient à la fois zéro et des effets utiles ; collecter ou décider sous risque explicite.
- Pratiquement convaincant : l’IC95 dépasse δ dans la direction utile sous les hypothèses déclarées.
- Pratiquement équivalent : l’IC90 est contenu dans [−δ,+δ] et les deux tests unilatéraux passent.
14
Conclusions recevables et interdites
Recevable
- Décrire l’ampleur et la précision pour les populations observées.
- Dire quelles valeurs utiles ou négligeables restent compatibles avec les données.
Interdit
- Transformer significativité en importance, probabilité de H0 ou causalité.
- Interpréter p ≥ 0,05 comme preuve d’absence sans test d’équivalence justifié.
15
Décision marketing possible
- 01
Déployer seulement si la plage plausible dépasse le seuil de valeur et si les risques opérationnels sont acceptables.
- 02
Arrêter pour futilité seulement si l’équivalence pratique est étayée autour d’un δ défendable.
- 03
Sinon, traiter le résultat comme indécis et choisir entre collecte supplémentaire, pilote borné ou décision sous risque.
16
Quand utiliser, et quand ne pas utiliser
Utiliser
- Comparaisons de deux proportions indépendantes déjà justifiées par le plan d’analyse.
- Lecture décisionnelle après contrôle du design, des données et de la multiplicité.
Ne pas utiliser
- Pour choisir le test : voir MSC-P-039.
- Pour planifier puissance et n : voir MSC-P-012 ; pour causalité : voir MSC-P-013.
17
Implémentations reproductibles
Python 3.13 · référence
python msc-p004-reference.py --csv msc-p004-significance-effect-size.csvR 4.5 · référence
Rscript msc-p004-reference.R msc-p004-significance-effect-size.csvSPSS 31 · secondaire
INSERT FILE='msc-p004-reference.sps'.SAS 9.4 · secondaire
%include 'msc-p004-reference.sas';Python et R sont les références exécutables vérifiées. Les syntaxes secondaires SPSS et SAS appliquent les mêmes comptes, formules et règles de décision ; elles doivent être exécutées dans leur environnement natif avant un usage opérationnel.
18
Livrable final attendu
- 01
Question, population, unité, fenêtre et design.
- 02
Δ absolu, lift relatif, p-value, IC95 et δ pré-déclaré.
- 03
Classe décisionnelle, hypothèses, multiplicité, limites et décision impossible.
19
Sources scientifiques et niveau de preuve
- American Statistical Association (2016)Déclaration institutionnelle
La p-value ne mesure ni la taille ni l’importance et ne doit pas décider seule.
- Lakens (2013)Article méthodologique, CC BY
Les tailles d’effet communiquent l’ampleur et facilitent comparaison, synthèse et planification.
- Lakens, Scheel & Isager (2018)Tutoriel méthodologique, open access
L’équivalence exige des bornes fondées sur le plus petit effet d’intérêt et deux tests unilatéraux.
- Fagerland, Lydersen & Laake (2015)Revue méthodologique
L’IC de Wald pour deux proportions exige de grands comptes et reste moins robuste que des intervalles de score.
Connexions méthodologiques
