Le test de Shapiro-Wilk affiche p = 0,003. La normalité est rejetée, et le réflexe enseigné partout est immédiat : basculer sur l’équivalent non paramétrique. C’est une réponse correcte. Ce n’est pas la seule, et ce n’est pas toujours la meilleure.
Il existe trois voies, et elles ne coûtent pas la même chose. On peut transformer la variable pour la ramener vers une forme symétrique. On peut garder le test paramétrique et bootstrapper ses intervalles. On peut changer de test. Chacune répond à une situation différente, et le choix se justifie en une phrase — à condition d’avoir compris ce que chacune abandonne.
Avant de choisir : la normalité de quoi, exactement ?
Deux vérifications préalables font disparaître le problème dans un cas sur deux.
Première vérification : ce n’est pas la variable brute qui doit être normale. Pour un test t, une ANOVA ou une régression, la condition porte sur les résidus du modèle — l’écart entre chaque observation et ce que le modèle prédit. Une variable dépendante fortement asymétrique dans l’ensemble de l’échantillon peut parfaitement produire des résidus symétriques une fois les groupes ou les prédicteurs pris en compte. Enregistrez les résidus, testez-les, et relisez notre article sur le test de Shapiro-Wilk avant de conclure.
Deuxième vérification : la taille de l’échantillon. Shapiro-Wilk devient très sensible au-delà de 200 ou 300 observations : il détecte des écarts minuscules et sans conséquence. Or c’est précisément dans les grands échantillons que le théorème central limite protège la distribution de la moyenne. Un test significatif sur n = 400, accompagné d’un histogramme d’allure raisonnable et d’un Q-Q plot sans décrochage massif, ne justifie pas de changer de méthode. À l’inverse, sur n = 25, un test non significatif ne prouve rien : il manque simplement de puissance.
Regardez le graphique avant le p. Si, après ces deux vérifications, l’asymétrie est réelle et l’échantillon petit, alors la question se pose vraiment.

Voie 1 — Transformer la variable
Le principe est de remplacer votre variable par une fonction d’elle-même qui comprime les grandes valeurs. Sur une asymétrie à droite — salaires, durées, nombres de consultations, temps de réaction —, la transformation logarithmique est de loin la plus utilisée : sous SPSS, Transformer → Calculer la variable avec LN(variable). La racine carrée comprime plus doucement, l’inverse plus brutalement.
Ce que vous gagnez : vous restez dans le monde paramétrique. Vous conservez l’ANOVA, la régression, les covariables, les interactions — tout l’appareil qui permet de contrôler plusieurs facteurs simultanément et qu’aucun test non paramétrique classique ne remplace.
Ce que vous perdez : l’interprétabilité directe. Un coefficient estimé sur LN(salaire) ne se lit pas en euros. Il faut le retransformer, et la retransformation d’une moyenne logarithmique ne redonne pas la moyenne arithmétique mais la moyenne géométrique. C’est une nuance à assumer, pas à cacher : écrivez que les analyses portent sur la variable log-transformée et donnez les statistiques descriptives sur l’échelle d’origine.
Les trois pièges :
- Les zéros et les valeurs négatives. Le logarithme n’est pas défini en zéro. La parade courante,
LN(x + 1), fonctionne mais déplace la distribution et rend la constante ajoutée arbitraire : signalez-la. - Transformer une variable qui n’a aucune raison de l’être. Une variable de comptage ou une durée avec censure appelle un modèle adapté, pas une transformation. Corriger la distribution d’une variable mal modélisée, c’est traiter le symptôme.
- Essayer les transformations les unes après les autres jusqu’à ce que Shapiro-Wilk passe. La méthode de Box-Cox, qui choisit l’exposant optimal, existe précisément pour éviter cette pêche — mais elle n’est pas accessible dans les menus de base de SPSS et demande de passer par R ou par une syntaxe dédiée. Si vous ne pouvez pas la mettre en œuvre, choisissez la transformation d’après la nature de la variable, pas d’après le résultat du test.
Voie 2 — Garder le test et bootstrapper
Le bootstrap ne transforme rien et ne change pas de test. Il change la façon dont l’incertitude est estimée. Au lieu de supposer que la statistique suit une loi théorique, on tire au sort, avec remise, des milliers de rééchantillons de la même taille dans votre propre base, on recalcule la statistique dans chacun, et on lit l’intervalle directement dans la distribution obtenue.

Ce que vous gagnez : un intervalle de confiance qui ne repose plus sur la normalité, sur la statistique de votre choix — une différence de moyennes, un coefficient de régression, un effet indirect de médiation, une différence de médianes. C’est d’ailleurs pourquoi le bootstrap est devenu la norme en analyse de médiation, où la distribution de l’effet indirect n’est jamais normale.
Ce que vous perdez : peu de choses sur le plan statistique, davantage sur le plan pratique. Sous SPSS, le bootstrap est un module additionnel : il apparaît sous forme d’un bouton Bootstrap dans la plupart des boîtes de dialogue lorsque la licence l’inclut, et il est simplement absent sinon. Vérifiez avant de bâtir votre plan dessus. R le fait nativement, jamovi et JASP le proposent sur plusieurs procédures — voyez notre comparatif des logiciels si vous devez changer d’outil.
Les réglages à déclarer : le nombre de rééchantillons (1 000 suffit pour explorer, 5 000 pour un résultat que vous publiez), la méthode d’intervalle (percentile, ou BCa qui corrige le biais et l’asymétrie et qu’il faut préférer quand elle est disponible), et la graine aléatoire si vous voulez que le résultat soit reproductible à l’identique.
Le malentendu à éviter : le bootstrap ne répare pas un échantillon trop petit, ne corrige pas une dépendance entre observations, et ne rattrape pas un modèle mal spécifié. Il relâche une hypothèse de forme, une seule.
Voie 3 — Passer au non-paramétrique
C’est la voie enseignée par défaut : Mann-Whitney à la place du test t sur deux groupes indépendants, Wilcoxon sur deux mesures appariées, Kruskal-Wallis à la place de l’ANOVA à un facteur, Spearman à la place de Pearson.
Ce que vous gagnez : aucune hypothèse de forme, une robustesse totale aux valeurs extrêmes, et une perte de puissance bien plus faible qu’on ne le croit — de l’ordre de 5 % par rapport au test t lorsque les données sont réellement normales, et un gain lorsqu’elles ne le sont pas.
Ce que vous perdez : l’objet même de la comparaison change, et c’est le point que les mémoires escamotent le plus souvent. Mann-Whitney ne compare pas deux moyennes. Il teste la probabilité qu’une observation tirée d’un groupe dépasse une observation tirée de l’autre. On ne peut le lire comme une différence de médianes que si les deux distributions ont approximativement la même forme : superposez-les avant d’écrire « la médiane du groupe A est significativement plus élevée ».
La limite structurelle : ces tests comparent des groupes. Dès que votre question comporte plusieurs facteurs croisés, une covariable à contrôler ou une interaction à tester, il n’existe pas d’équivalent non paramétrique simple, et la voie 1 ou la voie 2 redevient la seule option praticable. C’est le cas, par exemple, dès que vous devez ajuster sur un pré-test en covariable.
Le tableau de décision
| Transformer | Bootstrapper | Non-paramétrique | |
|---|---|---|---|
| Ce qui est modifié | L’échelle de la variable | Le calcul de l’incertitude | Le test lui-même |
| Modèle multifactoriel possible | Oui | Oui | Non, en pratique |
| Interprétation directe | Non, retransformation nécessaire | Oui | Sur les rangs, pas sur les moyennes |
| Robuste aux valeurs extrêmes | Partiellement | Non | Oui |
| Disponible sous SPSS de base | Oui | Selon la licence | Oui |
| Situation typique | Asymétrie à droite, variable positive | Petit échantillon, statistique complexe | Variable ordinale, valeurs extrêmes |
Comment trancher en pratique
Quatre questions, dans cet ordre, suffisent presque toujours.
- Ai-je besoin de contrôler autre chose ? Si oui — covariable, second facteur, interaction —, la voie 3 est écartée d’emblée.
- La variable est-elle naturellement asymétrique et strictement positive ? Un montant, une durée, un délai : la transformation logarithmique est la réponse conventionnelle, comprise par tous les jurys de la discipline.
- L’asymétrie vient-elle de quelques observations extrêmes ? Alors ni la transformation ni le bootstrap ne sont la bonne réponse : la question devient celle du poids de ces observations et de ce qu’il faut en faire.
- Ma variable est-elle ordinale par nature ? Un item unique de Likert, un stade, un grade : le non-paramétrique n’est pas un repli, c’est le choix correct dès le départ.
Et une règle qui vaut pour les trois : annoncez la voie avant de la prendre. Une phrase dans la méthode — « en cas de violation de la normalité des résidus, les intervalles seront estimés par bootstrap à 5 000 rééchantillons » — vaut mieux que trois pages d’explications a posteriori. Le reproche de p-hacking ne porte que sur les décisions prises après avoir vu le résultat.
Ce que vous écrivez
Trois modèles, à adapter :
Transformation. « La distribution des résidus s’écartant de la normalité (Shapiro-Wilk, p = 0,003 ; asymétrie = 1,84), la variable a fait l’objet d’une transformation logarithmique naturelle avant analyse. Les statistiques descriptives sont présentées sur l’échelle d’origine ; les tests portent sur la variable transformée. »
Bootstrap. « La normalité des résidus n’étant pas vérifiée, les intervalles de confiance à 95 % ont été estimés par bootstrap (5 000 rééchantillons, méthode BCa). L’estimation ponctuelle reste celle des moindres carrés. »
Non-paramétrique. « La normalité étant rejetée sur les deux groupes et l’effectif restant modeste (n = 31), la comparaison a été conduite par un test U de Mann-Whitney. Les distributions présentant des formes comparables, le résultat est interprété en termes de différence de tendance centrale. »
Dans les trois cas, un jury retient la même chose : vous avez vu le problème, vous avez choisi, et vous savez ce que votre choix coûte.
Rédiger la justification sans y passer la semaine
Le calcul prend dix minutes. Ce qui prend du temps, c’est d’articuler le diagnostic, la décision et sa conséquence dans un paragraphe de méthode qui tienne debout du protocole jusqu’à la discussion, sans changer de vocabulaire en route.
Tesify travaille avec vous sur ce passage : formuler la justification à partir de vos propres sorties, maintenir la cohérence terminologique entre les chapitres, et transformer une décision technique en un texte que le lecteur suit. Vos données restent les vôtres, et le texte est écrit à 100 % par vous.
Rédiger votre section méthode avec Tesify
Questions fréquentes
Peut-on combiner deux voies ?
Oui, et c’est parfois la meilleure solution : transformer la variable pour rendre le modèle raisonnable, puis bootstrapper les intervalles pour ne pas dépendre d’une normalité résiduelle imparfaite. Ce qu’il ne faut pas faire, c’est présenter successivement trois analyses et retenir celle qui donne le plus petit p.
Le bootstrap fonctionne-t-il sur un très petit échantillon ?
Mal. Le bootstrap rééchantillonne dans vos données : si elles sont trop peu nombreuses pour représenter la population, les rééchantillons héritent du problème. En dessous d’une vingtaine d’observations par groupe, il ne faut pas en attendre de miracle — le non-paramétrique est plus prudent.
Faut-il retester la normalité après transformation ?
Oui, mais sans en faire une condition de passage. Regardez surtout l’histogramme et le Q-Q plot des résidus. Si la transformation a réduit l’asymétrie sans l’annuler, le modèle est généralement utilisable : les procédures paramétriques sont robustes à des écarts modérés, beaucoup moins à des écarts massifs.
Mon directeur me dit que le non-paramétrique « fait moins sérieux ». A-t-il raison ?
Non, mais l’objection cache souvent une vraie question : un test non paramétrique répond à une question plus pauvre. Il dit qu’un groupe tend à dépasser l’autre, sans quantifier de combien sur l’échelle d’origine. Si votre discussion a besoin d’une taille d’effet interprétable en unités réelles, c’est un argument en faveur des voies 1 ou 2.
Et si mes données ne sont pas normales parce qu’il y a deux populations mélangées ?
Une distribution bimodale n’est pas un problème de normalité : c’est un signe que la variable qui distingue les deux sous-groupes manque à votre modèle. Ajoutez-la comme facteur — vous découvrirez souvent que les résidus redeviennent symétriques et que l’asymétrie n’était qu’un symptôme.
Peut-on transformer la variable indépendante plutôt que la dépendante ?
La condition de normalité ne porte jamais sur les prédicteurs, donc transformer un prédicteur ne sert pas à satisfaire une hypothèse. Cela peut en revanche se justifier pour linéariser une relation courbe — c’est une décision de spécification du modèle, à argumenter comme telle et non comme un correctif de distribution.
