Étiquette : SPSS

  • Analyse de modération sous SPSS : effet d’interaction, PROCESS et pentes simples (2026)

    Analyse de modération sous SPSS : effet d’interaction, PROCESS et pentes simples (2026)

    Votre hypothèse H3 ressemble sans doute à ceci : « l’effet du stress perçu sur l’épuisement professionnel est plus fort lorsque le soutien social est faible ». Ou : « la relation entre l’ancienneté et la performance est plus marquée dans les petites structures ».

    Ces énoncés ont tous la même forme. Vous ne dites pas que X influence Y. Vous dites que l’intensité de cet effet dépend d’une troisième variable. C’est une hypothèse de modération, et elle ne se teste pas en ajoutant simplement cette troisième variable au modèle.

    C’est l’erreur la plus fréquente sur cette famille d’hypothèses, et elle est invisible : le modèle tourne, sort des coefficients lisibles, et ne teste pas ce que l’étudiant croit qu’il teste. Voici la procédure correcte, la lecture de la sortie et les deux pièges classiques.

    Modération et médiation ne répondent pas à la même question

    Ces deux notions sont systématiquement confondues, alors que la distinction tient en une phrase.

    • La médiation répond à pourquoi et par quel chemin X influence Y. La variable intermédiaire M transmet l’effet : X agit sur M, qui agit sur Y.
    • La modération répond à pour qui, quand et dans quelles conditions. La variable W ne transmet rien : elle règle l’intensité, voire le signe, de la relation entre X et Y.

    Le test diagnostique est simple. Si votre variable supplémentaire est une conséquence de X, vous êtes en médiation. Si elle préexiste à X et n’en dépend pas — le sexe, la taille de l’entreprise, un trait de personnalité, l’ancienneté —, vous êtes en modération. Notre guide de l’analyse de médiation avec la macro PROCESS traite le cas symétrique en détail.

    Un point de vocabulaire, parce qu’il rassure : modération, effet d’interaction et effet modérateur désignent la même chose. La psychologie dit « modération », l’économétrie dit « interaction ».

    Schéma d'un modèle de modération : une variable agit sur la relation entre deux autres
    Le modérateur ne pointe pas vers Y : il pointe vers la flèche qui relie X à Y.

    Le principe : un terme produit

    Une modération se teste en ajoutant à votre régression une variable supplémentaire : le produit de la variable indépendante par le modérateur. Le modèle complet comporte donc trois prédicteurs : X, le modérateur W, et le terme d’interaction X × W.

    Les deux premiers doivent impérativement figurer dans le modèle en même temps que le troisième. Un terme d’interaction sans ses composantes n’est pas interprétable — c’est une contrainte, pas une convention.

    L’intuition derrière le produit est la suivante : le coefficient de X × W indique de combien la pente de X sur Y change quand W augmente d’une unité. S’il est nul, la pente de X est la même partout, et il n’y a pas de modération. S’il est non nul, la pente varie selon le niveau de W — ce qui est précisément votre hypothèse.

    Faut-il centrer les variables ? Oui, mais pas pour la raison qu’on vous a donnée

    Le conseil universel est de centrer X et W sur leur moyenne avant de calculer le produit. Il est bon, mais la justification qui l’accompagne est presque toujours fausse.

    Ce qu’on vous dira : « il faut centrer pour éliminer la multicolinéarité entre le produit et ses composantes ». Il est vrai que X × W est mécaniquement très corrélé à X et à W, et que le centrage fait chuter les facteurs d’inflation de la variance (VIF) de façon spectaculaire.

    Ce qu’on ne vous dira pas : cela ne change absolument rien au test. Le coefficient du terme d’interaction, son erreur standard, son t, sa p-valeur et le R² du modèle sont rigoureusement identiques avec ou sans centrage. Ce sont les mêmes chiffres. La colinéarité introduite par un terme produit est dite « non essentielle » : elle vient du choix de l’origine de l’échelle, pas d’une redondance réelle entre les variables, et le centrage ne fait que déplacer cette origine.

    Le centrage a néanmoins un vrai bénéfice, et c’est lui qu’il faut invoquer devant un jury : l’interprétabilité. Sur variables centrées, le coefficient de X se lit comme l’effet de X lorsque W est à sa moyenne — une valeur qui existe dans votre échantillon. Sur variables brutes, il se lit comme l’effet de X lorsque W vaut zéro, ce qui peut désigner un âge de zéro an ou un score de satisfaction impossible.

    Conséquence pratique : ne rapportez jamais un VIF élevé sur un terme d’interaction comme un problème, et ne supprimez surtout pas une variable pour cette raison — c’est un artefact d’échelle.

    La procédure sous SPSS

    SPSS n’a pas de boîte de dialogue « modération ». Deux chemins sont possibles, et ils donnent le même test.

    Voie 1 — la régression hiérarchique manuelle

    Elle a l’avantage d’être transparente : vous voyez exactement ce que vous faites, ce qui est appréciable si votre jury vous interroge sur la construction du modèle.

    1. Centrer. Transformer > Calculer la variable : créez X_c = X - moyenne(X) et W_c = W - moyenne(W). Relevez les moyennes au préalable avec Analyse > Statistiques descriptives.
    2. Créer le produit. Transformer > Calculer la variable : XW = X_c * W_c.
    3. Bloc 1. Analyse > Régression > Linéaire. Variable dépendante : Y. Indépendantes : X_c et W_c, plus vos éventuelles variables de contrôle.
    4. Bloc 2. Cliquez sur Suivant et ajoutez XW seul dans ce second bloc.
    5. Options. Dans Statistiques, cochez Variation de R-deux. C’est cette case qui produit le chiffre que vous allez rapporter.

    Toutes les conditions d’application de la régression linéaire multiple s’appliquent ici sans changement : linéarité, indépendance et normalité des résidus, homoscédasticité.

    Voie 2 — la macro PROCESS, modèle 1

    PROCESS, développée par Andrew F. Hayes, est téléchargeable gratuitement et s’installe comme une extension SPSS. Le modèle 1 est celui de la modération simple.

    Son intérêt est de produire automatiquement tout ce qui vient après la régression : le centrage, le terme produit, les effets conditionnels aux différents niveaux du modérateur, la région de significativité et les données du graphique. C’est plusieurs heures de manipulation en moins, et beaucoup moins d’occasions de se tromper.

    Sortie logicielle stylisée avec la ligne du terme d'interaction mise en évidence
    Une seule ligne de la sortie décide du sort de votre hypothèse : celle du terme produit.

    Lire la sortie sans se tromper

    Une seule ligne décide

    Toute votre hypothèse tient sur la ligne du terme d’interaction. Si sa p-valeur est inférieure à 0,05, la modération est établie ; sinon, elle ne l’est pas. En régression hiérarchique, le ΔR² du bloc 2 donne la même information sous une forme plus parlante : la part de variance de Y expliquée en plus par le fait de tenir compte de l’interaction. Les deux tests sont équivalents dans le cas d’un modérateur unique.

    Le piège des « effets principaux »

    Voici l’erreur qui coûte le plus de points en soutenance. Dans un modèle avec terme d’interaction, le coefficient de X n’est pas l’effet moyen de X. C’est l’effet de X lorsque W vaut zéro — c’est-à-dire, sur variables centrées, lorsque W est à sa moyenne. On parle d’effet conditionnel, et non d’effet principal.

    Deux conséquences que les jurys aiment vérifier :

    • Un coefficient de X non significatif dans le modèle avec interaction ne signifie pas que X n’a pas d’effet. Il peut avoir un effet fort chez les uns, un effet inverse chez les autres, et une moyenne proche de zéro.
    • Inversement, si l’interaction est significative, commenter longuement les coefficients de X et de W comme s’il s’agissait d’effets généraux est une faute d’interprétation.

    C’est la même logique que celle de l’ANOVA factorielle, où une interaction significative impose de ne plus interpréter les effets principaux tels quels, mais d’aller décomposer les effets simples.

    Décomposer : les pentes simples

    Savoir que l’effet varie ne dit pas encore comment. La décomposition consiste à estimer la pente de X sur Y à plusieurs niveaux choisis de W — conventionnellement à la moyenne, à un écart-type en dessous et à un écart-type au-dessus. PROCESS fournit ces trois pentes avec leur test de significativité.

    C’est là que le résultat devient racontable : « chez les répondants à faible soutien social, l’effet du stress est fort ; chez ceux à soutien élevé, il n’est plus distinguable de zéro ».

    Quand le modérateur est continu, découper à ±1 écart-type reste arbitraire. La technique de Johnson-Neyman répond autrement : au lieu de tester trois points choisis d’avance, elle identifie la plage de valeurs de W sur laquelle l’effet de X est significatif. PROCESS la propose en option, et c’est un vrai plus dans un mémoire quantitatif.

    Le graphique n’est pas décoratif

    Une modération se comprend visuellement en deux secondes et se lit péniblement dans un tableau ; attendez-vous à ce qu’un jury regarde la figure avant les chiffres. La convention : X en abscisse, Y en ordonnée, une droite par niveau du modérateur. Des droites qui se croisent signalent une interaction disordinale, où l’effet change de signe selon le niveau du modérateur — le résultat le plus intéressant qu’on puisse obtenir sur ce type d’hypothèse.

    La vraie difficulté : la puissance

    Il faut le dire franchement, parce que beaucoup d’étudiants concluent trop vite à l’absence de modération. Les effets d’interaction sont notoirement difficiles à détecter dans les études de terrain. Le ΔR² attribuable à une interaction dépasse rarement quelques centièmes, même quand l’effet est réel et théoriquement solide. Le terme produit hérite en effet de l’erreur de mesure de ses deux composantes, et la variance restant à expliquer après X et W est faible par construction.

    Conséquence directe : une modération non significative sur un échantillon de 80 personnes n’est pas une réfutation, c’est le plus souvent un manque de puissance. Deux réflexes en découlent — dimensionner l’échantillon en amont avec un calcul de puissance sous G*Power, en visant le ΔR² et non l’effet global du modèle ; et, en aval, formuler la conclusion comme une non-détection plutôt que comme une absence d’effet.

    Une précaution de mesure, enfin : plus vos échelles sont fiables, plus vous avez de chances de détecter l’interaction. Soigner la fidélité d’une échelle de Likert n’est pas un détail de forme ici.

    Ce qu’il faut rapporter

    Un tableau de régression hiérarchique à deux blocs, avec pour chacun les coefficients standardisés et le R², et pour le bloc 2 le ΔR² et son test. Puis un tableau ou un paragraphe des pentes simples, et la figure.

    Modèle de phrase — le test : « Les variables ont été centrées avant construction du terme produit. L’introduction de l’interaction stress × soutien social au bloc 2 améliore significativement le modèle (ΔR² = 0,04 ; F(1, 212) = 9,87 ; p = 0,002), le coefficient du terme produit étant négatif (β = −0,21 ; p = 0,002). »

    Modèle de phrase — la décomposition : « L’analyse des pentes simples indique que l’effet du stress perçu sur l’épuisement est significatif lorsque le soutien social est faible (−1 ET : B = 0,48 ; p < 0,001), atténué au niveau moyen (B = 0,27 ; p = 0,004) et non significatif lorsque le soutien est élevé (+1 ET : B = 0,06 ; p = 0,52). »

    Modèle de phrase — un résultat nul : « Le terme d’interaction n’atteint pas le seuil de significativité (ΔR² = 0,01 ; p = 0,18). Compte tenu de la puissance limitée dont disposent les tests d’interaction sur un échantillon de cette taille, ce résultat est interprété comme une non-détection et non comme une preuve d’absence de modération. »

    Sur le choix de l’indicateur, notre guide des tailles d’effet selon le test employé détaille les conventions : pour une modération, c’est le ΔR², éventuellement converti en .

    Rédiger le chapitre qui va autour

    Le test lui-même prend une après-midi. Ce qui prend des semaines, c’est de justifier théoriquement pourquoi ce modérateur-là, d’articuler l’hypothèse H3 avec la revue de littérature, puis d’écrire une discussion qui explique ce que la décomposition des pentes signifie pour votre terrain.

    Tesify vous accompagne sur cette partie rédactionnelle : structurer l’argumentation qui amène l’hypothèse, garder une terminologie constante entre le cadre théorique, les résultats et la discussion, et transformer une sortie logicielle en texte académique défendable. Vos données et vos analyses restent les vôtres.

    Rédiger votre chapitre d’analyse avec Tesify

    Questions fréquentes

    Mon modérateur est une variable catégorielle : la procédure change-t-elle ?

    Le principe est identique, avec une étape en plus. Une variable à deux modalités se code en 0/1 et se multiplie directement à X. Au-delà de deux modalités, il faut créer k−1 indicatrices et autant de termes produits, puis tester leur apport conjoint au bloc 2 — c’est le ΔR² du bloc entier qui fait foi, pas chaque coefficient pris isolément. PROCESS gère ce cas nativement via son option pour modérateur multicatégoriel.

    Le terme d’interaction est significatif mais le coefficient de X ne l’est pas. Est-ce contradictoire ?

    Non, et c’est même une configuration très informative. Le coefficient de X représente son effet au niveau moyen du modérateur ; il peut être proche de zéro parce qu’un effet positif chez les uns compense un effet négatif chez les autres. Décomposez en pentes simples : vous découvrirez probablement une interaction disordinale, où la relation s’inverse selon le niveau de W. C’est un résultat fort, à condition de le présenter comme tel.

    Dois-je vraiment centrer si le logiciel donne les mêmes p-valeurs ?

    Le test est effectivement inchangé, mais centrez quand même. Sans centrage, le coefficient de X s’interprète à W = 0, une valeur souvent impossible dans votre échantillon, ce qui rend le tableau ininterprétable pour votre lecteur. Le centrage ne change pas le résultat : il change ce que vos autres coefficients veulent dire. PROCESS centre automatiquement lorsque l’option correspondante est activée.

    Peut-on tester une modération dans une régression logistique ?

    Oui, la logique du terme produit est identique et PROCESS accepte une variable dépendante binaire. L’interprétation demande plus de soin, parce que les coefficients sont des logarithmes de rapports de cotes et que leur addition ne se lit pas aussi directement que dans le cas linéaire. Sur un mémoire de master, appuyez-vous surtout sur les effets conditionnels et sur une représentation graphique des probabilités prédites.

    Combien de participants faut-il pour tester une modération ?

    Il n’existe pas de nombre magique, et les règles empiriques du type « 10 observations par prédicteur » sont trompeuses ici : elles suffisent pour estimer le modèle, pas pour détecter une interaction. Le calcul de puissance doit porter sur le ΔR² attendu, qui est petit. À titre d’ordre de grandeur, détecter un ΔR² de 0,02 avec une puissance de 80 % demande couramment plus de 350 participants. En dessous de 150, considérez qu’un résultat nul n’est pas concluant et dites-le dans vos limites.

    Puis-je tester plusieurs modérateurs dans le même mémoire ?

    Techniquement oui, mais séparément et avec parcimonie. Empiler les interactions multiplie les tests, épuise la puissance et ouvre la porte au sur-ajustement. Le meilleur usage en mémoire de master est un seul modérateur, choisi et justifié théoriquement avant de regarder les données. Une modération testée après coup parce que le résultat principal était décevant se voit immédiatement, et un jury la sanctionnera.

  • Annuaire 2026 : chaque condition statistique et son plan de secours

    Annuaire 2026 : chaque condition statistique et son plan de secours

    Il est tard, SPSS vient de vous rendre un test de conditions significatif, et vous cherchez une seule information : qu’est-ce que je fais maintenant ?

    Cette page est faite pour ça. Elle réunit les onze conditions d’application qu’un mémoire quantitatif rencontre réellement, et pour chacune : comment on la diagnostique, quel seuil s’applique, ce qu’on fait quand elle échoue, et où lire le détail.

    Un principe la traverse. Une condition violée n’invalide presque jamais un mémoire. Chacune a une correction ou une alternative documentée. Ce qu’un jury sanctionne, ce n’est pas une condition non respectée — c’est une condition non testée, ou testée puis ignorée.

    Le tableau de correspondance

    Condition Diagnostic Seuil Plan de secours
    Normalité (2 groupes) Shapiro-Wilk + Q-Q plot p < 0,05 Mann-Whitney, ou test t si n > 30
    Normalité (3 groupes et +) Shapiro-Wilk par groupe p < 0,05 Kruskal-Wallis
    Normalité des résidus (régression) Q-Q plot des résidus Écart visuel net Bootstrap des IC
    Variances égales (2 groupes) Levene p < 0,05 Ligne « variances inégales » (Welch)
    Variances égales (3 groupes et +) Levene p < 0,05 ANOVA de Welch + Games-Howell
    Sphéricité (mesures répétées) Mauchly + epsilon p < 0,05 Greenhouse-Geisser ou Huynh-Feldt
    Homoscédasticité (régression) Nuage résidus × prédites Forme d’entonnoir Transformation log, ou erreurs standard robustes
    Multicolinéarité VIF et tolérance VIF > 10 (alerte dès 5) Retirer, combiner, ou assumer
    Indépendance des résidus Durbin-Watson Hors 1,5-2,5 Modèle multiniveau ou mesures répétées
    Linéarité Nuage résidus × prédites Courbure visible Terme quadratique, transformation, découpage en classes
    Absence de points influents Distance de Cook > 1 Analyse de sensibilité avec et sans
    Chaque condition d'application reliée à sa solution de repli
    À chaque condition correspond une route de repli identifiée. Aucune ne mène à l’abandon du modèle.

    Les conditions, une par une

    1 et 2. La normalité

    C’est la condition la plus testée et la plus mal comprise. Trois choses à savoir. D’abord, en régression, elle porte sur les résidus, pas sur vos variables brutes — tester la normalité de la variable dépendante ne renseigne pas sur la validité du modèle. Ensuite, au-delà d’une trentaine d’observations par groupe, le théorème central limite rend les tests paramétriques très robustes à un écart modéré. Enfin, le test de Shapiro-Wilk souffre du défaut de tous les tests de conditions : il ne détecte rien sur petit échantillon et devient significatif pour un rien sur grand échantillon.

    Regardez donc toujours le Q-Q plot à côté du test. Détail complet dans notre article sur le test de Shapiro-Wilk et l’interprétation de la normalité.

    Replis : pour deux groupes indépendants, Mann-Whitney ; pour deux mesures appariées, le test de Wilcoxon ; pour plusieurs mesures répétées, le test de Friedman.

    4 et 5. L’homogénéité des variances

    Le test de Levene répond à une question — les groupes sont-ils également dispersés ? — et à une seule. Il ne dit rien de la normalité, et c’est la source de l’erreur la plus répandue : basculer vers un test non paramétrique parce que Levene est significatif.

    La bonne réponse est paramétrique. Pour deux groupes, c’est la ligne « variances inégales » du tableau du test t, c’est-à-dire la correction de Welch. Pour trois groupes ou plus, c’est l’ANOVA de Welch, assortie du post-hoc de Games-Howell — un enchaînement détaillé dans notre article sur les variances inégales entre Welch, Games-Howell et Kruskal-Wallis.

    Nuance utile : l’ANOVA reste raisonnablement robuste à l’hétérogénéité quand les effectifs sont équilibrés. Le scénario dangereux est celui du petit groupe très dispersé face au grand groupe homogène.

    6. La sphéricité

    Elle ne concerne que les plans à mesures répétées comportant au moins trois niveaux — avec deux mesures, elle est vérifiée par construction et SPSS n’affiche aucun test. Le test de Mauchly l’évalue, mais les colonnes epsilon situées à sa droite sont plus informatives, car elles mesurent l’ampleur de l’écart.

    Le repli est intégré : SPSS calcule d’office les lignes Greenhouse-Geisser et Huynh-Feldt. Règle usuelle : epsilon inférieur à 0,75 → Greenhouse-Geisser ; au-dessus → Huynh-Feldt. Procédure complète dans notre guide de l’ANOVA à mesures répétées.

    7, 8, 9, 10 et 11. Les conditions de la régression

    La régression en concentre cinq à elle seule, plus le diagnostic des points influents. Deux d’entre elles se lisent sur le même graphique — le nuage des résidus standardisés en fonction des valeurs prédites : une courbure signale un problème de linéarité, une forme d’entonnoir un problème d’homoscédasticité. Les autres se lisent dans les tableaux : Durbin-Watson pour l’indépendance, VIF et tolérance pour la multicolinéarité.

    Le détail de la procédure et des cinq replis se trouve dans notre guide de la régression linéaire multiple sous SPSS, et la multicolinéarité — celle qui produit les contresens les plus coûteux — a son article dédié : multicolinéarité et VIF. Pour un modèle à variable dépendante binaire, les conditions changent : voyez la régression logistique binaire.

    Les conditions qui ne se testent pas

    Trois conditions décisives ne produisent aucune p-value, et ce sont souvent celles qui coûtent le plus cher.

    La nature de vos variables. Continue, ordinale, nominale ? Aucun logiciel ne vous arrêtera si vous calculez une moyenne sur une variable nominale codée 1, 2, 3. Le cas limite le plus fréquent concerne les échelles de Likert : un item unique est ordinal, un score composite d’échelle est traité comme continu.

    L’indépendance des observations. Elle relève du design, pas du calcul. Si vous avez interrogé trente élèves dans chacune de cinq classes, vos observations ne sont pas indépendantes, quelle que soit la valeur de Durbin-Watson.

    La puissance. Une condition respectée sur vingt participants ne rachète pas un échantillon trop petit pour détecter l’effet attendu. Le calcul de taille d’échantillon avec G*Power se fait avant la collecte, jamais après.

    À cela s’ajoute une condition invisible : la complétude. La suppression listwise par défaut peut réduire silencieusement votre N d’un tiers — voyez notre article sur les données manquantes.

    Le paragraphe de contrôle des conditions à écrire dans le mémoire
    Dix lignes en début de section résultats suffisent — et elles manquent dans la majorité des mémoires.

    Le paragraphe à écrire

    Toutes ces vérifications tiennent en un paragraphe placé en tête de votre section résultats, avant le premier test commenté. Sa structure :

    1. Les conditions testées et l’instrument utilisé pour chacune.
    2. Les valeurs obtenues, avec les statistiques et les seuils.
    3. Pour chaque condition violée : la correction retenue et sa justification.
    4. Le cas échéant, l’analyse de sensibilité qui montre que les conclusions tiennent.

    Modèle : « Les conditions d’application ont été vérifiées avant analyse. La normalité des distributions, examinée par le test de Shapiro-Wilk et les diagrammes Q-Q, est satisfaite dans les trois groupes (p > 0,05). Le test de Levene indique en revanche une hétérogénéité des variances, F(2, 117) = 5,08, p = 0,008 ; l’ANOVA de Welch et le post-hoc de Games-Howell ont donc été retenus, conformément à la règle annoncée en méthodologie. Deux observations présentant une distance de Cook supérieure à 1, les analyses ont été réétablies sans elles : les conclusions demeurent inchangées. »

    Cinq phrases. Elles répondent par avance à la première question du jury, et elles montrent que vous savez ce que vous faites.

    La règle d’or : annoncer avant, exécuter après

    Un principe rend tout le reste défendable : vos règles de décision s’écrivent dans la méthodologie, avant d’avoir vu les résultats. Le seuil de VIF que vous retenez, la correction de sphéricité que vous appliquerez, le pourcentage de données manquantes au-delà duquel vous imputez — tout cela s’annonce en amont.

    Choisir la correction après coup en fonction de celle qui rend l’effet significatif porte un nom, et un jury le reconnaît immédiatement. Annoncer d’abord coûte trois phrases et vous protège entièrement, y compris — et surtout — quand les résultats ne vont pas dans le sens espéré. Sur la lecture du seuil lui-même, voyez notre article sur la p-value et le seuil de significativité, et n’oubliez pas de rapporter la taille d’effet adaptée à chaque test.

    Pour aller plus loin dans chaque famille de tests

    Écrire la méthodologie qui tient ces promesses

    Le travail réel n’est pas de cocher onze cases : c’est de tenir, sur cent pages, une cohérence entre la règle annoncée au chapitre 3 et le résultat commenté au chapitre 4, avec le même vocabulaire et les mêmes seuils.

    Tesify vous aide précisément là : structurer votre méthodologie, y inscrire vos règles de décision, et rédiger les justifications à partir de vos propres choix d’analyse — sans dérive de terminologie d’un chapitre à l’autre. Vos données et vos arbitrages restent les vôtres, et le texte est écrit à 100 % par vous.

    Structurer votre mémoire avec Tesify

    Questions fréquentes

    Faut-il tester toutes les conditions d’application ?

    Vous devez tester celles du test que vous employez, et les rapporter — pas les onze systématiquement. Un test t n’exige pas de vérifier la sphéricité. En revanche, ne rapporter aucune vérification est un signal négatif fort : un jury sanctionne beaucoup plus une condition non testée qu’une condition violée et assumée, parce que la première laisse penser que le résultat n’a jamais été contrôlé.

    Une condition violée invalide-t-elle mon mémoire ?

    Presque jamais. Chacune des conditions de ce tableau dispose d’une correction ou d’une alternative documentée, et la plupart tiennent en une case à cocher. Une condition violée est une bifurcation méthodologique que vous documentez, pas un échec. Ce qui pose problème, c’est de constater la violation et de rapporter quand même le test non corrigé.

    Dans quel ordre vérifier les conditions ?

    Avant de commenter le moindre résultat — c’est le point essentiel. L’ordre pratique : nature des variables, indépendance des observations, normalité, homogénéité des variances, puis les conditions propres au modèle (sphéricité, multicolinéarité, linéarité). Lire un tableau dans le mauvais ordre conduit à s’étonner d’un résultat dont l’explication figurait deux colonnes plus loin.

    Les tests de conditions sont-ils fiables ?

    Ils partagent tous la même faiblesse : ils manquent de puissance sur les petits échantillons — où la violation ne sera pas détectée — et deviennent significatifs pour des écarts triviaux sur les grands. Complétez-les donc systématiquement par un examen graphique et par l’ampleur de l’écart observé. Un Levene significatif accompagné d’un rapport de variances de 1,3 ne dit pas la même chose qu’un rapport de 9.

    Mon logiciel n’a pas l’option dont j’ai besoin : que faire ?

    C’est fréquent, en particulier pour les modules SPSS complémentaires absents de certaines licences universitaires. Trois voies : vérifier si l’option existe ailleurs dans le logiciel (l’ANOVA de Welch n’est pas dans le Modèle linéaire général mais bien dans l’ANOVA à un facteur), passer par un logiciel gratuit qui la propose, ou choisir une alternative disponible en le justifiant. Dans tous les cas, indiquez la version et le logiciel utilisés dans votre méthodologie.

  • Variances inégales sur trois groupes : Welch, Games-Howell ou Kruskal-Wallis ? (2026)

    Variances inégales sur trois groupes : Welch, Games-Howell ou Kruskal-Wallis ? (2026)

    Vous comparez trois groupes ou plus. Vous lancez l’ANOVA, et SPSS vous rend d’abord le test de Levene : p = 0,008. Les variances ne sont pas homogènes.

    Le réflexe quasi universel, à ce moment-là, est de fermer l’ANOVA et de basculer vers Kruskal-Wallis, « le test non paramétrique ». C’est presque toujours le mauvais choix, et il vous coûte de la puissance statistique pour rien.

    Cet article compare les trois routes réellement disponibles, et donne la règle qui permet de trancher.

    La confusion de départ : deux conditions différentes

    L’ANOVA repose sur plusieurs conditions, dont deux qu’on mélange constamment :

    • La normalité — la distribution de la variable dans chaque groupe.
    • L’homogénéité des variances (homoscédasticité) — le fait que les groupes soient également dispersés.

    Le test de Levene ne teste que la seconde. Un Levene significatif ne vous dit rien sur la normalité de vos données.

    Or Kruskal-Wallis est la réponse à un problème de distribution : il abandonne les moyennes pour travailler sur les rangs. Il ne corrige pas l’hétérogénéité des variances — il change de question. L’utiliser pour répondre à un Levene significatif, c’est prendre un médicament pour une maladie qu’on n’a pas, tout en subissant ses effets secondaires : une perte de puissance, l’impossibilité de rapporter des moyennes, et une interprétation moins directe.

    La correction faite pour l’hétérogénéité des variances existe, elle est paramétrique, et elle s’appelle Welch. C’est exactement la même logique que pour deux groupes, où un Levene significatif conduit à la ligne « variances inégales » du test t plutôt qu’à Mann-Whitney — un mécanisme détaillé dans notre guide du test t et de Mann-Whitney. Avec trois groupes, la logique ne change pas ; seul le nom du test change.

    Trois boîtes à moustaches de dispersions très différentes
    Des variances inégales, ce sont des boîtes de tailles différentes. Cela ne dit rien de la forme des distributions.

    Route 1 — L’ANOVA de Welch

    Quand : variances inégales, distributions à peu près normales dans chaque groupe. C’est le cas le plus fréquent, et la bonne réponse par défaut.

    Ce qu’elle fait : exactement ce que fait la correction de Welch pour deux groupes. Elle ne suppose plus l’égalité des variances et ajuste les degrés de liberté en conséquence, ce qui produit des degrés de liberté décimaux et un test valide.

    Sous SPSS : Analyse → Comparer les moyennes → ANOVA à un facteur, bouton Options, cochez Welch ainsi que Test d’homogénéité de la variance et Descriptives.

    Attention à un piège de navigation qui explique beaucoup de confusions : cette option n’existe pas dans Modèle linéaire général → Univarié, la procédure que beaucoup d’étudiants utilisent par habitude. Il faut passer par ANOVA à un facteur. SPSS affiche alors un tableau Tests robustes d’égalité des moyennes contenant Welch et Brown-Forsythe.

    Brown-Forsythe, présenté dans le même tableau, est une alternative de même famille. Welch est généralement préféré, sa puissance étant meilleure dans la plupart des configurations ; Brown-Forsythe garde un avantage lorsque les distributions sont fortement asymétriques. Les deux sont défendables ; rapportez celui que vous avez annoncé.

    Route 2 — Le post-hoc de Games-Howell

    Welch vous dit que les groupes ne sont pas tous égaux. Il ne vous dit pas lesquels diffèrent. Il faut un test post-hoc — et là encore, le choix par défaut est piégeux.

    Tukey, le post-hoc le plus utilisé, suppose l’égalité des variances et des effectifs comparables. Si vous avez lancé Welch, c’est précisément parce que cette condition est violée : enchaîner sur Tukey annule l’intérêt de la correction et produit des seuils faux.

    Games-Howell est conçu pour ce cas exact. Il ne suppose ni variances égales ni effectifs égaux, et applique à chaque comparaison par paire la même logique de correction que Welch applique au test global.

    Sous SPSS : dans ANOVA à un facteur, bouton Post hoc, la fenêtre est divisée en deux zones. Games-Howell se trouve dans le bloc du bas, Variances non homogènes — que la plupart des étudiants ne remarquent jamais, parce que Tukey occupe le bloc du haut.

    Retenez donc l’appariement : Welch va avec Games-Howell, comme l’ANOVA classique va avec Tukey. Utiliser l’un sans l’autre est incohérent, et c’est visible.

    Arbre de décision entre ANOVA de Welch, Games-Howell et Kruskal-Wallis
    Deux questions suffisent : les distributions sont-elles à peu près normales, et les variances sont-elles homogènes ?

    Route 3 — Kruskal-Wallis, et quand il est réellement justifié

    Kruskal-Wallis reste le bon choix, mais pour d’autres raisons que l’hétérogénéité des variances :

    • Votre variable dépendante est ordinale — un rang, un stade, un item unique de Likert.
    • Les distributions sont franchement non normales dans plusieurs groupes, et vos effectifs sont trop petits pour compter sur la robustesse de l’ANOVA.
    • Vos groupes sont très petits, moins d’une quinzaine d’observations chacun, ce qui rend le diagnostic de normalité peu fiable.

    Deux limites à connaître avant de le choisir. D’abord, on lit souvent que Kruskal-Wallis « compare les médianes » : ce n’est vrai que si les distributions des groupes ont la même forme. Quand les variances diffèrent fortement — votre situation de départ — cette condition est justement mise en défaut, et le test compare alors des rangs moyens sans que l’interprétation médiane tienne. Ensuite, son post-hoc naturel sous SPSS est la comparaison par paires ajustée selon Dunn-Bonferroni, disponible en double-cliquant sur le résultat pour ouvrir la vue détaillée.

    Le test de Friedman en est l’équivalent lorsque vos groupes ne sont pas indépendants mais correspondent à des mesures répétées sur les mêmes participants.

    Le tableau de décision

    Situation Test global Post-hoc
    Normalité OK, variances homogènes ANOVA classique Tukey
    Normalité OK, variances inégales ANOVA de Welch Games-Howell
    Non-normalité franche, ou variable ordinale Kruskal-Wallis Dunn-Bonferroni
    Petits effectifs et distributions douteuses Kruskal-Wallis Dunn-Bonferroni

    Une nuance utile sur la première colonne : l’ANOVA est robuste à une non-normalité modérée dès que les groupes dépassent une trentaine d’observations, grâce au théorème central limite. Elle l’est en revanche beaucoup moins à l’hétérogénéité des variances quand les effectifs sont déséquilibrés. C’est le pire scénario : petit groupe à forte variance, grand groupe à faible variance. Dans cette configuration, Welch n’est pas une option de confort, il est nécessaire. Notre article sur le test de Shapiro-Wilk détaille le diagnostic de normalité qui alimente la première question.

    Rédiger le résultat

    Welch et Games-Howell : « Le test de Levene indique une hétérogénéité des variances, F(2, 117) = 5,08, p = 0,008. L’ANOVA de Welch, robuste à cette violation, a donc été retenue : elle révèle une différence significative entre les trois filières, F(2 ; 71,42) = 8,94, p < 0,001. Les comparaisons post-hoc de Games-Howell montrent que la filière A diffère significativement de la filière C (p = 0,002) et de la filière B (p = 0,031), tandis que B et C ne diffèrent pas (p = 0,214). »

    Kruskal-Wallis : « La variable dépendante étant ordinale, un test de Kruskal-Wallis a été retenu. Il révèle une différence significative entre les trois groupes, H(2) = 12,47, p = 0,002, ε² = 0,10. Les comparaisons par paires ajustées selon Dunn-Bonferroni situent la différence entre les groupes 1 et 3 (p = 0,004). »

    Notez encore les degrés de liberté décimaux de Welch — F(2 ; 71,42) — qui sont la signature de la correction, exactement comme pour les corrections de sphéricité.

    L’erreur qui reste la plus fréquente

    Elle consiste à lancer l’ANOVA classique, constater que Levene est significatif, et rapporter quand même le F de l’ANOVA classique en ajoutant une phrase du type « le test de Levene était significatif, ce qui constitue une limite de cette étude ».

    Ce n’est pas une limite : c’est une correction disponible en une case à cocher, dans le même menu, sans aucun coût. Un jury qui connaît SPSS le sait, et la phrase se retourne contre vous. La bonne conduite tient en trois secondes de clic et une phrase de méthode. Sur la lecture du seuil lui-même, voyez notre article sur la p-value et le seuil de significativité, et sur les plans à plusieurs facteurs, le guide de l’ANOVA factorielle.

    Mettre cette décision par écrit

    Une bifurcation méthodologique n’a de valeur que si elle est annoncée avant et justifiée après. Cela suppose que votre chapitre méthodologie contienne déjà la règle que vous appliquerez, et que votre chapitre résultats l’exécute sans contradiction.

    Tesify vous aide à tenir cette continuité : structurer la méthodologie, y inscrire vos règles de décision, et rédiger les passages de justification en gardant le même vocabulaire d’un bout à l’autre du mémoire. Vos analyses restent les vôtres, et le texte est écrit à 100 % par vous.

    Structurer votre méthodologie avec Tesify

    Questions fréquentes

    Le test de Levene est significatif : dois-je passer au non paramétrique ?

    Non, pas automatiquement. Levene teste l’égalité des variances, pas la normalité. La réponse adaptée est l’ANOVA de Welch, qui reste un test paramétrique sur les moyennes tout en corrigeant l’hétérogénéité. Kruskal-Wallis répond à un problème différent et vous fait perdre de la puissance si vous l’utilisez pour celui-ci.

    Où trouver l’ANOVA de Welch dans SPSS ?

    Dans Analyse → Comparer les moyennes → ANOVA à un facteur, bouton Options, case Welch. Elle n’existe pas dans Modèle linéaire général → Univarié, ce qui fait croire à beaucoup d’étudiants qu’elle est absente du logiciel. Le tableau produit s’intitule Tests robustes d’égalité des moyennes.

    Pourquoi Games-Howell plutôt que Tukey ?

    Tukey suppose des variances égales et des effectifs comparables ; Games-Howell ne suppose ni l’un ni l’autre. Si vous avez retenu Welch pour le test global, enchaîner sur Tukey est incohérent et produit des seuils erronés. Dans SPSS, Games-Howell se trouve dans le bloc Variances non homogènes de la fenêtre post-hoc, sous le bloc où figure Tukey.

    Kruskal-Wallis compare-t-il les médianes ?

    Pas exactement, et la nuance compte pour votre rédaction. Il compare les rangs moyens. Cela n’équivaut à une comparaison de médianes que si les distributions ont la même forme dans tous les groupes — une condition justement mise en défaut lorsque les variances diffèrent fortement. Formulez donc vos conclusions en termes de différence de distribution, pas de médiane, sauf si vous avez vérifié la similarité des formes.

    Que faire si Levene est significatif mais que les effectifs sont parfaitement équilibrés ?

    L’ANOVA classique est nettement plus robuste à l’hétérogénéité des variances quand les groupes ont des effectifs égaux. Beaucoup d’auteurs admettent alors de la conserver, en particulier si le rapport entre la plus grande et la plus petite variance reste inférieur à 4. Le coût de Welch étant nul, la conduite la plus sûre reste néanmoins de rapporter les deux et de constater qu’elles concordent.

    Faut-il tester Levene avant chaque ANOVA ?

    Oui, et cochez la case dès le départ plutôt que de relancer l’analyse. Sachez toutefois que Levene souffre du même défaut que tous les tests de conditions : il manque de puissance sur les petits échantillons et devient significatif pour un écart trivial sur les grands. Regardez donc aussi le rapport des variances et vos boîtes à moustaches, qui disent souvent plus que la p-value.

  • Données manquantes dans un mémoire : MCAR, MAR, MNAR et que faire (2026)

    Données manquantes dans un mémoire : MCAR, MAR, MNAR et que faire (2026)

    Vous avez recruté 180 répondants. Vous lancez votre régression, et sous le tableau SPSS écrit discrètement : N = 121.

    Cinquante-neuf personnes viennent de disparaître de votre analyse sans que rien ne vous ait prévenu. Vous n’avez perdu aucun questionnaire : vous venez de rencontrer la suppression listwise, le comportement par défaut de SPSS face aux données manquantes.

    C’est le point aveugle le plus coûteux des mémoires quantitatifs, parce qu’il est silencieux : aucun message d’erreur, aucun avertissement, juste un N plus petit en bas d’un tableau que personne ne lit.

    Pourquoi la perte est bien plus grande qu’elle n’en a l’air

    La suppression listwise exclut un participant de l’analyse entière dès qu’il lui manque une seule valeur sur une seule des variables du modèle.

    L’arithmétique est brutale. Imaginez cinq variables, chacune manquant chez seulement 8 % des répondants, et des non-réponses réparties indépendamment. La probabilité qu’un participant soit complet sur les cinq est de 0,92⁵, soit environ 0,66 : un tiers de votre échantillon disparaît alors qu’aucune variable ne dépassait 8 % de manquants.

    C’est ce mécanisme multiplicatif qui explique l’écart entre le N que vous annoncez fièrement en méthodologie et le N réel de vos tests. Et il a deux conséquences distinctes :

    • Une perte de puissance. Votre calcul de taille d’échantillon, si vous en avez fait un avec G*Power, portait sur 180 personnes, pas sur 121. Votre étude est devenue sous-dimensionnée en cours de route.
    • Un risque de biais. Bien plus grave. Si les personnes qui n’ont pas répondu diffèrent systématiquement de celles qui ont répondu, votre échantillon analysé n’est plus représentatif de votre échantillon recruté.
    Effet de la suppression listwise sur la taille de l'échantillon analysé
    Cinq variables à 8 % de manquants chacune suffisent à faire perdre un tiers des participants.

    Les trois mécanismes : MCAR, MAR, MNAR

    La typologie classique distingue trois mécanismes. Ce n’est pas du jargon décoratif : c’est ce qui détermine si votre traitement est acceptable ou non.

    MCAR — manquant complètement au hasard

    Missing Completely At Random. L’absence de réponse ne dépend de rien : ni de la variable elle-même, ni d’aucune autre variable mesurée. Un questionnaire papier dont une page s’est détachée, une panne de serveur pendant une heure, une erreur de saisie aléatoire.

    Conséquence : c’est le cas le plus favorable. La suppression listwise reste non biaisée — vous ne perdez que de la puissance, pas de la validité. C’est aussi le cas le plus rare.

    MAR — manquant au hasard conditionnellement

    Missing At Random, une appellation trompeuse : le manque n’est pas aléatoire, il est explicable par d’autres variables que vous avez mesurées. Exemple typique : les hommes de votre échantillon répondent moins souvent que les femmes à la question sur le revenu. Le manque dépend du sexe — que vous connaissez — et non du revenu lui-même une fois le sexe pris en compte.

    Conséquence : la suppression listwise devient biaisée, puisqu’elle surreprésente les femmes dans l’analyse. Mais la situation est récupérable : puisque le sexe est mesuré, une méthode d’imputation peut exploiter cette information. C’est le cas le plus fréquent en pratique, et celui pour lequel l’imputation multiple a été conçue.

    MNAR — manquant de façon non aléatoire

    Missing Not At Random. L’absence dépend de la valeur manquante elle-même. Les personnes aux revenus les plus élevés refusent de déclarer leur revenu ; les étudiants les plus en difficulté ne répondent pas au questionnaire sur le décrochage ; les patients dont l’état s’est aggravé ne reviennent pas au suivi.

    Conséquence : c’est le cas problématique, et aucune méthode statistique ne le résout, parce que l’information nécessaire n’a jamais été recueillie. La seule conduite honnête est de l’identifier, de l’expliquer, et d’en discuter la direction probable du biais dans vos limites.

    Trois configurations de données manquantes dans une matrice
    Le même pourcentage de cases vides peut relever de trois mécanismes très différents. C’est la configuration, pas le taux, qui décide.

    Comment savoir dans quel cas vous êtes

    On ne peut pas prouver le mécanisme, et il faut le dire ainsi dans le mémoire. On peut néanmoins l’étayer sérieusement en trois étapes, dont deux sont à la portée de tout mémoire de master.

    1. Quantifier. Dressez le pourcentage de manquants par variable, pas seulement pour l’ensemble. Une variable à 22 % et neuf variables à 1 % ne posent pas le même problème, et la première est peut-être simplement une question mal formulée.

    2. Comparer les répondants et les non-répondants. C’est l’analyse la plus utile et la plus négligée. Créez une variable indicatrice (1 = donnée manquante sur X, 0 = présente), puis comparez les deux groupes sur toutes vos autres variables avec des tests t et des khi-deux. Si aucune différence n’apparaît, l’hypothèse MCAR est plausible. Si les non-répondants sont significativement plus jeunes, ou concentrés dans une filière, vous êtes en MAR et vous savez sur quelle variable.

    3. Le test MCAR de Little. Disponible dans Analyse → Analyse des valeurs manquantes (module complémentaire Missing Values, absent de certaines licences universitaires). Un résultat non significatif est compatible avec MCAR. Deux réserves : il ne distingue jamais MAR de MNAR, et comme tout test de condition il perd de la puissance sur petit échantillon.

    Les quatre traitements, et lequel défendre

    Méthode Quand Risque
    Suppression listwise MCAR, et moins de 5 % de manquants Perte de puissance ; biais si MAR
    Suppression pairwise Matrices de corrélations N différent d’une cellule à l’autre ; matrice parfois incohérente
    Imputation par la moyenne À éviter Réduit la variance, affaiblit les corrélations
    Imputation multiple MAR, dès 5-10 % de manquants Plus lourde à décrire, mais c’est la référence

    Pourquoi l’imputation par la moyenne est un mauvais réflexe

    Elle paraît raisonnable et se fait en deux clics, ce qui explique sa popularité. Le problème est mécanique : remplacer trente valeurs manquantes par la moyenne place trente points exactement au centre de la distribution. Vous réduisez artificiellement la variance, donc l’écart-type, donc les erreurs standard — et vous affaiblissez toutes les corrélations impliquant cette variable, puisque trente paires ne portent plus aucune variation. Le biais va vers l’absence d’effet, et un jury attentif le repérera immédiatement. Si vous y recourez malgré tout, limitez-la à un pourcentage très faible et déclarez-le explicitement.

    L’imputation multiple, en pratique

    C’est aujourd’hui la méthode de référence sous hypothèse MAR, et elle est plus accessible qu’on ne le croit. Le principe : plutôt qu’une seule valeur de remplacement, on en génère plusieurs jeux plausibles (typiquement 5 à 20) en exploitant les corrélations avec les autres variables, on analyse chaque jeu séparément, puis on combine les résultats selon des règles qui tiennent compte de l’incertitude liée à l’imputation. C’est exactement ce que l’imputation par la moyenne oublie de faire.

    Sous SPSS : Analyse → Imputation multiple → Imputer les valeurs manquantes. Le logiciel produit un fichier empilé, et toutes les analyses ultérieures affichent automatiquement une ligne Résultats combinés. Comme le module Missing Values, cette procédure n’est pas incluse dans toutes les licences.

    Le cas particulier des items d’échelle

    Si un répondant a rempli 9 items sur 10 d’une échelle validée, le supprimer serait absurde. La pratique admise consiste à calculer son score comme la moyenne des items renseignés, à condition qu’il en ait complété une proportion suffisante — un seuil de 80 % est couramment retenu et facile à justifier.

    Deux précautions. Fixez et annoncez ce seuil avant de regarder vos données. Et vérifiez que les items inversés ont bien été recodés avant tout calcul de moyenne, sans quoi vous imputez du bruit — un point détaillé dans notre guide sur l’échelle de Likert et dans celui sur la construction d’un questionnaire. La cohérence interne se vérifie ensuite comme d’habitude, avec l’alpha de Cronbach.

    Ce que vous écrivez

    Cas simple : « Le taux de données manquantes est faible et n’excède pas 3,2 % pour aucune variable. La comparaison des répondants et des non-répondants ne révèle aucune différence significative sur l’âge, le sexe et la filière. L’hypothèse d’un mécanisme complètement aléatoire étant plausible, la suppression listwise a été retenue ; l’effectif analysé est de 168 sur les 180 recrutés. »

    Cas MAR traité : « La variable revenu présente 14,8 % de valeurs manquantes. Les non-répondants à cette question sont significativement plus âgés que les répondants, t(178) = 2,91, p = 0,004, ce qui oriente vers un mécanisme de type MAR. Une imputation multiple à 20 jeux, incluant l’âge, le sexe et le niveau de diplôme comme variables auxiliaires, a donc été réalisée ; les résultats rapportés sont les estimations combinées. Une analyse de sensibilité sur les cas complets conduit aux mêmes conclusions. »

    Cas MNAR assumé : « Les 22 participants perdus au suivi à trois mois présentaient des scores initiaux significativement plus élevés, ce qui suggère un mécanisme non aléatoire lié à la variable mesurée elle-même. Aucune méthode d’imputation ne permettant de corriger ce type de manque, les résultats du suivi doivent être lus comme portant sur une population dont les cas les plus sévères sont sous-représentés, ce qui conduit vraisemblablement à une sous-estimation de l’effet. »

    Cette dernière phrase est un modèle : elle nomme le mécanisme, reconnaît qu’il est irréparable, et indique la direction du biais. C’est ce dernier point qui distingue une limite bien traitée d’un aveu d’impuissance.

    L’analyse de sensibilité, votre meilleur argument

    Quelle que soit la méthode retenue, la démonstration la plus convaincante tient en une phrase : faites tourner votre analyse principale de deux façons — cas complets d’un côté, données imputées de l’autre — et comparez. Si les conclusions concordent, votre résultat ne dépend pas de votre choix de traitement, et vous venez de le prouver plutôt que de l’affirmer. Si elles divergent, c’est une découverte majeure qui appartient à votre discussion.

    C’est la même logique que pour les valeurs influentes en régression, et elle vaut pour toute décision d’analyse discutable. Sur l’organisation générale de cette étape, voyez notre guide complet de l’analyse de données et celui sur l’analyse quantitative sous SPSS et Excel.

    Écrire la section « traitement des données manquantes »

    Cette section fait dix lignes et elle est presque toujours absente. Elle doit contenir : le taux par variable, l’analyse répondants/non-répondants, le mécanisme retenu et son argument, la méthode de traitement, et l’analyse de sensibilité.

    Tesify vous aide à construire ce passage et à le tenir cohérent avec le reste de votre méthodologie : mêmes termes, mêmes seuils annoncés en amont et respectés en aval, et une justification rédigée à partir de vos propres décisions. Vos données restent les vôtres, et le texte est écrit à 100 % par vous.

    Rédiger votre méthodologie avec Tesify

    Questions fréquentes

    Quel pourcentage de données manquantes est acceptable dans un mémoire ?

    Aucun seuil n’est réglementaire. Un repère très répandu situe en dessous de 5 % par variable un niveau où le choix de traitement change rarement les conclusions. Mais le pourcentage compte moins que le mécanisme : 3 % de manquants concentrés sur les répondants les plus vulnérables est plus dommageable que 15 % répartis au hasard. Rapportez toujours le taux par variable, jamais un taux global qui masque la concentration.

    Puis-je remplacer les valeurs manquantes par la moyenne ?

    Vous le pouvez, mais c’est déconseillé et facilement critiquable. La méthode écrase la variance et affaiblit les corrélations, biaisant vos tests vers l’absence d’effet. Si le taux est vraiment marginal, l’impact restera faible — mais dans ce cas la suppression listwise fait aussi bien et se défend mieux.

    Pourquoi mon N analysé est-il plus petit que mon N recruté ?

    À cause de la suppression listwise, appliquée par défaut : un participant est exclu de toute l’analyse dès qu’il lui manque une valeur sur une variable du modèle. Vérifiez systématiquement le N indiqué sous chaque tableau SPSS, et signalez-le en résultats. Un mémoire qui annonce 180 participants et analyse 121 personnes sans le dire présente une incohérence que le jury relèvera.

    Qu’est-ce que le test de Little ?

    Le test MCAR de Little évalue l’hypothèse d’un mécanisme complètement aléatoire sur l’ensemble des variables simultanément. Un résultat non significatif est compatible avec MCAR — sans le prouver. Il ne distingue jamais MAR de MNAR, et il figure dans le module Missing Values, absent de certaines licences universitaires. En son absence, la comparaison répondants/non-répondants est un substitut parfaitement acceptable en mémoire.

    Faut-il exclure un participant qui a répondu à moins de la moitié du questionnaire ?

    C’est une pratique courante et défendable, à condition de fixer la règle à l’avance et de la documenter. Beaucoup d’études excluent les questionnaires remplis à moins de 50 %, en le mentionnant dans le diagramme de flux des participants. L’essentiel est que le critère soit annoncé en méthodologie et appliqué uniformément, et non décidé après avoir vu quels résultats en découlent.

  • ANOVA à mesures répétées sous SPSS : Mauchly, sphéricité et corrections (2026)

    ANOVA à mesures répétées sous SPSS : Mauchly, sphéricité et corrections (2026)

    Votre design est le plus courant des mémoires expérimentaux : vous mesurez le même groupe à plusieurs reprises. Avant l’intervention, juste après, trois mois plus tard. Ou sur trois conditions que chaque participant a traversées.

    Vous lancez l’ANOVA à mesures répétées sous SPSS, et le logiciel vous rend un tableau que vous n’attendiez pas : Test de sphéricité de Mauchly, avec un p à 0,003. Puis, juste en dessous, un tableau des effets intra-sujets qui vous propose quatre lignes différentes pour le même effet — et quatre valeurs de p.

    La question devient : laquelle est la vôtre ? C’est exactement ce que cet article résout.

    Pourquoi ce test existe, et ce que « sphéricité » veut dire

    Quand vous comparez des groupes indépendants, l’hypothèse à vérifier est l’égalité des variances entre groupes. Quand vous comparez des mesures répétées sur les mêmes individus, la question change de nature : vos mesures ne sont plus indépendantes, puisqu’un participant qui score haut au temps 1 scorera probablement haut au temps 2.

    La sphéricité est la condition qui remplace l’homogénéité des variances dans ce contexte. Elle exige que les variances des différences entre chaque paire de mesures soient égales.

    Prenez trois temps de mesure. Il existe trois différences possibles : T1−T2, T1−T3 et T2−T3. La sphéricité demande que ces trois différences soient aussi dispersées les unes que les autres. Or c’est souvent faux dans un design longitudinal, et pour une raison très intuitive : deux mesures rapprochées dans le temps se ressemblent beaucoup plus que deux mesures éloignées. La variance de T1−T2 est alors petite, celle de T1−T3 nettement plus grande, et la sphéricité tombe.

    Ce que ça change concrètement : si la sphéricité est violée et que vous lisez quand même la ligne non corrigée, votre test F est trop libéral. Il produit des p-values artificiellement basses, et vous risquez de conclure à un effet qui n’existe pas.

    Trajectoires individuelles sur trois temps de mesure
    Chaque participant est sa propre référence. C’est la force du design — et la raison pour laquelle il a sa condition d’application à lui.

    La procédure sous SPSS, étape par étape

    Premier obstacle : le format des données. En mesures répétées, chaque temps de mesure est une colonne séparée, et chaque participant occupe une seule ligne. C’est le format « large ». Si vos données sont empilées en format long — une ligne par mesure — vous devez les restructurer avant toute chose (Données → Restructurer).

    1. Analyse → Modèle linéaire général → Mesures répétées.
    2. Dans la première boîte, nommez votre facteur intra-sujets (par exemple temps) et indiquez son nombre de niveaux (3). Cliquez Ajouter, puis Définir.
    3. Faites correspondre vos colonnes aux niveaux, dans le bon ordre : la variable du temps 1 sur le niveau 1, et ainsi de suite. C’est l’erreur de manipulation la plus fréquente, et elle produit silencieusement des résultats faux.
    4. Bouton Options (ou Moyennes marginales estimées selon votre version) : déplacez votre facteur dans la zone d’affichage des moyennes, cochez Comparer les effets principaux et choisissez l’ajustement Bonferroni. Cochez aussi Statistiques descriptives et Estimations de la taille d’effet.
    5. Bouton Graphiques : placez le facteur en abscisse pour obtenir le profil des moyennes. C’est la figure que vous mettrez dans le mémoire.

    Avant de lancer, un mot sur l’effectif. Un design à mesures répétées est plus puissant qu’un design à groupes indépendants, parce que chaque participant sert de témoin à lui-même et que la variabilité interindividuelle est neutralisée. Vous avez donc besoin de moins de participants — mais « moins » n’est pas « peu ». La procédure G*Power couvre ce cas précis via la famille Repeated measures, within factors, où la corrélation entre mesures est un paramètre d’entrée décisif.

    Lire le tableau de Mauchly

    SPSS produit un tableau Test de sphéricité de Mauchly qui contient deux informations utiles.

    La colonne Sig. C’est le test lui-même. Ici, contrairement à la logique habituelle, un résultat non significatif est la bonne nouvelle : p > 0,05 signifie que la sphéricité est respectée et que vous pouvez lire la ligne non corrigée.

    Les colonnes epsilon. À droite, SPSS affiche Greenhouse-Geisser et Huynh-Feldt. Ce sont des estimations du paramètre epsilon (ε), qui mesure l’ampleur de l’écart à la sphéricité. Un ε de 1 correspond à une sphéricité parfaite ; plus il descend, plus la violation est sévère. Ces valeurs sont plus informatives que le test lui-même, et voici pourquoi.

    Le test de Mauchly a une faiblesse bien documentée : il dépend fortement de l’effectif. Sur un petit échantillon, il manque de puissance et ne détecte pas une violation réelle ; sur un grand échantillon, il devient significatif pour un écart trivial. Ne lui faites donc pas aveuglément confiance. Beaucoup de méthodologues recommandent aujourd’hui d’appliquer systématiquement une correction dès que le facteur compte plus de deux niveaux, sans même consulter Mauchly. C’est une position défendable et facile à justifier devant un jury : la correction n’est pénalisante que si la sphéricité était respectée, auquel cas ε vaut environ 1 et la correction ne change presque rien.

    Correction appliquée aux degrés de liberté lorsque la sphéricité est violée
    La correction ne touche pas au F. Elle resserre les degrés de liberté, ce qui rend le test plus exigeant.

    Greenhouse-Geisser ou Huynh-Feldt : la règle de décision

    Le tableau Tests des effets intra-sujets vous propose quatre lignes : Sphéricité supposée, Greenhouse-Geisser, Huynh-Feldt et Borne inférieure. Le F est identique sur les quatre. Ce qui change, ce sont les degrés de liberté : chaque correction les multiplie par son epsilon, ce qui les réduit et rend le test plus conservateur.

    La règle de décision généralement enseignée s’appuie sur l’epsilon de Greenhouse-Geisser :

    • Mauchly non significatif (p > 0,05) → lisez Sphéricité supposée.
    • Mauchly significatif et ε < 0,75 → la violation est marquée : retenez Greenhouse-Geisser, la correction la plus prudente.
    • Mauchly significatif et ε > 0,75 → la violation est modérée : Huynh-Feldt est moins conservateur et préserve mieux votre puissance statistique.

    La ligne Borne inférieure correspond au scénario le plus défavorable possible ; elle est trop pénalisante pour un usage courant et ne se rapporte pas dans un mémoire.

    Comme pour tout seuil conventionnel, annoncez la règle que vous appliquez dans votre section méthodologie, avant d’avoir vu vos résultats. Choisir la correction après coup en fonction de celle qui rend l’effet significatif est une pratique qui se voit immédiatement.

    Si l’effet est significatif : les comparaisons par paires

    L’ANOVA vous dit qu’au moins deux temps de mesure diffèrent, pas lesquels. C’est le tableau des Comparaisons par paires, produit par l’option Bonferroni cochée plus haut, qui répond. L’ajustement de Bonferroni est indispensable : avec trois temps, vous faites trois comparaisons, et sans correction votre risque d’erreur de première espèce grimpe bien au-delà de 5 %.

    Rapportez aussi l’eta carré partiel (η²p), que l’option de taille d’effet a fait apparaître. Les repères conventionnels pour cet indice sont 0,01 (petit), 0,06 (moyen) et 0,14 (grand).

    Et si la normalité pose aussi problème ?

    La sphéricité n’est pas la seule condition. L’ANOVA à mesures répétées suppose également une distribution normale des variables à chaque niveau du facteur — même si, comme pour toute ANOVA, elle est raisonnablement robuste à des écarts modérés dès que l’effectif dépasse la trentaine. Notre article sur le test de Shapiro-Wilk et l’interprétation de la normalité détaille ce diagnostic.

    Si la non-normalité est franche, ou si votre variable est ordinale, ou si votre effectif est vraiment petit, le repli existe et il est propre : le test de Friedman, équivalent non paramétrique de l’ANOVA à mesures répétées. Vous perdez un peu de puissance et vous ne pouvez plus tester d’interaction, mais le test ne suppose plus ni normalité ni sphéricité. Pour deux mesures seulement, l’équivalent est le test de Wilcoxon pour échantillons appariés.

    Rédiger le résultat dans le mémoire

    Sphéricité respectée : « Le test de sphéricité de Mauchly n’est pas significatif, χ²(2) = 2,41, p = 0,300 ; l’hypothèse de sphéricité est donc retenue. L’ANOVA à mesures répétées révèle un effet significatif du temps sur le score d’anxiété, F(2, 88) = 14,62, p < 0,001, η²p = 0,25. »

    Sphéricité violée, correction appliquée : « Le test de Mauchly indique une violation de l’hypothèse de sphéricité, χ²(2) = 11,84, p = 0,003 ; l’epsilon de Greenhouse-Geisser étant de 0,81, la correction de Huynh-Feldt a été appliquée conformément à la règle annoncée. L’effet du temps demeure significatif, F(1,74 ; 76,56) = 9,31, p < 0,001, η²p = 0,17. »

    Comparaisons par paires : « Les comparaisons par paires ajustées selon Bonferroni montrent une baisse significative entre T1 et T2 (différence moyenne = 4,12 ; p < 0,001) et entre T1 et T3 (différence moyenne = 5,08 ; p < 0,001), tandis que l’écart entre T2 et T3 n’atteint pas le seuil (p = 0,214). L’effet apparaît donc immédiatement après l’intervention et se maintient à trois mois sans progression supplémentaire. »

    Remarquez les degrés de liberté décimaux dans le deuxième exemple : F(1,74 ; 76,56). Ce ne sont pas des coquilles. Ce sont les degrés de liberté d’origine (2 et 88) multipliés par epsilon, et leur présence est précisément ce qui prouve à votre lecteur que la correction a bien été appliquée.

    Les erreurs qui coûtent cher

    • Lire la ligne « Sphéricité supposée » sans regarder Mauchly. L’erreur la plus fréquente, et elle gonfle votre taux de faux positifs.
    • Assigner les colonnes dans le désordre lors de la définition des niveaux. SPSS ne proteste pas ; les résultats sont simplement faux.
    • Traiter un design à mesures répétées comme des groupes indépendants. Comparer T1 et T2 avec un test t pour échantillons indépendants jette l’appariement à la poubelle et ruine la puissance du design. Sur le choix du plan lui-même, voyez notre guide du design expérimental.
    • Oublier l’ajustement des comparaisons multiples. Trois tests t successifs sans correction, ce n’est plus un test à 5 %.
    • Ignorer l’attrition. SPSS exclut par défaut tout participant ayant une donnée manquante à un seul temps de mesure. Un participant absent au suivi disparaît entièrement de l’analyse — vérifiez votre N effectif dans le tableau des descriptives, il est souvent plus bas que vous ne le croyez.

    Transformer ces sorties en chapitre résultats

    L’analyse prend dix minutes. Ce qui prend des jours, c’est d’en faire un texte : annoncer la règle de décision en méthodologie, la respecter en résultats, articuler l’effet principal avec les comparaisons par paires, et discuter ce que le maintien à trois mois signifie pour votre question de recherche.

    Tesify travaille avec vous sur cette partie-là : organiser le chapitre, tenir une terminologie constante d’un bout à l’autre du mémoire, et rédiger les passages de justification à partir de vos propres choix d’analyse. Vos données restent les vôtres, et le texte est écrit à 100 % par vous.

    Rédiger votre chapitre résultats avec Tesify

    Questions fréquentes

    Mon test de Mauchly est significatif : mon analyse est-elle invalide ?

    Non, pas du tout. Une sphéricité violée ne remet pas en cause votre design ni votre analyse : elle vous impose seulement de lire une ligne corrigée plutôt que la ligne Sphéricité supposée. SPSS a déjà calculé ces corrections dans le même tableau. C’est une bifurcation de lecture, pas un échec.

    Greenhouse-Geisser ou Huynh-Feldt : lequel choisir ?

    La règle usuelle s’appuie sur l’epsilon de Greenhouse-Geisser : en dessous de 0,75, retenez Greenhouse-Geisser, plus conservateur ; au-dessus, Huynh-Feldt préserve mieux votre puissance. Si vous préférez une position simple et défendable, appliquez systématiquement Greenhouse-Geisser dès que le facteur a plus de deux niveaux : vous ne serez jamais critiqué pour excès de prudence.

    Pourquoi SPSS n’affiche-t-il aucun test de Mauchly ?

    Parce que votre facteur intra-sujets n’a que deux niveaux. Avec deux mesures, il n’existe qu’une seule différence possible, donc une seule variance de différence, et la sphéricité est vérifiée par construction. Aucune correction n’a de sens, et SPSS le signale d’ailleurs par une note sous le tableau.

    Puis-je écrire des degrés de liberté décimaux ?

    Oui, et c’est même le signe d’un résultat correctement corrigé. La correction multiplie les degrés de liberté par epsilon, ce qui donne des valeurs non entières comme F(1,62 ; 71,28). Rapportez-les telles quelles, arrondies à deux décimales, avec la virgule décimale française et un point-virgule pour séparer les deux degrés de liberté.

    Quelle différence avec une ANOVA factorielle classique ?

    La différence tient à l’indépendance des observations. L’ANOVA factorielle compare des groupes distincts de participants ; l’ANOVA à mesures répétées compare des mesures prises sur les mêmes participants. Les deux se combinent d’ailleurs très bien dans un plan mixte — un facteur inter-sujets (groupe témoin contre groupe expérimental) croisé avec un facteur intra-sujets (avant contre après) —, qui est le plan d’évaluation d’intervention le plus courant en mémoire.

  • Quelle taille d’effet rapporter selon votre test statistique ? (2026)

    Quelle taille d’effet rapporter selon votre test statistique ? (2026)

    « Il faudra ajouter la taille d’effet. » C’est l’une des remarques les plus fréquentes en pré-soutenance, et l’une des plus déroutantes — parce que SPSS n’affiche pas d’indice de taille d’effet pour la moitié des tests, et parce que chaque test a le sien.

    Cet article est un tableau d’orientation : pour chaque test que vous êtes susceptible d’avoir utilisé, quel indice rapporter, où le trouver, comment le calculer quand le logiciel ne le donne pas, et comment l’interpréter.

    Pourquoi la p-value ne suffit pas

    La p-value répond à une seule question : l’effet observé est-il compatible avec le hasard ? Elle ne dit rien de son ampleur. Et elle a une propriété qui la disqualifie comme mesure d’importance : elle dépend directement de la taille de votre échantillon.

    Un écart minuscule et sans intérêt pratique devient significatif si vous interrogez 5 000 personnes. Le même écart, sur 40 personnes, ne le sera pas. La p-value mélange donc deux informations — l’ampleur de l’effet et la taille de l’échantillon — sans permettre de les séparer.

    La taille d’effet isole la première. C’est une mesure standardisée de l’ampleur, indépendante de l’effectif. Elle répond à la question que votre lecteur se pose vraiment : non pas « y a-t-il un effet ? » mais « à quel point ? ». Sur la lecture du seuil de significativité lui-même, voyez notre article sur le seuil de significativité et la p-value dans un mémoire.

    C’est aussi ce qui rend votre travail cumulable : une taille d’effet peut être comparée à celles de la littérature de votre domaine, et c’est la matière première de toute méta-analyse.

    Deux distributions peu recouvrantes et deux distributions très recouvrantes
    La taille d’effet, intuitivement : à quel point les deux groupes se recouvrent-ils ? Le d de Cohen est une mesure directe de cet écart.

    Le tableau d’orientation

    Deux grandes familles. Les indices de différence standardisée (le d de Cohen et ses variantes) expriment un écart en nombre d’écarts-types. Les indices de variance expliquée (η², R²) expriment une proportion de la variation totale. Un même résultat peut souvent se dire dans les deux langues ; choisissez celle qui a cours dans votre discipline.

    Votre test Indice à rapporter Dans SPSS ?
    Test t (deux groupes indépendants) d de Cohen Oui, versions récentes
    Test t apparié d de Cohen (pour échantillons appariés) Oui, versions récentes
    Mann-Whitney r = Z / √N Non — à calculer
    Wilcoxon apparié r = Z / √N Non — à calculer
    ANOVA (tous plans) η² partiel (eta carré partiel) Oui, via Options
    Kruskal-Wallis epsilon carré ou eta carré des rangs Non — à calculer
    Khi-deux d’indépendance V de Cramér (ou phi en tableau 2×2) Oui, via Statistiques
    Corrélation r lui-même est la taille d’effet Oui, c’est le résultat
    Régression linéaire R² ajusté, et β par prédicteur Oui
    Régression logistique Odds ratio (Exp(B)) Oui

    Les seuils d’interprétation, et leur mode d’emploi

    Les repères conventionnels, tous issus des travaux de Cohen :

    Indice Petit Moyen Grand
    d de Cohen 0,20 0,50 0,80
    r (corrélation ou non paramétrique) 0,10 0,30 0,50
    η² partiel 0,01 0,06 0,14
    V de Cramér (ddl = 1) 0,10 0,30 0,50

    Un avertissement qui vaut mieux qu’un tableau. Cohen lui-même présentait ces valeurs comme des repères pour un chercheur dépourvu de tout point de comparaison, et non comme des catégories absolues. Leur usage mécanique est aujourd’hui largement critiqué, pour une raison simple : ce qui compte comme un « grand » effet dépend entièrement du domaine. En psychologie sociale, un d de 0,4 est substantiel ; en pharmacologie, il serait décevant. Un effet de 0,15 sur la réussite scolaire d’une cohorte entière peut avoir plus de portée qu’un effet de 0,8 en laboratoire.

    La bonne pratique en mémoire : citez le repère conventionnel, puis situez votre résultat par rapport à ce que rapporte la littérature de votre domaine. C’est cette deuxième phrase qui vaut des points.

    Notez aussi que le V de Cramér a des seuils qui varient avec le nombre de degrés de liberté du tableau : ceux du tableau ci-dessus valent pour ddl = 1. Pour ddl = 2, les repères descendent à environ 0,07 / 0,21 / 0,35.

    Tableau d'orientation associant chaque test statistique à sa mesure de taille d'effet
    Un test, un indice. La règle est mécanique une fois qu’on la connaît.

    Quand SPSS ne calcule rien : les formules de secours

    Après un Mann-Whitney ou un Wilcoxon

    C’est le cas le plus fréquent, et la remarque de jury la plus fréquente aussi. SPSS ne fournit aucune taille d’effet pour les tests non paramétriques, mais la formule est immédiate :

    r = Z / √N

    Le Z se trouve dans le tableau des statistiques du test (colonne Z). Le N est l’effectif total des deux groupes réunis — pas la taille d’un groupe, c’est l’erreur classique. Pour un Wilcoxon apparié, N est le nombre total d’observations, soit deux fois le nombre de paires.

    Exemple : Z = −2,84 avec 60 participants au total donne r = 2,84 / √60 = 2,84 / 7,75 = 0,37, soit un effet moyen. Le signe de Z ne se reporte pas ; on utilise la valeur absolue.

    À partir d’un test t

    Si votre version de SPSS n’affiche pas le d : d = 2t / √ddl pour deux groupes indépendants d’effectifs proches. Vous pouvez aussi le calculer directement comme la différence des moyennes divisée par l’écart-type combiné, que les statistiques descriptives vous donnent.

    Après un khi-deux

    Le V de Cramér s’obtient sans formule : dans Analyse → Statistiques descriptives → Tableaux croisés, bouton Statistiques, cochez Phi et V de Cramér. Il apparaît dans un tableau Mesures symétriques.

    Après un Kruskal-Wallis

    ε² = H / ((N² − 1) / (N + 1)), où H est la statistique du test et N l’effectif total. Une approximation très répandue et acceptable en mémoire consiste à rapporter η² = (H − k + 1) / (N − k), k étant le nombre de groupes.

    Où l’écrire, et comment

    La taille d’effet se rapporte immédiatement après le test, dans la même parenthèse, jamais dans une section séparée.

    • Test t : « Les étudiants du groupe accompagné obtiennent des scores supérieurs à ceux du groupe témoin, t(78) = 3,42, p < 0,001, d = 0,77 — un effet de taille proche du seuil conventionnel du grand effet. »
    • Mann-Whitney : « La différence est significative, U = 312,5, Z = −2,84, p = 0,004, r = 0,37, ce qui correspond à un effet de taille moyenne. »
    • ANOVA : « L’effet du temps est significatif, F(2, 88) = 14,62, p < 0,001, η²p = 0,25 : le facteur temps rend compte de 25 % de la variance intra-sujets. »
    • Khi-deux : « L’association entre la filière et le recours au tutorat est significative, χ²(3) = 18,74, p < 0,001, V de Cramér = 0,24, soit une association faible à modérée. »
    • Corrélation : « Les deux variables sont modérément corrélées, r(118) = 0,34, p < 0,001 ; le coefficient de détermination indique une variance partagée de 12 %. »

    Trois conventions de forme à respecter en français : la virgule décimale (d = 0,77 et non 0.77), l’italique pour les symboles statistiques latins (t, d, r, p, F) mais pas pour les lettres grecques (η, χ), et l’usage de deux décimales sauf pour les p très petits, qu’on écrit p < 0,001.

    L’erreur à ne pas commettre

    Elle consiste à traiter la taille d’effet comme une décoration : la calculer, la coller entre parenthèses, et ne plus jamais en parler. Or c’est elle qui doit structurer votre discussion.

    Un d de 0,15 significatif sur 800 participants et un d de 0,72 non significatif sur 22 participants sont deux résultats radicalement différents, et aucun des deux ne se résume par « significatif » ou « non significatif ». Le premier est un effet réel mais probablement sans portée pratique. Le second est un effet possiblement important que votre étude n’avait pas la puissance de détecter — un cas où la taille d’effet ne vous sauve pas seulement, elle vous fournit l’argument central de votre section limites, et le paramètre d’entrée d’un calcul de puissance pour une recherche future. Notre article sur le calcul de taille d’échantillon avec G*Power montre comment cette boucle se referme : la taille d’effet attendue est justement ce qu’on entre au départ.

    Et pensez à l’intervalle de confiance : rapporté autour de la taille d’effet, il indique la précision de votre estimation et permet de voir immédiatement si un effet nul reste plausible.

    Rédiger vos résultats sans laisser passer ces oublis

    Le vrai risque, en fin de mémoire, n’est pas de mal calculer un indice : c’est d’en oublier un sur cinq tests, d’écrire un point décimal ici et une virgule là, et de ne pas relier la taille d’effet à la discussion.

    Tesify vous aide à tenir cette cohérence : structurer le chapitre résultats, uniformiser la présentation de chaque test, et articuler ampleur des effets et interprétation d’un chapitre à l’autre. Vos analyses restent les vôtres, et le texte est écrit à 100 % par vous.

    Rédiger votre chapitre résultats avec Tesify

    Questions fréquentes

    La taille d’effet est-elle obligatoire dans un mémoire ?

    Aucun règlement d’université ne l’impose, mais les normes de rédaction scientifique dominantes — l’APA en tête — la considèrent comme attendue, et la quasi-totalité des revues l’exigent. Un jury qui maîtrise la méthode la demandera. Le coût est faible, l’omission se remarque : rapportez-la pour chaque test inférentiel que vous commentez.

    Mon effet est significatif mais la taille d’effet est petite : que dire ?

    Dites-le exactement ainsi : l’effet existe, son ampleur est modeste. C’est la situation typique d’un grand échantillon. Loin d’affaiblir votre mémoire, cette lucidité le renforce — à condition que votre discussion porte alors sur la portée pratique du résultat plutôt que sur sa seule existence statistique.

    Peut-on rapporter une taille d’effet quand le test n’est pas significatif ?

    Oui, et c’est vivement recommandé. Une taille d’effet moyenne assortie d’un test non significatif suggère un manque de puissance plutôt qu’une absence d’effet. C’est une information précieuse pour votre section limites et pour toute recherche ultérieure, et elle transforme un « résultat négatif » en contribution utile.

    Faut-il utiliser eta carré ou eta carré partiel ?

    SPSS affiche l’eta carré partiel : nommez-le explicitement comme tel (η²p), car les deux indices ne coïncident qu’en présence d’un seul facteur. Attention à un piège fréquent dans les plans à plusieurs facteurs : les eta carrés partiels ne s’additionnent pas à 100 %, chacun étant calculé en écartant la variance attribuée aux autres facteurs. Notre guide de l’ANOVA factorielle revient sur cette lecture.

    Le d de Cohen peut-il dépasser 1 ?

    Oui, sans aucun problème. Le d n’est pas borné : il exprime un écart en nombre d’écarts-types, et un d de 1,4 signifie simplement que les moyennes des deux groupes sont distantes de 1,4 écart-type. Les valeurs très élevées doivent néanmoins vous faire vérifier deux choses : la présence de valeurs extrêmes, et le fait que vous n’avez pas comparé deux groupes constitués justement sur la base de la variable mesurée.

    Quelle taille d’effet pour un test t apparié ?

    Le d de Cohen reste l’indice, mais son calcul diffère : il repose sur la moyenne et l’écart-type des différences, pas sur l’écart-type combiné des deux mesures. Précisez toujours dans le mémoire quelle version vous rapportez, car les deux peuvent différer sensiblement selon la corrélation entre vos mesures. Le guide du test t et de Mann-Whitney détaille le cas des groupes indépendants.

  • Régression linéaire multiple sous SPSS : la procédure et les 5 hypothèses (2026)

    Régression linéaire multiple sous SPSS : la procédure et les 5 hypothèses (2026)

    Vous avez saisi vos données, lancé Analyse → Régression → Linéaire, et SPSS vous a rendu quatre tableaux. Le R² s’affiche, quelques coefficients sont significatifs, et une question vous arrête net : est-ce que j’ai le droit d’interpréter ça ?

    C’est la bonne question, et c’est celle que la plupart des mémoires escamotent. La régression linéaire multiple est le modèle le plus utilisé dans les mémoires quantitatifs de gestion, de psychologie, de sciences de l’éducation et de santé publique — et c’est aussi celui dont les conditions d’application sont le plus souvent passées sous silence. Un jury qui connaît la méthode ouvre presque toujours la discussion par là.

    Cet article suit l’ordre réel du travail : la procédure sous SPSS d’abord, puis les cinq hypothèses, chacune avec son diagnostic, son seuil et, surtout, ce que vous faites quand elle n’est pas vérifiée.

    Nuage de points avec droite de régression et résidus représentés
    La régression ajuste une droite ; les résidus sont ce qui reste. Presque tous les diagnostics portent sur eux, pas sur vos variables brutes.

    À quoi sert exactement une régression linéaire multiple

    Elle répond à une question précise : quelle part de la variation d’une variable dépendante continue est expliquée par plusieurs variables indépendantes prises ensemble, et quelle est la contribution propre de chacune ?

    Le mot important est propre. L’intérêt de la régression multiple par rapport à une série de corrélations simples est qu’elle estime l’effet de chaque prédicteur à niveau constant des autres. C’est ce qui vous permet d’écrire qu’un effet subsiste « après contrôle de l’ancienneté et du niveau de diplôme ».

    Trois conditions de cadrage, avant même les hypothèses statistiques :

    • La variable dépendante doit être continue. Si elle est binaire (réussite/échec, départ/maintien), ce n’est pas ce modèle : voyez la régression logistique binaire et l’interprétation des odds ratios.
    • Les prédicteurs peuvent être continus ou catégoriels, mais un prédicteur catégoriel à plus de deux modalités doit être transformé en variables indicatrices (0/1), avec une modalité de référence que vous choisissez et que vous nommez explicitement dans le mémoire.
    • Il vous faut assez de participants. La référence la plus citée reste Green (1991), Multivariate Behavioral Research, 26(3), 499-510 : environ N ≥ 50 + 8m pour tester le R² global et N ≥ 104 + m pour tester des coefficients individuels, m étant le nombre de prédicteurs. Avec 4 prédicteurs, cela donne 82 et 108. Ce sont des règles empiriques ; un calcul de puissance formel reste préférable, et le site détaille la procédure G*Power pas à pas.

    La procédure sous SPSS, étape par étape

    Le chemin est court, mais deux boîtes de dialogue décident de tout ce que vous pourrez diagnostiquer ensuite. Ne les sautez pas.

    1. Analyse → Régression → Linéaire.
    2. Glissez votre variable dépendante dans Variable dépendante, et l’ensemble de vos prédicteurs dans Variables indépendantes.
    3. Laissez la méthode sur Entrée (Enter). Les méthodes pas à pas (Forward, Backward, Stepwise) laissent l’algorithme choisir vos variables à votre place ; en mémoire, elles sont très critiquées parce qu’elles capitalisent sur le hasard de votre échantillon. Si vos hypothèses sont théoriquement fondées, elles entrent toutes.
    4. Bouton Statistiques : cochez Estimations, Ajustement du modèle, Intervalles de confiance, Diagnostics de colinéarité, et Durbin-Watson dans le cadre Résidus. Les deux dernières cases sont précisément celles qui manquent dans la plupart des mémoires.
    5. Bouton Graphiques : placez *ZRESID en ordonnée et *ZPRED en abscisse, et cochez Diagramme Q-Q ou Histogramme. Ce nuage unique sert à deux diagnostics à la fois.
    6. Bouton Enregistrer : cochez Distance de Cook et Valeurs influentes. SPSS créera de nouvelles colonnes dans votre fichier.

    Vous obtenez alors quatre tableaux : Récapitulatif des modèles (R, R², R² ajusté, Durbin-Watson), ANOVA (le test global du modèle), Coefficients (les B, bêtas, t, p, IC et VIF), et les Diagnostics par observation.

    Lire les trois chiffres qui comptent

    Le tableau ANOVA teste une seule chose : votre modèle fait-il mieux que la moyenne ? Si p > 0,05, le modèle dans son ensemble n’explique rien de significatif, et commenter des coefficients individuels n’a plus de sens.

    Le R² ajusté est la valeur à rapporter en régression multiple, pas le R² brut : le R² augmente mécaniquement à chaque prédicteur ajouté, même inutile ; le R² ajusté pénalise cet ajout. Un écart important entre les deux signale que vous avez trop de prédicteurs pour votre effectif.

    Dans le tableau des coefficients, le B non standardisé s’interprète dans l’unité de la variable (« une année d’ancienneté supplémentaire est associée à +0,34 point de satisfaction »), tandis que le bêta standardisé permet de comparer l’importance relative des prédicteurs entre eux. Rapportez les deux, et l’intervalle de confiance à 95 % du B : un IC qui contient zéro dit la même chose qu’un p > 0,05, mais il dit en plus quelle est la précision de votre estimation. Sur la lecture du seuil lui-même, voyez notre article sur le seuil de significativité et la p-value dans un mémoire.

    Liste de vérification des cinq hypothèses de la régression linéaire
    Cinq conditions, cinq diagnostics, cinq plans de repli. Aucune n’oblige à abandonner le modèle.

    Les cinq hypothèses, et le plan de repli de chacune

    Voici le point que presque aucun tutoriel ne traite honnêtement. Une hypothèse violée n’est pas la fin de votre mémoire : c’est une bifurcation méthodologique que vous documentez. Un jury sanctionne beaucoup plus sévèrement une condition non testée qu’une condition non respectée et assumée.

    1. Linéarité de la relation

    Diagnostic : le nuage *ZRESID × *ZPRED. Les points doivent former un nuage informe autour de l’horizontale zéro. Une courbe nette (en U, en cloche) signale que la relation n’est pas linéaire.

    Si elle échoue : ajoutez un terme quadratique (le carré du prédicteur concerné), transformez la variable (logarithme si la relation s’aplatit aux valeurs hautes), ou découpez le prédicteur en classes et traitez-le comme catégoriel. La solution la plus honnête en mémoire de master est souvent la troisième : elle se justifie et s’explique simplement.

    2. Indépendance des résidus

    Diagnostic : la statistique de Durbin-Watson, dans le tableau récapitulatif. Elle varie de 0 à 4 ; une valeur proche de 2 indique l’absence d’autocorrélation, et la fourchette conventionnellement admise est d’environ 1,5 à 2,5.

    Si elle échoue : l’autocorrélation apparaît surtout avec des données recueillies dans le temps ou par grappes (plusieurs mesures d’un même individu, plusieurs élèves d’une même classe). Ce n’est pas un défaut à corriger par un bricolage : c’est le signe que la structure de vos données est hiérarchique, et le modèle adapté est un modèle multiniveau ou une ANOVA à mesures répétées. Si l’ampleur est faible, mentionnez-la en limite.

    3. Homoscédasticité (variance constante des résidus)

    Diagnostic : le même nuage *ZRESID × *ZPRED. La dispersion verticale doit rester à peu près constante de gauche à droite. Une forme d’entonnoir — les résidus s’écartent quand les valeurs prédites augmentent — indique l’hétéroscédasticité.

    Si elle échoue : deux voies. Transformer la variable dépendante (le logarithme resserre efficacement une variable très étalée à droite, ce qui est typique des revenus, des durées ou des montants). Ou conserver le modèle et rapporter des erreurs standard robustes à l’hétéroscédasticité, disponibles dans SPSS via la procédure de régression du menu Modèles linéaires généralisés ou via une macro. Les coefficients ne changent pas, seuls leurs tests deviennent valides.

    4. Normalité des résidus

    Diagnostic : le diagramme Q-Q des résidus standardisés. Attention à l’erreur la plus fréquente : l’hypothèse porte sur les résidus, pas sur vos variables brutes. Tester la normalité de la variable dépendante elle-même ne renseigne pas sur la validité du modèle. Notre article sur le test de Shapiro-Wilk et l’interprétation de la normalité détaille la lecture du test et du Q-Q plot.

    Si elle échoue : c’est l’hypothèse la moins inquiétante. Au-delà d’une centaine d’observations, le théorème central limite rend les tests de régression très robustes à une non-normalité modérée. Un Q-Q plot qui s’écarte franchement aux extrémités renvoie généralement à un problème de valeurs extrêmes (point 5) plutôt qu’à la distribution elle-même. Le repli formel existe néanmoins : un bootstrap des intervalles de confiance, disponible dans SPSS via le bouton Bootstrap de la boîte de dialogue, produit des IC qui ne supposent aucune forme de distribution.

    5. Absence de multicolinéarité

    Diagnostic : les colonnes Tolérance et VIF du tableau des coefficients — celles que la case Diagnostics de colinéarité a fait apparaître. Les seuils conventionnels : VIF supérieur à 10 (soit une tolérance inférieure à 0,10) signale une multicolinéarité sévère, et beaucoup d’auteurs alertent dès VIF supérieur à 5.

    Si elle échoue : deux de vos prédicteurs mesurent largement la même chose. Le symptôme typique est un modèle globalement très significatif dont aucun coefficient ne l’est individuellement, avec parfois un signe inversé par rapport à la corrélation simple. Les issues : retirer l’un des deux prédicteurs redondants en justifiant théoriquement lequel, ou les combiner en un score composite unique. Cette hypothèse est celle qui produit les erreurs d’interprétation les plus graves en mémoire, et nous lui consacrons un article entier.

    Et les valeurs influentes

    Ce n’est pas une hypothèse à proprement parler, mais le diagnostic va de pair. Ouvrez la colonne Distance de Cook que SPSS a enregistrée : une valeur supérieure à 1 signale une observation qui, à elle seule, déplace sensiblement vos coefficients. La règle de conduite est simple et vaut mieux que n’importe quelle suppression silencieuse : faites tourner le modèle avec et sans cette observation, et rapportez les deux résultats. Si les conclusions ne changent pas, votre résultat est robuste et vous venez de le prouver. Si elles changent, c’est une limite majeure que vous devez discuter.

    Rédiger les résultats dans le mémoire

    La section résultats d’une régression tient en trois mouvements : le contrôle des conditions, le modèle global, les coefficients.

    Modèle de phrase — les conditions : « Les conditions d’application de la régression ont été vérifiées. L’examen du nuage des résidus standardisés en fonction des valeurs prédites n’a pas révélé de structure curviligne ni d’hétéroscédasticité. La statistique de Durbin-Watson (1,92) indique l’absence d’autocorrélation. Les facteurs d’inflation de la variance sont tous inférieurs à 2, écartant un problème de multicolinéarité. Deux observations présentaient une distance de Cook supérieure à 1 ; le modèle a été réestimé sans elles et les conclusions demeurent inchangées. »

    Modèle de phrase — le modèle global : « Le modèle est significatif, F(4, 145) = 12,74, p < 0,001, et explique 24 % de la variance de la satisfaction au travail (R² ajusté = 0,24). »

    Modèle de phrase — un coefficient : « Le soutien perçu du supérieur est le prédicteur le plus fort (β = 0,38 ; B = 0,52 ; IC 95 % [0,31 ; 0,73] ; t = 4,86 ; p < 0,001) : à niveau constant des autres variables, une augmentation d’un point du soutien perçu est associée à une hausse de 0,52 point de satisfaction. »

    Notez la formulation : est associé à, jamais cause. Une régression sur données transversales n’établit pas de causalité, quelle que soit la qualité du modèle, et c’est une phrase que les jurys attendent explicitement en discussion.

    Les erreurs qui reviennent le plus souvent

    • Tester la normalité des variables au lieu des résidus. L’erreur numéro un, et elle conduit à abandonner un modèle parfaitement valide.
    • Empiler les prédicteurs. Chaque variable ajoutée consomme un degré de liberté et augmente le risque de multicolinéarité. Un modèle de mémoire avec 4 à 6 prédicteurs bien choisis vaut mieux qu’un modèle à 15.
    • Utiliser une méthode pas à pas puis présenter le résultat comme une confirmation d’hypothèse. C’est de l’exploration présentée comme de la confirmation.
    • Ne rapporter que le R². Sans les conditions et sans les intervalles de confiance, le lecteur ne peut pas évaluer votre résultat.
    • Supprimer les valeurs aberrantes sans le dire. Toute suppression se justifie et se documente ; sinon, c’est un choix invisible qui fabrique le résultat.

    Écrire tout cela proprement, sans y passer trois semaines

    Le vrai coût de cette partie du mémoire n’est pas le calcul — SPSS le fait en trois secondes. C’est la rédaction : formuler chaque diagnostic, justifier chaque choix, transformer une sortie logicielle en prose scientifique cohérente avec le reste de votre méthodologie, et le faire dans une langue académique qui tienne debout du début à la fin.

    Tesify vous accompagne exactement à cet endroit : structurer votre chapitre méthodologie et votre chapitre résultats, garder une terminologie constante d’un chapitre à l’autre, et rédiger les passages de justification à partir de vos propres décisions d’analyse. Vos données restent les vôtres, vos résultats restent les vôtres, et le texte reste écrit à 100 % par vous.

    Commencer la rédaction de votre mémoire avec Tesify

    Questions fréquentes

    Combien de prédicteurs puis-je mettre dans une régression pour un mémoire de master ?

    Cela dépend de votre effectif avant tout. En appliquant la règle de Green (1991), un échantillon de 120 participants supporte confortablement 4 à 6 prédicteurs pour tester des coefficients individuels. Au-delà, vous perdez en puissance et vous augmentez le risque de multicolinéarité. Le critère décisif n’est pas le nombre maximal possible mais la justification théorique : chaque prédicteur doit répondre à une hypothèse formulée dans votre revue de littérature.

    Mon R² ajusté est de 0,15 : mon modèle est-il mauvais ?

    Non, pas nécessairement. Un R² de 0,15 signifie que vos variables expliquent 15 % de la variance — ce qui est courant, et souvent bon, en sciences humaines et sociales où les comportements dépendent d’une multitude de facteurs non mesurés. Un R² de 0,15 avec des coefficients théoriquement cohérents et significatifs vaut mieux qu’un R² de 0,60 obtenu par accumulation de prédicteurs redondants. Discutez la valeur au regard de ce que rapporte la littérature de votre domaine, pas dans l’absolu.

    Faut-il centrer ou standardiser mes variables avant la régression ?

    Ce n’est pas nécessaire pour une régression simple à effets principaux : SPSS fournit déjà les bêtas standardisés. Le centrage devient utile lorsque vous introduisez un terme d’interaction entre deux variables continues, car il réduit la colinéarité artificielle entre les prédicteurs et leur produit, et il rend l’interprétation des effets principaux beaucoup plus lisible.

    Puis-je utiliser une variable mesurée par une échelle de Likert comme variable dépendante ?

    Un item unique de Likert est ordinal et se prête mal à une régression linéaire. En revanche, un score composite — la moyenne de plusieurs items d’une même dimension, dont vous avez vérifié la cohérence interne — est très largement traité comme continu dans la pratique de recherche. La conception et l’analyse de ces échelles sont détaillées dans notre guide sur l’échelle de Likert dans un mémoire.

    Quelle est la différence entre une régression multiple et une ANOVA factorielle ?

    Mathématiquement, ce sont deux cas particuliers du même modèle linéaire général. La différence est pratique : l’ANOVA factorielle est adaptée à des prédicteurs catégoriels et se concentre sur les effets d’interaction entre groupes, tandis que la régression multiple est adaptée à des prédicteurs majoritairement continus et se concentre sur la contribution propre de chacun. Si vos variables indépendantes sont des groupes expérimentaux, allez voir le guide de l’ANOVA factorielle sous SPSS.

    Dois-je mettre les tableaux SPSS bruts dans mon mémoire ?

    Non. Les captures d’écran de sorties SPSS n’ont pas leur place dans le corps du texte. Reconstruisez un tableau propre au format de votre norme de présentation, ne conservant que les colonnes utiles — prédicteur, B, erreur standard, IC 95 %, β, t, p — et renvoyez en annexe la sortie complète si votre directeur la demande.

  • Multicolinéarité et VIF dans un mémoire : diagnostiquer, décider, corriger (2026)

    Multicolinéarité et VIF dans un mémoire : diagnostiquer, décider, corriger (2026)

    Votre tableau ANOVA est net : F significatif, p < 0,001, le modèle explique 31 % de la variance. Vous descendez au tableau des coefficients, satisfait — et là, plus rien. Aucun prédicteur n’est significatif. Ou pire : l’un d’eux affiche un signe négatif alors que sa corrélation simple avec la variable dépendante était franchement positive.

    Vous n’avez pas fait d’erreur de manipulation. Vous regardez la signature la plus reconnaissable d’un problème précis : la multicolinéarité.

    C’est la condition d’application de la régression la moins bien comprise en mémoire de master, et celle qui produit les contresens les plus coûteux — parce que, contrairement à la normalité ou à l’homoscédasticité, elle ne se voit sur aucun graphique de résidus. Elle se lit dans une colonne que la plupart des étudiants n’ont jamais demandé à SPSS d’afficher.

    Ce que c’est réellement

    La multicolinéarité, c’est le fait que deux ou plusieurs de vos variables indépendantes se prédisent largement les unes les autres. Elles ne mesurent pas exactement la même chose, mais elles portent une information si redondante que le modèle n’arrive plus à démêler leurs contributions respectives.

    Le point à saisir est là. Une régression multiple estime l’effet de chaque prédicteur à niveau constant des autres. Si votre ancienneté dans l’entreprise et votre âge varient presque toujours ensemble, la question « quel est l’effet de l’ancienneté à âge constant ? » n’a presque plus de données pour être répondue : dans votre échantillon, il n’existe quasiment personne de 25 ans avec 20 ans d’ancienneté. Le modèle répond quand même, mais avec une incertitude énorme.

    Cette incertitude a un nom technique : l’inflation de la variance des coefficients. Les estimations restent non biaisées — en moyenne, elles visent juste — mais elles deviennent instables. Leurs erreurs standard gonflent, donc les t chutent, donc les p montent, et vos effets réels deviennent statistiquement invisibles.

    Les trois symptômes qui doivent vous alerter

    • Un modèle globalement significatif dont aucun coefficient ne l’est. L’ensemble explique bien la variable dépendante, mais on ne peut attribuer le mérite à personne en particulier.
    • Un signe inversé. La corrélation simple entre le prédicteur et la variable dépendante est positive, le coefficient de régression est négatif. C’est le symptôme le plus déroutant, et le plus diagnostique.
    • Une instabilité extrême. Vous ajoutez ou retirez une variable, et les coefficients des autres changent radicalement de valeur, parfois d’ordre de grandeur.
    Diagramme en barres illustrant des valeurs de VIF dépassant un seuil
    Le VIF se lit prédicteur par prédicteur. Deux valeurs élevées vont toujours par paire : elles se désignent mutuellement.

    Le diagnostic : VIF et tolérance

    Sous SPSS, ces colonnes n’apparaissent pas par défaut. Dans Analyse → Régression → Linéaire, ouvrez le bouton Statistiques et cochez Diagnostics de colinéarité. Deux colonnes s’ajoutent alors au tableau des coefficients.

    La tolérance d’un prédicteur est la part de sa variance que les autres prédicteurs n’expliquent pas. Une tolérance de 0,08 signifie que 92 % de cette variable est déjà contenue dans les autres : il ne reste que 8 % d’information propre pour estimer son effet.

    Le VIF (facteur d’inflation de la variance, variance inflation factor) est simplement l’inverse de la tolérance. Il se lit très concrètement : un VIF de 4 signifie que l’erreur standard de ce coefficient est deux fois plus grande — la racine carrée de 4 — qu’elle ne le serait sans colinéarité.

    Les seuils conventionnels, à citer tels quels dans un mémoire :

    • VIF < 5 (tolérance > 0,20) : situation généralement considérée comme acceptable.
    • VIF entre 5 et 10 : zone d’alerte. À mentionner et à commenter, sans nécessairement modifier le modèle.
    • VIF > 10 (tolérance < 0,10) : le seuil le plus consensuellement retenu pour parler de multicolinéarité sévère. Une action est attendue.

    Ces seuils sont des conventions, pas des lois : ils n’ont pas de fondement distributionnel. Annoncez celui que vous retenez avant de lire vos résultats, et tenez-vous-y.

    Un réflexe qui ne suffit pas : la matrice de corrélations

    Beaucoup de mémoires se contentent de vérifier que deux prédicteurs ne corrèlent pas au-delà de 0,80 entre eux. C’est utile mais insuffisant, et il faut comprendre pourquoi : la multicolinéarité peut être multivariée. Trois variables peuvent afficher des corrélations deux à deux très modérées — 0,5 ou 0,6 — tout en étant telles que la troisième est presque parfaitement prédite par la combinaison des deux premières. Aucune corrélation bivariée ne le montrera ; le VIF, si. Regardez néanmoins la matrice, elle vous dira quelle paire est en cause. Notre guide sur les corrélations de Pearson et de Spearman sous SPSS détaille sa lecture.

    Quand la multicolinéarité ne pose aucun problème

    Ce point est presque systématiquement omis, et il peut vous éviter de mutiler un modèle parfaitement valide.

    Si votre objectif est la prédiction et non l’explication, la multicolinéarité est sans conséquence. Le R², les valeurs prédites et les résidus ne sont pas affectés du tout. Seule l’interprétation des coefficients individuels l’est. Un modèle destiné à prédire un résultat, sans prétention à attribuer un effet à telle ou telle variable, peut vivre avec des VIF élevés.

    Si la variable colinéaire est une simple variable de contrôle, dont vous ne comptez pas interpréter le coefficient, son VIF élevé ne compromet pas l’interprétation de vos variables d’intérêt — à condition que celles-ci aient, elles, des VIF acceptables. C’est le cas très fréquent où l’âge et l’ancienneté sont tous deux contrôlés mais où votre hypothèse porte sur autre chose.

    Si la colinéarité vient d’un terme d’interaction ou d’un terme quadratique, elle est purement artificielle : le produit de deux variables corrèle mécaniquement avec chacune d’elles. Le remède est simple et bien établi — centrer les variables (soustraire leur moyenne) avant de calculer le produit. Les VIF retombent souvent d’un ordre de grandeur.

    Arbre de décision à trois issues face à une multicolinéarité détectée
    Un VIF élevé n’impose jamais une seule réponse. Il ouvre un choix que vous devez justifier.

    Les quatre issues, de la plus simple à la plus lourde

    1. Retirer l’un des deux prédicteurs redondants

    La solution la plus courante, et celle qui demande le plus de discipline. La tentation est de supprimer mécaniquement celui dont le VIF est le plus haut ; c’est une erreur, parce que ce peut être précisément le prédicteur central de votre hypothèse. Le critère doit être théorique : lequel des deux votre cadre conceptuel désigne-t-il comme le mécanisme pertinent ? Lequel est mesuré avec le plus de fiabilité ? Lequel est le plus directement actionnable pour la question de recherche ? Écrivez la justification dans le mémoire ; c’est elle qui transforme une suppression en décision méthodologique.

    2. Combiner les prédicteurs en un score composite

    Si deux variables corrèlent à 0,88, c’est peut-être qu’elles mesurent une même dimension latente. Plutôt que d’en sacrifier une, faites-en la moyenne (après standardisation si les échelles diffèrent) et entrez ce score unique dans le modèle. Vous perdez la possibilité de distinguer leurs effets — mais cette distinction était de toute façon impossible, c’est exactement ce que le VIF vous disait. Vous gagnez une variable plus fiable et un modèle interprétable.

    3. Passer par une réduction de dimensions

    Avec un grand nombre de prédicteurs fortement intercorrélés, une analyse en composantes principales permet d’extraire quelques composantes orthogonales — donc, par construction, sans aucune colinéarité — et de les utiliser comme prédicteurs. Le coût est réel : les composantes sont des combinaisons abstraites, plus difficiles à nommer et à commenter qu’une variable observée. À réserver aux cas où la redondance est massive.

    4. Assumer et documenter

    Parfaitement légitime lorsque les VIF sont dans la zone 5-10 et que retirer une variable amputerait votre modèle théorique. Vous conservez le modèle, vous rapportez les VIF, vous signalez que les coefficients concernés doivent être interprétés avec prudence, et vous montrez idéalement un modèle alternatif sans la variable en cause pour prouver la robustesse de vos conclusions. Un jury accueille très bien cette transparence.

    Une cinquième voie mérite d’être connue même si elle dépasse le cadre du master : lorsque la redondance est structurelle et théoriquement assumée, les modèles d’équations structurelles traitent explicitement les variables latentes mesurées par plusieurs indicateurs corrélés, et le problème disparaît par construction.

    Ce que vous écrivez dans le mémoire

    Cas favorable : « Les diagnostics de colinéarité ne révèlent aucun problème : les facteurs d’inflation de la variance s’échelonnent de 1,08 à 2,34, très en deçà du seuil de 10 conventionnellement retenu, et les tolérances sont toutes supérieures à 0,42. »

    Cas d’une correction : « L’examen initial des diagnostics de colinéarité a révélé un VIF de 11,7 pour l’ancienneté et de 10,9 pour l’âge (r = 0,91), signalant une multicolinéarité sévère. L’ancienneté ayant été retenue comme le mécanisme pertinent au regard du cadre théorique mobilisé, l’âge a été retiré du modèle. Après cette modification, l’ensemble des VIF est inférieur à 2,1 et le coefficient de l’ancienneté devient significatif. »

    Cas assumé : « Deux prédicteurs présentent des VIF compris entre 6 et 8, en zone d’alerte sans atteindre le seuil de multicolinéarité sévère. Ces deux variables étant centrales dans le modèle théorique, elles ont été conservées. Leurs coefficients doivent néanmoins être interprétés avec prudence, leurs erreurs standard étant mécaniquement majorées. Un modèle alternatif excluant le second prédicteur, présenté en annexe, conduit aux mêmes conclusions. »

    Rédiger cette justification sans y perdre une semaine

    Le calcul prend une case à cocher. C’est la mise en mots qui coûte : expliquer le diagnostic, argumenter le choix, articuler la décision avec votre cadre théorique — et tenir la même terminologie du chapitre méthodologie au chapitre résultats.

    Tesify vous aide précisément là : structurer ces passages, garder une cohérence de vocabulaire d’un chapitre à l’autre, et rédiger les justifications à partir de vos propres décisions d’analyse. Vos données et vos arbitrages restent les vôtres ; le texte est écrit à 100 % par vous.

    Rédiger votre chapitre méthodologie avec Tesify

    Questions fréquentes

    À partir de quelle valeur de VIF faut-il s’inquiéter ?

    Le seuil le plus consensuel est VIF > 10 (tolérance < 0,10), qui signale une multicolinéarité sévère appelant une action. Beaucoup d’auteurs alertent dès VIF > 5, et c’est un seuil plus prudent à retenir pour un mémoire. Aucun des deux n’a de fondement distributionnel : ce sont des conventions. L’essentiel est d’annoncer le vôtre avant de lire vos résultats.

    La multicolinéarité fausse-t-elle mon R² ?

    Non, et c’est l’idée la plus utile de tout cet article. Le R², le test F global, les valeurs prédites et les résidus ne sont pas affectés. Seules les erreurs standard des coefficients individuels gonflent, donc leurs tests t, leurs p-values et leurs intervalles de confiance. Un modèle colinéaire prédit toujours aussi bien ; il explique moins bien.

    Puis-je simplement supprimer la variable au VIF le plus élevé ?

    Techniquement oui, méthodologiquement c’est risqué. Le VIF le plus haut peut appartenir à votre variable explicative centrale, et la retirer viderait votre question de recherche de son objet. Le choix doit être théorique et écrit. Notez aussi que les VIF s’effondrent en cascade : retirer une seule variable fait souvent redescendre tous les autres d’un coup, car ils se gonflaient mutuellement.

    La multicolinéarité concerne-t-elle aussi la régression logistique ?

    Oui, le mécanisme est exactement le même. SPSS n’affiche cependant pas les VIF dans la procédure de régression logistique binaire. L’astuce pratique et parfaitement admise : lancez une régression linéaire fictive sur exactement les mêmes prédicteurs, uniquement pour lire les diagnostics de colinéarité. Les VIF ne dépendent que des relations entre variables indépendantes, pas de la variable dépendante — la lecture est donc valide.

    Faut-il tester la multicolinéarité avant ou après avoir lancé le modèle ?

    Les deux se font en une seule opération, puisque la case à cocher produit les VIF dans le même tableau que les coefficients. Mais interprétez-les avant de commenter le moindre coefficient : un tableau lu dans le mauvais ordre conduit à s’étonner d’un résultat dont l’explication se trouvait deux colonnes plus loin. Sur l’organisation générale de cette étape, voyez notre guide complet de l’analyse de données pour un mémoire.

  • Vous avez mesuré trois choses : trois ANOVA ou une MANOVA ? (2026)

    Vous avez mesuré trois choses : trois ANOVA ou une MANOVA ? (2026)

    Votre questionnaire produit trois scores : engagement, épuisement, satisfaction. Vous comparez deux groupes. Vous vous apprêtez à lancer trois tests, et votre directeur prononce le mot : « ce serait plutôt une MANOVA ».

    Vous notez, et vous rentrez chez vous avec une question à laquelle aucun manuel ne répond en une page : qu’est-ce que ce modèle apporte, et est-ce que votre situation le justifie ?

    La réponse courte

    Une MANOVA se justifie quand vos variables dépendantes forment un ensemble conceptuel, sont modérément corrélées, et que votre hypothèse porte sur cet ensemble.

    Si vos trois mesures sont conceptuellement indépendantes — un score, un délai, un nombre —, trois analyses séparées, annoncées à l’avance dans la méthodologie, sont plus lisibles et parfaitement défendables. La MANOVA n’est pas une version supérieure de l’ANOVA ; c’est une réponse à une question différente.

    L’argument que tout le monde donne, et qui ne suffit pas

    La justification qu’on entend systématiquement est celle de l’inflation du risque : trois tests à 5 % ne font pas un test à 5 %. C’est exact, c’est traité en détail dans notre article sur le seuil de signification et la p-value, et ce n’est pas la bonne raison de choisir une MANOVA — parce qu’une simple correction du seuil réglerait le problème sans changer de modèle.

    La vraie raison est ailleurs, et elle est plus intéressante.

    Ce que la MANOVA teste réellement

    Le modèle ne teste pas vos trois variables l’une après l’autre. Il construit une combinaison linéaire de vos variables dépendantes — une variable synthétique optimisée pour séparer au mieux les groupes — puis teste si les groupes diffèrent sur cette combinaison.

    La conséquence est contre-intuitive et c’est tout l’intérêt de la méthode : deux groupes peuvent ne différer significativement sur aucune variable prise isolément, et différer nettement sur leur combinaison.

    Deux groupes qui se recouvrent sur chaque axe pris isolément mais se séparent dans le plan
    Sur chaque axe pris seul, les distributions se recouvrent largement. Dans le plan, les deux groupes se séparent nettement. C’est exactement ce que la MANOVA détecte.

    Concrètement : un groupe peut se caractériser non par un engagement plus élevé ni par un épuisement plus faible, mais par une configuration particulière des deux. C’est un résultat que trois ANOVA séparées ne peuvent structurellement pas produire.

    L’inverse est vrai aussi, et il faut le savoir avant de se lancer : si vos variables dépendantes sont très fortement corrélées, elles portent la même information et la MANOVA n’ajoute rien — mieux vaut alors les agréger en un score unique après avoir vérifié sa cohérence par un alpha de Cronbach.

    Les trois conditions du choix

    1. Cohérence conceptuelle. Vos variables dépendantes doivent relever du même champ théorique. Mettre ensemble un score de bien-être et un nombre d’absences produit une combinaison linéaire que personne ne saura interpréter.
    2. Corrélation modérée. L’intervalle utile se situe grossièrement entre 0,2 et 0,7. En dessous, la MANOVA perd de la puissance par rapport à des analyses séparées ; au-dessus, vos variables sont redondantes. Vérifiez la matrice avec nos corrélations de Pearson et de Spearman avant de décider.
    3. Une hypothèse sur l’ensemble. « Les deux groupes se distinguent-ils par leur profil sur ces trois dimensions ? » appelle une MANOVA. « L’épuisement est-il plus élevé dans le groupe A ? » n’en appelle pas.

    Si vos dimensions viennent d’une analyse factorielle exploratoire, un point de vigilance : des scores factoriels issus d’une rotation orthogonale sont par construction peu corrélés, ce qui affaiblit précisément l’argument de la MANOVA.

    La procédure sous SPSS

    Analyse → Modèle linéaire général → Multivarié. Placez vos variables dépendantes dans la première boîte, votre facteur en facteur fixe. Dans Options, cochez les statistiques descriptives, les estimations de la taille d’effet et les tests d’homogénéité.

    La sortie centrale s’appelle Tests multivariés et présente quatre statistiques : trace de Pillai, lambda de Wilks, trace de Hotelling et plus grande racine de Roy. Elles répondent à la même question par des chemins différents.

    • Le lambda de Wilks est le plus souvent rapporté, par convention.
    • La trace de Pillai est la plus robuste aux violations d’hypothèses et aux groupes de tailles inégales. C’est celle à privilégier dans un mémoire dès que vos effectifs sont déséquilibrés — en disant pourquoi.

    Avec deux groupes seulement, les quatre statistiques donnent exactement le même p ; le choix ne se pose vraiment qu’à partir de trois groupes.

    Les conditions à vérifier

    Le test M de Box évalue l’égalité des matrices de covariance entre groupes. Il apparaît dès que vous cochez les tests d’homogénéité, et il est extrêmement sensible : sur un grand échantillon ou avec une légère non-normalité, il devient significatif pour un écart trivial. La pratique courante consiste à l’évaluer à un seuil très strict, de l’ordre de 0,001, et à rapporter la trace de Pillai s’il est franchi alors que les effectifs sont comparables.

    Les valeurs atypiques multivariées sont l’autre point sensible. Un participant peut être parfaitement banal sur chacune de vos variables et complètement atypique dans leur combinaison — engagement très haut avec épuisement très haut, par exemple. La distance de Mahalanobis, calculable en enregistrant les distances dans le menu de régression, est l’outil standard pour les repérer.

    L’indépendance des observations reste, ici comme ailleurs, la condition la plus discrète : si vos participants sont imbriqués dans des classes ou des services, aucune statistique multivariée ne le corrigera. Voyez notre article sur les données groupées.

    Le piège de la descente

    Votre MANOVA est significative. Le réflexe universel consiste à enchaîner trois ANOVA univariées pour voir « d’où ça vient ».

    Une conclusion multivariée redescendue vers des analyses par variable
    La descente vers les analyses univariées est l’étape où l’argument initial se retourne contre lui-même.

    Le problème est logique : vous avez choisi la MANOVA pour éviter de multiplier les tests, et vous multipliez les tests immédiatement après. La protection que le test multivarié était censé fournir ne s’étend pas automatiquement aux analyses de suivi.

    Deux voies cohérentes.

    La voie simple : conduisez les analyses univariées, mais appliquez une correction explicite du seuil et annoncez-la dans la méthodologie. C’est acceptable, et c’est honnête.

    La voie cohérente : passez à une analyse discriminante (Analyse → Classification → Analyse discriminante). C’est le prolongement naturel de la MANOVA : au lieu de redescendre variable par variable, elle décrit la combinaison qui sépare les groupes, en indiquant le poids de chaque variable dans cette séparation. Vous restez au niveau où la question a été posée. Le rapprochement avec les démarches de typologie n’est pas fortuit : dans les deux cas, l’objet est un profil, pas une variable isolée.

    Et si vous avez aussi une covariable ?

    Le modèle s’appelle alors MANCOVA, et il se déclare dans la même boîte de dialogue en ajoutant la covariable. Le cas typique est un plan avant-après sur plusieurs dimensions : les scores initiaux entrent en covariables, les scores finaux en variables dépendantes. La logique de l’ajustement est celle décrite dans notre article sur l’ANCOVA en plan pré-test / post-test, transposée à plusieurs mesures simultanées — avec la même condition d’homogénéité des pentes, à vérifier pour chaque variable dépendante.

    Rédiger le résultat

    MANOVA significative : « Une analyse multivariée de la variance a été conduite sur les trois dimensions du questionnaire, dont les corrélations bivariées s’échelonnent de 0,31 à 0,58. Le test M de Box est non significatif (p = 0,214) et les effectifs sont comparables. L’effet du groupe sur l’ensemble des trois dimensions est significatif, trace de Pillai = 0,14, F(3, 182) = 9,87, p < 0,001, η²p = 0,14. »

    Décision de ne pas faire de MANOVA : « Les trois variables dépendantes relevant de construits distincts et faiblement corrélées entre elles (r maximal = 0,17), une approche multivariée n’a pas été retenue. Trois analyses univariées, annoncées a priori, ont été conduites avec un seuil ajusté pour tenir compte de leur nombre. »

    La seconde phrase vaut la première : refuser une méthode avec un argument chiffré est un résultat méthodologique, pas un aveu.

    Les erreurs qui coûtent cher

    • Empiler les variables dépendantes pour « voir ce qui sort ». Chaque variable ajoutée coûte de la puissance ; une MANOVA à sept variables dépendantes sur 90 participants ne détectera rien.
    • Rapporter les quatre statistiques multivariées. Choisissez-en une, justifiez-la, tenez-vous-y.
    • Conclure de la MANOVA à chaque variable. Un effet multivarié significatif ne signifie pas que chaque dimension diffère.
    • Ignorer le sens de la combinaison. Si vous ne pouvez pas dire ce que la combinaison représente, votre résultat n’est pas interprétable.
    • Confondre plusieurs variables dépendantes et plusieurs facteurs. Deux facteurs croisés avec une seule variable dépendante relèvent de l’ANOVA factorielle, pas de la MANOVA.
    • Se tromper de famille de modèle. Si l’une de vos variables dépendantes est binaire, ordinale ou un comptage, elle n’a pas sa place dans une MANOVA : notre annuaire de l’analyse selon le type de variable dépendante permet de vérifier ce point avant de construire le modèle.

    Écrire le chapitre qui va avec, sans y passer trois semaines

    La MANOVA est un cas où l’analyse est courte et la rédaction longue. Il faut justifier le choix du modèle avant les résultats, expliquer ce que teste une combinaison linéaire à un lecteur qui ne le sait pas, choisir et défendre une statistique multivariée, décider de la stratégie de suivi et s’y tenir, puis interpréter un profil plutôt qu’une variable — le tout en gardant les mêmes termes du chapitre méthode à la discussion.

    Tesify travaille avec vous exactement sur ce passage. L’outil structure le chapitre à partir de vos propres décisions d’analyse, tient une terminologie constante d’un bout à l’autre du mémoire, et rédige avec vous les paragraphes de justification qui font la différence à la lecture du jury. Vos données restent les vôtres, et le texte est écrit à 100 % par vous.

    Rédiger votre chapitre résultats avec Tesify

    Questions fréquentes

    Combien de participants faut-il pour une MANOVA ?

    La contrainte absolue est qu’il faut, dans le plus petit groupe, davantage de participants que de variables dépendantes — faute de quoi le modèle n’est pas estimable. C’est un plancher technique, pas une recommandation : en pratique il faut nettement plus pour une puissance raisonnable, et chaque variable dépendante ajoutée renchérit l’exigence. Traitez la question au moment du calcul d’effectif, pas après la collecte.

    Peut-on faire une MANOVA avec deux groupes seulement ?

    Oui. Les quatre statistiques multivariées coïncident alors, et le test équivaut au T² de Hotelling, la généralisation multivariée du test t. La procédure SPSS est la même.

    La MANOVA remplace-t-elle une correction de seuil ?

    Non, et c’est le malentendu le plus répandu. Elle protège le test global, pas les analyses de suivi. Si vous redescendez vers des ANOVA univariées, la question du seuil se repose intégralement.

    Mon test de Box est significatif : dois-je abandonner ?

    Pas nécessairement. Ce test est très sensible à l’effectif et à la non-normalité, ce qui explique qu’on l’évalue usuellement à un seuil très strict. Avec des groupes de tailles comparables, un résultat significatif reste tolérable si vous rapportez la trace de Pillai et si vous mentionnez la limite. Avec des groupes très déséquilibrés, la prudence s’impose davantage.

    Puis-je faire une MANOVA sur des mesures répétées ?

    Il faut distinguer deux situations que le vocabulaire confond. Mesurer trois variables différentes sur les mêmes personnes relève bien de la MANOVA. Mesurer la même variable à trois moments relève d’un plan intra-sujets, avec ses conditions propres. Si vous avez les deux à la fois, le plan devient un modèle multivarié à mesures répétées, et il faut l’annoncer comme tel.

  • Annuaire 2026 : chaque tableau de sortie SPSS, ce qu’il dit et le chiffre à recopier

    Annuaire 2026 : chaque tableau de sortie SPSS, ce qu’il dit et le chiffre à recopier

    Vous avez lancé la procédure. SPSS a produit sept tableaux. Sur la centaine de nombres affichés, votre mémoire en utilisera cinq — et le reste sert à vérifier des conditions ou n’a aucun intérêt pour vous.

    Cet annuaire range les sorties dans l’ordre où elles apparaissent, par famille d’analyse. Pour chacune : ce que le tableau dit, quel nombre recopier, et sous quelle forme l’écrire. Les intitulés donnés sont ceux de l’interface française ; l’équivalent anglais est indiqué quand il diffère nettement, parce que beaucoup de licences universitaires sont installées en anglais.

    La règle qui vaut pour tous les tableaux

    Trois repères suffisent à lire n’importe quelle sortie.

    1. Trouvez le N — et vérifiez qu’il correspond à ce que vous attendez. Un N plus petit signale des observations écartées pour valeurs manquantes, et il change selon les analyses. C’est le premier chiffre à contrôler, avant même le résultat.
    2. Trouvez la statistique et ses degrés de libertét, F, χ², U, accompagnés de leur ddl. Ce couple est ce qui identifie le test ; le p seul ne suffit jamais.
    3. Trouvez la colonne Sig. — c’est le p. SPSS ne l’appelle jamais p.
    Trois cellules d'un tableau de sortie deviennent une seule phrase de résultat
    Une phrase de résultat, c’est trois cellules : la statistique, ses degrés de liberté, et la significativité.

    Les conventions de transcription

    Elles ne sont écrites nulle part dans SPSS, et elles reviennent dans presque toutes les corrections.

    • Sig. affiche « ,000 » : n’écrivez jamais p = 0,000. Une probabilité n’est pas nulle ; SPSS a simplement arrondi à trois décimales. La forme correcte est p < 0,001. Pour toute autre valeur, écrivez l’égalité avec trois décimales : p = 0,032.
    • Deux décimales pour les statistiques (t = 2,41 ; F = 5,82 ; r = 0,43), trois pour les probabilités. Au-delà, vous affichez une précision que vos données n’ont pas.
    • Symboles en italiques : t, F, p, r, n, M, SD, d. Les lettres grecques (α, χ², η²) restent droites.
    • Virgule décimale en français, y compris dans les tableaux, et espace insécable avant les deux-points et les points-virgules. Si votre département impose un gabarit, il prime : vérifiez-le avant de tout reformater.
    • « Sig. (bilatéral) » veut dire bilatéral. Si votre hypothèse est unilatérale et que vous l’avez annoncée comme telle avant l’analyse, divisez par deux — et dites-le. Ne divisez jamais après avoir vu le résultat.

    Statistiques descriptives

    « Statistiques descriptives » / « Récapitulatif du traitement des observations ». À recopier : N, moyenne, écart-type, minimum et maximum. Le second tableau donne le nombre de valeurs manquantes par variable : regardez-le, il justifie les écarts de N entre analyses. Ces chiffres alimentent le tableau de description de l’échantillon, jamais le corps du texte ligne à ligne. Notre tutoriel d’analyse quantitative détaille l’enchaînement complet depuis l’import du fichier.

    Comparer deux groupes

    « Statistiques de groupe » donne n, moyenne et écart-type par groupe. C’est de là que sortent les M et SD de votre phrase.

    « Test d’échantillons indépendants » est le tableau le plus mal lu de tout SPSS, parce qu’il contient deux lignes de résultats. La partie gauche donne le test de Levene sur l’égalité des variances ; la partie droite donne le test t, une fois en supposant les variances égales, une fois sans cette hypothèse (correction de Welch). Lisez d’abord Levene, puis choisissez la ligne. Si le Levene est significatif, c’est la seconde ligne qu’il faut recopier, et ses degrés de liberté seront décimaux — c’est normal. Le détail du choix est traité dans notre article sur le test t et Mann-Whitney.

    « Test des échantillons appariés » pour deux mesures sur les mêmes personnes : le tableau des corrélations qui le précède n’est pas le résultat, c’est un indicateur de liaison entre les deux mesures.

    Comparer trois groupes ou plus

    « Tests des effets inter-sujets » (Tests of Between-Subjects Effects) est le tableau central de l’ANOVA. Recopiez, pour chaque effet : F, les ddl de l’effet, les ddl de l’erreur (dernière ligne du tableau), Sig. et l’êta-carré partiel si vous l’avez demandé. La ligne « Total corrigé » ne se rapporte jamais. La lecture de l’ANOVA factorielle, et notamment celle de l’interaction, mérite une attention particulière : c’est elle qui porte le résultat, pas les effets principaux.

    « Comparaisons multiples » contient les tests post-hoc. Chaque paire y figure deux fois, en miroir : n’en recopiez qu’une.

    Si vous avez ajouté une covariable, la sortie s’enrichit d’un tableau de moyennes ajustées — ce sont elles, et non les moyennes brutes, qui doivent être rapportées. Voyez notre article sur l’ANCOVA avec le pré-test en covariable.

    Tests non paramétriques

    La procédure moderne produit d’abord un « Récapitulatif des tests d’hypothèses » : une ligne, une décision en clair, et un Sig. C’est utile pour trancher, insuffisant pour rédiger. Double-cliquez pour ouvrir la vue détaillée, qui contient la statistique U ou H, les rangs moyens et les effectifs par groupe — ce sont ces valeurs qu’il faut rapporter. Les articles sur le test de Wilcoxon et le test de Friedman donnent la phrase type pour chacun.

    Croiser deux variables catégorielles

    « Tableau croisé » puis « Tests du khi-deux ». Recopiez la ligne Khi-deux de Pearson : valeur, ddl, Sig. La note sous le tableau indique le pourcentage de cellules dont l’effectif théorique est inférieur à 5 — c’est la condition d’application, et elle décide si vous devez passer au test exact de Fisher. Le tableau « Mesures symétriques » donne le V de Cramér, c’est-à-dire la taille d’effet. Tout est détaillé dans notre article sur le khi-deux sur tableau croisé.

    Relier deux variables continues

    « Corrélations » : une matrice symétrique où chaque coefficient apparaît deux fois. Recopiez la moitié inférieure. Attention au N propre à chaque paire, qui varie avec les valeurs manquantes. Le choix entre Pearson et Spearman se fait avant, pas en regardant lequel donne le plus petit p.

    Expliquer par plusieurs prédicteurs

    La régression linéaire produit quatre tableaux, et chacun a un usage distinct.

    • « Récapitulatif des modèles »R, R-deux, R-deux ajusté, erreur standard de l’estimation. Rapportez le R-deux ajusté dès que vous avez plusieurs prédicteurs. La statistique de Durbin-Watson, si demandée, s’affiche ici.
    • « ANOVA » — le test global du modèle. Un F significatif dit que le modèle explique plus que rien, pas que chaque prédicteur compte.
    • « Coefficients » — le tableau qui porte le résultat : B non standardisé, erreur standard, bêta standardisé, t, Sig., et si vous les avez demandés l’intervalle de confiance de B et les indices de tolérance et de VIF.
    • « Diagnostics des observations » — la liste des cas dont le résidu standardisé dépasse 3. Ce tableau ne dit pas tout : la question de savoir si une observation pèse sur le modèle se traite avec la distance de Cook et le levier, qui s’enregistrent en colonnes plutôt qu’en tableau.

    Pour une issue binaire, la sortie change de noms : « Variables dans l’équation » remplace « Coefficients » et donne B, Wald, Sig. et Exp(B) — c’est ce dernier qui est l’odds ratio. S’y ajoutent le test de Hosmer-Lemeshow, où un résultat non significatif est le bon signe, et le tableau de classement.

    L'annuaire des tableaux de sortie, regroupés par famille d'analyse
    Chaque famille d’analyse a sa sortie type ; dans chacune, deux ou trois cellules seulement partent dans le mémoire.

    Questionnaires et échelles

    « Statistiques de fiabilité » donne l’alpha de Cronbach et le nombre d’éléments. Le tableau « Statistiques de total des éléments » qui suit est le plus utile des deux : sa colonne Corrélation complète des éléments corrigés repère les items qui ne collent pas à l’échelle, et sa dernière colonne indique l’alpha obtenu si l’item était supprimé. Une corrélation négative y signale presque toujours un item inversé non recodé — voyez notre article sur l’alpha de Cronbach.

    Pour une structure factorielle : « Indice KMO et test de Bartlett » (les deux conditions préalables), « Variance totale expliquée » (le nombre de facteurs retenus et leur part), et « Matrice des composantes après rotation » (les saturations à interpréter). Le détail figure dans nos articles sur l’analyse factorielle exploratoire et sur l’analyse en composantes principales. La suite confirmatoire relève des modèles d’équations structurelles.

    Conditions et diagnostics

    « Tests de normalité » donne Kolmogorov-Smirnov et Shapiro-Wilk. Ici, un résultat significatif est une mauvaise nouvelle — et ce que l’on en fait dépend de ce qu’on est prêt à changer : l’échelle de la variable, le calcul de l’incertitude ou le test lui-même.

    « Aire sous la courbe » accompagne la courbe ROC : recopiez l’AUC, son erreur standard, son Sig. et surtout son intervalle de confiance.

    Enfin, si un bloc « Bootstrap » apparaît sous vos tableaux habituels, c’est que l’option est cochée : ce sont ces intervalles-là qu’il faut rapporter, et non les intervalles théoriques de la ligne du dessus.

    Où va chaque nombre

    Ce que SPSS affiche Ce que vous recopiez Où cela va
    Sig. = ,000 p < 0,001 Dans la phrase de résultat
    Statistiques de groupe M et SD par groupe Tableau descriptif, puis la phrase
    Test de Levene Rien, sauf s’il est significatif Une incise dans la méthode
    ddl de l’erreur Le second nombre entre parenthèses de F Dans la phrase de résultat
    Récapitulatif des modèles R-deux ajusté Une phrase avant le tableau des coefficients
    Matrice de corrélations La moitié inférieure seulement Un tableau reformaté
    Le tableau SPSS lui-même Jamais tel quel Reformaté au gabarit de votre école

    Les cinq pièges

    • Coller la capture d’écran du tableau SPSS. Un tableau de résultats se reconstruit, avec ses seules colonnes utiles et le format imposé par votre établissement : voyez comment présenter tableaux et figures.
    • Recopier la mauvaise ligne du test t. Le tableau en contient deux ; Levene décide.
    • Oublier les degrés de liberté. F = 5,82 ne veut rien dire sans F(2, 147).
    • Rapporter Sig. sans la statistique. Un p isolé n’est pas vérifiable, et un lecteur ne peut pas le recalculer.
    • Prendre un N pour un autre. Le N de l’échantillon, le N valide d’une variable et le N d’une analyse donnée diffèrent souvent. C’est la première incohérence que relève un rapporteur.

    Sur le sens exact de la colonne Sig. et sur ce qu’un seuil autorise à conclure, voyez notre article sur le seuil de signification ; sur ce que les bornes chiffrées ajoutent, celui sur l’intervalle de confiance. Et si vous travaillez sous jamovi ou JASP, les intitulés changent mais la logique de lecture reste exactement la même.

    De la sortie au chapitre

    Extraire les bons nombres prend quelques minutes. Ce qui prend du temps, c’est de les enchaîner en un chapitre lisible : annoncer l’analyse, donner le résultat, l’interpréter en une phrase, et passer au suivant sans que le lecteur se perde.

    Tesify travaille avec vous sur ce passage : structurer le chapitre résultats à partir de vos propres sorties, tenir un vocabulaire constant d’une analyse à l’autre, et rédiger les transitions. Vos données restent les vôtres, et le texte est écrit à 100 % par vous.

    Rédiger votre chapitre résultats avec Tesify

    Questions fréquentes

    Mon SPSS est en anglais. Les intitulés correspondent-ils ?

    Oui, tableau pour tableau. Les correspondances les plus utiles : Group Statistics, Independent Samples Test, Tests of Between-Subjects Effects, Model Summary, Coefficients, Variables in the Equation, Reliability Statistics, Total Variance Explained. La colonne Sig. porte le même nom dans les deux langues.

    Faut-il mettre les sorties brutes en annexe ?

    La plupart des établissements l’apprécient, certains l’exigent. Mettez-y les sorties complètes des analyses principales, pas l’intégralité de vos essais. Le corps du texte ne contient que des tableaux reformatés.

    SPSS affiche « . » ou une cellule vide. Pourquoi ?

    Une valeur non calculable : effectif nul dans une cellule, variance nulle, ou modèle non identifié. Ce n’est pas un bug d’affichage, c’est un signal — revenez aux données avant d’interpréter quoi que ce soit du tableau.

    Dois-je rapporter tous les tableaux produits ?

    Non. Un chapitre résultats rapporte ce qui répond aux hypothèses annoncées, plus les vérifications de conditions. Tout le reste appartient aux annexes ou à rien du tout. Le critère n’est pas « SPSS l’a produit » mais « ma question de recherche en a besoin ».

    Comment citer une taille d’effet quand SPSS ne l’affiche pas ?

    Plusieurs procédures ne la fournissent pas par défaut. L’êta-carré partiel se coche dans les options de l’ANOVA ; le d de Cohen se calcule à partir des moyennes et des écarts-types du tableau descriptif ; le V de Cramér figure dans les mesures symétriques du khi-deux. Pour un accord entre juges, c’est le kappa de Cohen qui joue ce rôle.

    Deux tableaux donnent des N différents. Lequel est le bon ?

    Les deux, pour leur analyse respective. SPSS exclut les observations au cas par cas ou liste par liste selon les procédures et les options. Notez le N de chaque analyse dans son propre tableau et expliquez l’écart une fois pour toutes en début de chapitre.