Statistiques inférentielles
1. Statistiques inférentielles
L'aléatoire intervient en statistiques inférentielles car il est impossible de mesurer tous les individus d'une population, et parce qu'il existe une variabilité entre individus sur les variables étudiées.
2. Population / Échantillon
- Population : ensemble plus grand dont sont extraits les individus étudiés (appelés individus statistiques). Ce n’est pas forcément une population démographique, mais un ensemble défini par la question de recherche.
- Échantillon : sous-ensemble de la population, toujours plus petit, sur lequel on collecte les données.
a) Exemples de populations selon la question de recherche
| Question de recherche | Individus statistiques | Populations impliquées |
|---|---|---|
| Les étudiants en fac de lettres sont-ils plus assidus qu’en fac de droit ? | Étudiants en lettres et en droit | 2 populations : étudiants en lettres, étudiants en droit |
| La nouveauté d’une solution diminue-t-elle sa faisabilité ? | Solutions au problème ouvert | Ensemble des solutions possibles |
| Les lycées à faibles effectifs réussissent-ils mieux que ceux à forts effectifs ? | Lycées | 2 populations : lycées à faible effectif, lycées à fort effectif |
À retenir : La population est définie par la question de recherche et ne peut être entièrement observée, d’où la nécessité d’étudier un échantillon.
3. Inférence statistique
- L’objectif est de tirer des conclusions sur la population à partir des données collectées sur un échantillon.
- L’inférence statistique permet de généraliser les résultats obtenus sur l’échantillon à la population entière, malgré la variabilité et l’impossibilité d’observer tous les individus.
À retenir : L’inférence statistique consiste à estimer ou tester des caractéristiques de la population à partir d’un échantillon.
4. Notations essentielles
- Population : ensemble complet des individus statistiques concernés.
- Échantillon : sous-ensemble observé, utilisé pour l’analyse.
- Variable indépendante (VI) : facteur manipulé ou observé pour expliquer un phénomène.
- Variable dépendante (VD) : phénomène mesuré, affecté par la VI.
Cette distinction population/échantillon et l’inférence statistique sont fondamentales pour répondre aux questions de recherche en psychologie, où l’accès à la totalité des données est impossible.
Population et échantillon
1. Population et échantillon
- Population : ensemble complet des individus ou unités d’étude sur lesquels on souhaite tirer des conclusions.
- Échantillon : sous-ensemble de la population, sélectionné pour effectuer des mesures ou observations.
a) Paramètres vs Statistiques
| Terme | Population (paramètre) | Échantillon (statistique) |
|---|---|---|
| Moyenne | (grec) | (latin) |
| Écart-type | (grec) | (latin) |
- La moyenne et l’écart-type de la population sont souvent inconnus.
- La moyenne et l’écart-type calculés sur un échantillon sont des estimations des paramètres populationnels.
- La moyenne d’un échantillon n’est pas nécessairement égale à la moyenne vraie .
- Différents échantillons peuvent donner des moyennes différentes.
b) Exemple : QI
- Population générale : , (valeurs connues).
- Échantillon : moyenne et écart-type calculés à partir des données.
- Objectif : comparer à pour savoir si l’échantillon diffère significativement de la population.
c) Inférence statistique
- But : étendre les résultats observés dans un échantillon à la population entière.
- Fondée sur la probabilité pour quantifier la confiance dans les conclusions.
- Processus inductif : du particulier (échantillon) au général (population).
2. Démarche du test d’hypothèses
- Poser des hypothèses a priori sur la population (hypothèses théoriques).
- Tester ces hypothèses à partir des données de l’échantillon.
- Conclure sur la population en fonction des résultats du test.
À retenir : « Si tu ignores quelque chose du réel, pose une hypothèse que tu affirmes comme vraie. Si tu as tort, le réel devrait te détromper. »
a) Hypothèse générale vs opérationnelle
- Hypothèse générale : réponse théorique à la question de recherche (ex. : la thérapie A réduit les symptômes).
- Hypothèse opérationnelle : formulation précise et testable à partir des données (ex. : la moyenne des symptômes après thérapie A est inférieure à celle d’un groupe contrôle).
3. Points clés à retenir
- La moyenne d’un échantillon est une estimation de la moyenne populationnelle, jamais une égalité certaine.
- La statistique inférentielle repose sur la probabilité pour évaluer la validité des hypothèses.
- Le test d’hypothèse est une démarche en 3 étapes : poser, tester, conclure.
- Les paramètres de la population sont notés en lettres grecques (, ), les statistiques d’échantillon en lettres latines (, ).
Inférence statistique
1. Formulation des hypothèses en inférence statistique
L'inférence statistique repose sur des hypothèses formulées à deux niveaux :
| Niveau | Description | Exemple | Variables définies ? |
|---|---|---|---|
| Général | Hypothèses qui mettent en avant les construits d’intérêt sans préciser la mesure ou manipulation | « Les lycées avec de faibles effectifs réussissent mieux que ceux avec de grands effectifs » | Non, VD et VI mal définies |
| Opérationnel | Hypothèses précisant comment manipuler ou mesurer les construits | « Les lycées avec moins de 300 élèves ont de meilleures moyennes générales que ceux avec plus de 300 élèves » | Oui, VI nominale à 2 modalités, VD quantitative continue |
- Variable indépendante (VI) : facteur manipulé ou catégorisé (ex. : effectif lycée {≤300, >300}).
- Variable dépendante (VD) : mesure observée (ex. : moyenne générale).
Parfois, une hypothèse peut être intermédiaire, où la VD est claire mais pas la VI.
2. Hypothèse nulle (H₀) vs hypothèse alternative (H₁)
Considérons l'exemple du QI des étudiants en psychologie :
- Hypothèse générale : Les étudiants en psychologie sont plus intelligents que la population générale.
- Hypothèse opérationnelle : La moyenne du QI des étudiants en psychologie est supérieure à celle de la population générale.
On distingue deux mondes possibles :
| Monde | Description | Formulation symbolique |
|---|---|---|
| Hypothèse alternative (H₁) | La moyenne du QI des étudiants en psychologie () est supérieure à celle de la population générale (). | |
| Hypothèse nulle (H₀) | La moyenne du QI des étudiants en psychologie n’est pas supérieure à celle de la population générale (égales ou inférieures). | (ou ) |
- H₁ correspond à l'effet ou la différence que l'on cherche à démontrer.
- H₀ représente l'absence d'effet ou la situation par défaut.
L'inférence statistique consiste à tester H₀ contre H₁ à partir des données échantillonnées.
3. Récapitulatif des notions clés
- Hypothèse générale : formulation conceptuelle, sans précision sur la mesure.
- Hypothèse opérationnelle : précise la manipulation et la mesure des variables.
- VI : variable indépendante, souvent qualitative (ex. : taille d’effectif).
- VD : variable dépendante, souvent quantitative (ex. : moyenne générale).
- H₀ (hypothèse nulle) : pas de différence ou effet.
- H₁ (hypothèse alternative) : différence ou effet attendu.
Pour tester une hypothèse, il faut toujours la formuler au niveau opérationnel, avec des variables clairement définies.
Démarche du test d'hypothèses
1. Hypothèses en test statistique
- Hypothèse nulle (H₀) : représente l'absence de différence ou l'égalité entre les groupes, formulée symboliquement comme
- Hypothèse alternative (H₁) : correspond à la présence d'une différence, c'est l'hypothèse que l'on cherche à corroborer.
Ces deux hypothèses sont fondamentales en statistique inférentielle, car toute question de recherche doit pouvoir être traduite en ces termes.
2. Principe du test d'hypothèses
- On ne peut jamais affirmer avec certitude que H₀ ou H₁ est vraie.
- On évalue la probabilité que les données observées soient compatibles avec H₀.
- Cette probabilité permet de décider si l'on rejette H₀ en faveur de H₁.
3. Exemple illustratif
- Population de référence : moyenne du QI standardisée , variance .
- Échantillon : 70 étudiants en psychologie, moyenne empirique .
- Différence observée :
- Cette différence peut être due au hasard de l'échantillonnage.
- On cherche à quantifier la probabilité d'observer une telle différence si H₀ est vraie.
4. Valeur p et seuil de signification
- La valeur p est la probabilité d'obtenir un résultat au moins aussi extrême que celui observé, sous l'hypothèse nulle.
- Le seuil de risque est fixé arbitrairement, souvent à 5% en psychologie.
- Règle de décision :
- Si , on rejette H₀ (résultat significatif).
- Sinon, on ne rejette pas H₀.
5. Importance des notions de probabilité et distribution
- Comprendre la valeur p et le seuil nécessite de maîtriser les concepts de :
- Variables aléatoires
- Distributions de probabilité
- Ces notions permettent de relier les données d'échantillon à la population et de prendre une décision statistique rigoureuse.
À retenir : Le test d'hypothèses repose sur la comparaison entre la probabilité d'observer les données sous H₀ (valeur p) et un seuil de risque pour décider de rejeter ou non H₀.
Hypothèse générale versus opérationnelle
1. Hypothèse générale vs hypothèse opérationnelle
En recherche, l'hypothèse générale est une affirmation large et théorique sur la relation entre des variables. Elle exprime une idée globale que l'on souhaite tester.
L'hypothèse opérationnelle est une traduction précise et mesurable de l'hypothèse générale, adaptée à la méthode expérimentale. Elle définit clairement les variables observables et les conditions de mesure.
| Aspect | Hypothèse générale | Hypothèse opérationnelle |
|---|---|---|
| Nature | Théorique, large | Précise, mesurable |
| Objectif | Exprimer une relation ou un effet attendu | Définir comment tester cette relation |
| Variables | Concepts abstraits | Variables concrètes et observables |
| Exemple (psychologie) | "Le stress influence la mémoire" | "Les sujets exposés à un bruit blanc auront un score moyen inférieur au test de mémoire" |
a) Importance de la distinction
- L'hypothèse générale guide la réflexion théorique.
- L'hypothèse opérationnelle permet la mise en place d'une expérience ou d'une étude statistique.
- Sans hypothèse opérationnelle claire, il est impossible de collecter des données pertinentes et d'effectuer des analyses statistiques valides.
À retenir : L'hypothèse opérationnelle est la version testable et mesurable de l'hypothèse générale.
Hypothèse alternative versus hypothèse nulle
1. Hypothèse nulle (H0) et hypothèse alternative (H1)
En statistique inférentielle, l'hypothèse nulle (H0) représente la situation de référence, souvent l'absence d'effet ou de différence. Elle sert de base au test statistique.
L'hypothèse alternative (H1) est l'hypothèse que l'on cherche à démontrer, indiquant la présence d'un effet, d'une différence ou d'une relation.
| Élément | Hypothèse nulle (H0) | Hypothèse alternative (H1) |
|---|---|---|
| Rôle | Hypothèse de départ, absence d'effet | Hypothèse à tester, présence d'effet |
| Formulation | Souvent une égalité (ex : ) | Souvent une inégalité (ex : ) |
| But du test | Vérifier si les données sont compatibles avec H0 | Rejeter H0 en faveur de H1 si preuve suffisante |
| Décision possible | Rejeter ou ne pas rejeter H0 | Acceptée si H0 rejetée |
2. Principe du test d'hypothèse
- On part de l'hypothèse nulle H0.
- On calcule une statistique de test à partir des données.
- On évalue la probabilité d'obtenir cette statistique (ou une plus extrême) sous H0 : c'est la p-valeur.
- Si la p-valeur est inférieure au seuil de signification (ex : 0,05), on rejette H0 au profit de H1.
- Sinon, on ne rejette pas H0 (pas de preuve suffisante contre H0).
3. Relation avec la loi normale et le score z
- Les tests statistiques reposent souvent sur la distribution d'une statistique sous H0.
- Pour des variables numériques, cette distribution est souvent approchée par une loi normale centrée-réduite grâce au théorème central limite.
- Le score z standardise une observation par rapport à la moyenne et l'écart-type de l'échantillon :
- Cette transformation permet de comparer un score à la distribution normale standard, facilitant le calcul de la p-valeur.
À retenir : L'hypothèse nulle est la référence testée, l'hypothèse alternative est ce que l'on cherche à démontrer ; la décision repose sur la p-valeur calculée à partir d'une statistique dont la distribution est souvent approchée par la loi normale centrée-réduite via le score z.
Probabilité : variables aléatoires et distribution
1. Variables aléatoires et distribution
a) Loi normale centrée réduite
- Loi normale centrée réduite : loi normale de moyenne et d'écart-type .
- La courbe de densité est symétrique autour de 0, avec une variance de 1.
- Les probabilités correspondent à des aires sous la courbe entre deux valeurs ou au-delà d'une valeur.
b) Transformation en score
-
Pour une variable de moyenne et écart-type , le score est défini par :
-
Permet de standardiser une variable pour utiliser la loi normale centrée réduite.
c) Interprétation des probabilités avec la loi normale
- Probabilité d'être au-dessus d'un score : aire sous la courbe de à .
- Probabilité d'être en dessous d'un score : aire sous la courbe de à .
- Probabilité d'être entre deux scores et : aire sous la courbe entre et .
d) Exemple : Quotient Intellectuel (QI)
-
QI suit une loi normale avec et .
-
Calcul du score pour un QI donné :
-
Pour :
-
Pour , le QI est :
-
-
Probabilités associées (via logiciel ou tables) :
Question Probabilité / Pourcentage 66% 84% 68% (QI très élevé) 0.1%
e) Utilisation pratique
- Les scores permettent de quantifier la position d’un individu dans une population.
- En psychologie, ils servent à comparer un patient à une norme populationnelle.
- Les probabilités associées aux scores aident à prendre des décisions cliniques.
La transformation en score standardise les données pour utiliser la loi normale centrée réduite et calculer facilement des probabilités associées à des scores donnés.
La loi normale et le théorème central-limite
1. Variable aléatoire et moyenne d’échantillon
- Un score individuel est une réalisation d’une variable aléatoire .
- La moyenne d’un échantillon est aussi une variable aléatoire : si on répète l’échantillonnage, varie.
- Ainsi, la moyenne d’un échantillon n’est pas fixe, mais suit une distribution de probabilité.
La moyenne d’un échantillon est une variable aléatoire qui suit une distribution dont il faut connaître les paramètres pour raisonner sur la population.
2. Distribution des moyennes d’échantillons
- Considérons une population avec moyenne et écart-type .
- On tire plusieurs échantillons de taille et calcule leurs moyennes .
- La distribution des est appelée distribution d’échantillonnage de la moyenne.
Propriétés clés :
| Propriété | Description |
|---|---|
| Moyenne de la distribution | Égale à la moyenne de la population : |
| Écart-type de la distribution | |
| Forme de la distribution | Approche une loi normale (Gaussienne) |
3. Loi normale (Gaussienne)
- La loi normale est une distribution continue en forme de cloche, caractérisée par deux paramètres : la moyenne et l’écart-type .
- Sa fonction de densité est donnée par :
- En psychologie, beaucoup de variables (QI, taille, etc.) suivent approximativement cette loi.
4. Théorème central limite (TCL)
- Énoncé : Pour une variable aléatoire de moyenne et variance finie , la distribution des moyennes d’échantillons de taille tend vers une loi normale lorsque est grand, quelle que soit la distribution initiale de .
- En pratique, pour , la distribution des moyennes est très proche d’une loi normale.
- Cela justifie l’usage de la loi normale pour modéliser la distribution des moyennes d’échantillons, même si la population n’est pas normale.
5. Conséquences pratiques
- La moyenne d’un échantillon suit une loi normale de moyenne et d’écart-type .
- On peut calculer la probabilité d’obtenir une moyenne d’échantillon donnée, ce qui permet de tester des hypothèses statistiques.
- Le TCL est la base des tests paramétriques (ex. test t) et des intervalles de confiance.
La distribution des moyennes d’échantillons est normale, centrée sur la moyenne de la population, avec un écart-type réduit par , ce qui permet d’inférer sur la population à partir d’un échantillon.
Score z et loi normale centrée-réduite
1. Loi normale centrée-réduite et score z
La loi normale est une distribution de probabilité continue, en forme de cloche, caractérisée par deux paramètres : la moyenne et l’écart-type . Elle est notée .
2. Distribution des moyennes d’échantillons
- On considère une population avec une loi normale .
- En tirant des échantillons de taille dans cette population, on obtient une distribution des moyennes d’échantillons .
- Cette distribution des moyennes suit elle-même une loi normale, appelée distribution d’échantillonnage de la moyenne.
Propriétés clés :
| Caractéristique | Population | Moyennes d’échantillons |
|---|---|---|
| Distribution | ||
| Moyenne | ||
| Écart-type (écart-type standard) |
- La moyenne des moyennes d’échantillons est égale à la moyenne vraie de la population.
- L’écart-type des moyennes d’échantillons est plus petit que celui de la population, il diminue avec la taille .
3. Score z (score standardisé)
Le score z permet de standardiser une valeur issue d’une distribution normale en une valeur centrée réduite, c’est-à-dire exprimée en nombre d’écarts-types par rapport à la moyenne.
- mesure la position relative de dans la distribution.
- La variable suit une loi normale centrée réduite (moyenne 0, écart-type 1).
- Cette transformation facilite la comparaison entre différentes distributions normales.
4. Loi normale centrée réduite
- La loi normale centrée réduite est la loi normale .
- Toute variable normale peut être transformée en variable par la formule du score z.
- Les tables de la loi normale centrée réduite permettent de calculer des probabilités et des quantiles.
5. Résumé des conclusions expérimentales (simulation)
- Distribution des échantillons : Les scores individuels dans un échantillon de taille suivent la loi normale initiale .
- Distribution des moyennes d’échantillons : La moyenne des échantillons fluctue autour de et suit une loi normale .
- Effet de la taille d’échantillon : Plus est grand, plus la distribution des moyennes est concentrée autour de (écart-type plus petit).
- Moyenne des moyennes : La moyenne des moyennes d’échantillons est égale à la moyenne vraie de la population.
La distribution des moyennes d’échantillons est une loi normale centrée sur la moyenne vraie de la population, avec un écart-type réduit proportionnel à .
6. Utilité pratique
- Le score z permet de comparer des valeurs issues de distributions normales différentes.
- La loi normale centrée réduite sert de référence pour estimer des probabilités et réaliser des tests statistiques.
- La compréhension de la distribution des moyennes d’échantillons est fondamentale pour l’inférence statistique (ex. estimation, tests d’hypothèse).
Distribution d'échantillonnage d'une moyenne
1. Distribution d'échantillonnage d'une moyenne
La distribution d’échantillonnage d’une moyenne décrit comment la moyenne d’échantillons tirés d’une population varie selon la taille des échantillons.
2. Effet de la taille de l’échantillon () sur la distribution d’échantillonnage
| Taille de l’échantillon | Moyenne des moyennes | Écart-type () | Variance () |
|---|---|---|---|
| 25 | 100 (constante) | Environ 3 | 9 |
| 75 | 100 (constante) | Environ 1.73 | 3 |
| 225 | 100 (constante) | Environ 1 | 1 |
- La moyenne des moyennes reste toujours égale à la moyenne vraie de la population, quelle que soit la taille de l’échantillon.
- L’écart-type de la distribution d’échantillonnage diminue lorsque la taille des échantillons augmente.
- La variance de la distribution d’échantillonnage diminue proportionnellement à l’augmentation de la taille des échantillons.
3. Relation fondamentale entre variance et taille d’échantillon
La variance de la distribution d’échantillonnage d’une moyenne est reliée à la variance de la population et à la taille de l’échantillon par la formule :
où :
- est la variance de la population,
- est la taille de l’échantillon,
- est la variance de la distribution d’échantillonnage de la moyenne.
À retenir : Plus la taille de l’échantillon augmente, plus la variance de la moyenne d’échantillon diminue, ce qui signifie que la moyenne d’échantillon est une estimation plus précise de la moyenne vraie de la population.
Variance de la distribution des moyennes
1. Variance de la distribution des moyennes
-
La variance de la distribution d’échantillonnage d’une moyenne () n’est pas égale à la variance vraie de la population ().
-
La moyenne de la distribution des moyennes est égale à la moyenne vraie du phénomène ().
-
Ainsi, la variable aléatoire représentant la moyenne d’un échantillon de taille suit la loi :
2. Relation entre variance vraie et variance de la distribution des moyennes
-
La variance de la distribution des moyennes est donnée par :
-
Cette formule signifie que la variance de la moyenne d’échantillon est la variance vraie divisée par la taille de l’échantillon.
-
Exemple : si (écart-type vrai), alors . Pour , on a :
-
L’écart-type de la distribution des moyennes (appelé erreur-type ou erreur-standard) est :
3. Interprétation et conséquences
| Paramètre | Description | Effet sur |
|---|---|---|
| (variance vraie) | Dispersion réelle dans la population | Plus est grand, plus est grand |
| (taille de l’échantillon) | Nombre d’observations dans l’échantillon | Plus est grand, plus diminue |
- Augmenter la taille de l’échantillon () réduit la variance de la moyenne, donc la variabilité des estimations diminue.
- Quand , , la moyenne d’échantillon converge vers la moyenne vraie.
- L’erreur-type mesure la qualité de l’estimation de la moyenne vraie : plus elle est petite, plus l’estimation est précise.
La variance de la distribution des moyennes est égale à la variance vraie divisée par la taille de l’échantillon, ce qui explique que la précision de la moyenne augmente avec la taille de l’échantillon.