La statistique est une discipline fondamentale en sciences, en économie, en sciences sociales et dans de nombreux autres domaines, offrant des outils pour collecter, organiser, analyser et interpréter des données. Au cœur de cette discipline se trouvent les variables statistiques, qui représentent les caractéristiques mesurées ou observées sur des individus ou des unités d'étude. Comprendre leurs types et leurs propriétés est une étape indispensable pour toute analyse statistique rigoureuse, car la nature d'une variable dicte les méthodes d'analyse pertinentes et les conclusions qui peuvent en être tirées. Cette fiche explorera les définitions fondamentales, la typologie des variables, leurs échelles de mesure, les méthodes de collecte et de présentation, ainsi que les implications de leur nature sur l'analyse statistique, en offrant une approche complète pour maîtriser ces concepts essentiels.
Variable statistique
Caractéristique ou attribut qui peut prendre différentes valeurs au sein d'une population ou d'un échantillon.
Population
Ensemble complet de toutes les unités d'intérêt (individus, objets, événements) sur lesquelles porte une étude statistique.
Échantillon
Sous-ensemble représentatif de la population, sélectionné pour l'étude et utilisé pour inférer des propriétés de la population d'origine.
Donnée brute
Ensemble des valeurs observées ou mesurées pour une variable statistique avant toute forme de traitement ou d'analyse.
Modalité
Chaque valeur distincte que peut prendre une variable statistique, qu'elle soit qualitative ou quantitative.
Fréquence
Nombre d'occurrences ou proportion d'une modalité donnée d'une variable au sein d'un ensemble de données.
Échelle de mesure
Système de classification qui détermine la nature des informations contenues dans les données et, par conséquent, les types d'opérations mathématiques et d'analyses statistiques qui peuvent être légitimement appliqués.
Statistique descriptive
Branche de la statistique qui vise à résumer et à organiser les données pour en extraire l'information essentielle sans tirer de conclusions sur une population plus large.
Statistique inférentielle
Branche de la statistique qui utilise les données d'un échantillon pour faire des prédictions ou des généralisations sur une population plus vaste, en tenant compte de l'incertitude.
Typologie des variables statistiques
La distinction fondamentale en statistique réside entre les variables qualitatives et les variables quantitatives. Cette classification n'est pas une simple formalité ; elle conditionne l'ensemble du processus d'analyse, depuis la collecte des données jusqu'à l'interprétation des résultats. Une variable qualitative décrit une qualité ou une catégorie et ne peut être mesurée numériquement de manière significative, tandis qu'une variable quantitative exprime une quantité mesurable et peut être soumise à des opérations arithmétiques. Comprendre cette dichotomie est la première étape pour choisir les méthodes d'analyse appropriées.
Les variables qualitatives, aussi appelées catégorielles, se subdivisent en deux types principaux. Les variables nominales sont celles dont les modalités sont de simples étiquettes sans ordre intrinsèque. Par exemple, la couleur des yeux (bleu, marron, vert) ou le genre (masculin, féminin) sont des variables nominales. On ne peut pas affirmer qu'une modalité est « supérieure » ou « inférieure » à une autre. Les variables ordinales, en revanche, ont des modalités qui peuvent être classées ou ordonnées logiquement. Le niveau de satisfaction (très insatisfait, insatisfait, neutre, satisfait, très satisfait) ou la catégorie socio-professionnelle (ouvrier, employé, cadre) sont des exemples de variables ordinales. Bien qu'il y ait un ordre, l'intervalle entre les catégories n'est pas nécessairement constant ou mesurable.
Les variables quantitatives, quant à elles, se divisent également en deux catégories. Les variables discrètes sont celles qui ne peuvent prendre qu'un nombre fini ou dénombrable de valeurs, généralement des nombres entiers, résultant souvent d'un comptage. Le nombre d'enfants dans une famille ou le nombre de voitures possédées sont des exemples de variables discrètes. On ne peut pas avoir 2,5 enfants. Les variables continues, par contraste, peuvent prendre n'importe quelle valeur au sein d'un intervalle donné, généralement le résultat d'une mesure et non d'un comptage. La taille (175,3 cm), le poids (72,8 kg) ou la température (25,7°C) sont des exemples de variables continues. En théorie, il existe une infinité de valeurs possibles entre deux points donnés.
Il est crucial de ne pas confondre une variable quantitative discrète avec une variable qualitative ordinale, même si les modalités d'une ordinale peuvent parfois être représentées par des chiffres (ex: niveau de douleur sur une échelle de 1 à 10). La différence réside dans la signification des intervalles. Pour une discrète, l'écart entre 1 et 2 est le même qu'entre 2 et 3. Pour une ordinale, l'écart perçu entre « léger » et « modéré » n'est pas nécessairement équivalent à celui entre « modéré » et « sévère », même si on les code numériquement 1, 2, 3. La nature fondamentale de la mesure, comptage ou classement subjectif, doit guider la classification.
Les échelles de mesure de Stevens
Les échelles de mesure, formalisées par Stanley Smith Stevens, sont un cadre essentiel pour comprendre les propriétés des variables statistiques et, par extension, les opérations mathématiques et les tests statistiques qui leur sont applicables. Elles classifient les données en fonction de la quantité d'information qu'elles contiennent et des relations entre leurs modalités. Il existe quatre types d'échelles : nominale, ordinale, d'intervalle et de ratio. Chaque échelle supérieure inclut les propriétés de l'échelle précédente, augmentant ainsi la richesse de l'information disponible.
L'échelle nominale est la plus élémentaire et correspond aux variables qualitatives nominales. Elle permet uniquement de catégoriser les données en groupes distincts et mutuellement exclusifs. Les seules opérations possibles sont l'égalité ou l'inégalité. Par exemple, les codes postaux ou les numéros de sécurité sociale sont des variables nominales : ils identifient des entités sans impliquer d'ordre ni de grandeur. Les statistiques descriptives pertinentes sont le mode et les fréquences (absolues et relatives). Les tests non paramétriques comme le Chi-deux sont adaptés à ce niveau de mesure.
L'échelle ordinale introduit la notion d'ordre ou de classement entre les catégories, sans pour autant quantifier les différences entre elles. Elle correspond aux variables qualitatives ordinales. On peut dire qu'une modalité est « plus grande » ou « plus petite » qu'une autre. Les classements scolaires (premier, deuxième, troisième) ou les échelles de Likert (tout à fait d'accord, d'accord, neutre, pas d'accord, pas du tout d'accord) sont des exemples. Au-delà du mode et des fréquences, la médiane devient une mesure de tendance centrale pertinente. Des tests non paramétriques comme le test de rang de Wilcoxon sont appropriés, mais les opérations arithmétiques directes (addition, soustraction) entre les valeurs n'ont pas de sens.
L'échelle d'intervalle possède les propriétés de l'échelle ordinale mais ajoute la notion que les intervalles entre les valeurs sont égaux et significatifs. La différence entre deux points de l'échelle a une signification constante. Un point zéro existe, mais il est arbitraire et ne représente pas l'absence de la caractéristique mesurée. La température en degrés Celsius ou Fahrenheit est le cas d'étude classique : l'écart entre 10°C et 20°C est le même qu'entre 20°C et 30°C, mais 0°C ne signifie pas l'absence totale de chaleur. L'addition et la soustraction sont valides, ce qui permet de calculer la moyenne et l'écart-type. Les tests paramétriques comme le test t ou l'ANOVA peuvent être utilisés, mais les rapports (par exemple, 20°C n'est pas « deux fois plus chaud » que 10°C) n'ont pas de sens.
L'échelle de ratio est la plus informative et incorpore toutes les propriétés des échelles précédentes, en y ajoutant un zéro absolu, qui indique l'absence totale de la caractéristique mesurée. Le rapport entre deux valeurs est donc significatif. La taille, le poids, le revenu, le nombre d'heures travaillées sont des exemples de variables mesurées sur une échelle de ratio. Une personne de 180 cm est bien « deux fois plus grande » qu'une personne de 90 cm. Toutes les opérations arithmétiques sont valides, y compris la multiplication et la division, permettant l'utilisation de toutes les statistiques descriptives et inférentielles possibles, y compris les coefficients de variation ou la régression linéaire. C'est l'échelle qui offre le plus grand potentiel d'analyse statistique.
Collecte et présentation des données
La qualité de l'analyse statistique dépend intrinsèquement de la manière dont les données sont collectées. Un protocole de collecte mal défini peut introduire des biais irréparables, rendant toute conclusion potentiellement erronée. Le choix des instruments de mesure (questionnaires, capteurs, bases de données existantes) doit être adapté au type de variable et à l'objectif de l'étude. Pour les variables qualitatives, l'attention se porte sur la clarté des catégories de réponse, tandis que pour les variables quantitatives, la précision et l'exactitude de la mesure sont primordiales. Un échantillonnage rigoureux est également essentiel pour garantir la représentativité des données par rapport à la population cible.
Une fois collectées, les données brutes nécessitent une organisation et une présentation claires pour faciliter leur analyse. La première étape est souvent la création d'un tableau de fréquences. Pour une variable qualitative nominale, ce tableau listera chaque modalité avec son effectif (nombre d'observations) et sa fréquence relative (pourcentage). Par exemple, pour une variable « couleur préférée » : Rouge (15, 30%), Bleu (20, 40%), Vert (10, 20%), Jaune (5, 10%). Pour une ordinale, l'ordre des modalités sera respecté. Pour les variables quantitatives discrètes, le principe est similaire, chaque valeur observée étant traitée comme une modalité. Pour les variables quantitatives continues, il est souvent nécessaire de regrouper les données en classes ou intervalles avant de construire le tableau de fréquences, afin de synthétiser l'information sans perdre de vue sa distribution.
La présentation graphique des données est tout aussi cruciale pour la compréhension rapide des tendances et des distributions. Pour les variables qualitatives (nominales ou ordinales), les diagrammes en barres ou les diagrammes circulaires (camemberts) sont les plus appropriés. Un diagramme en barres représente chaque modalité par une barre dont la hauteur est proportionnelle à l'effectif ou à la fréquence. Un diagramme circulaire montre la proportion de chaque modalité par rapport au total. Pour les variables quantitatives, les histogrammes sont utilisés pour les variables continues regroupées en classes, tandis que les diagrammes en bâtons sont privilégiés pour les variables discrètes. Ces visualisations permettent de détecter rapidement la forme de la distribution, la présence de valeurs aberrantes ou les concentrations de données.
Un exemple concret illustre l'importance de ces étapes. Supposons une étude sur le nombre de prêts immobiliers accordés par une banque sur un mois (variable quantitative discrète) et la satisfaction de la clientèle (variable qualitative ordinale: Très insatisfait à Très satisfait). Les données brutes des prêts pourraient être : 5, 8, 12, 5, 6, 9, 8, etc. Celles de la satisfaction : Satisfait, Neutre, Très insatisfait, Satisfait, etc. Un tableau de fréquences pour les prêts pourrait regrouper 0-4, 5-9, 10-14, 15+ prêts, tandis que pour la satisfaction, il listerait chaque modalité ordonnée. Un histogramme des prêts révélera la distribution des activités de prêt, et un diagramme en barres de la satisfaction montrera les niveaux de contentement des clients, informations essentielles pour la gestion bancaire.
Mesures de tendance centrale et de dispersion
Les mesures de tendance centrale et de dispersion sont des statistiques descriptives fondamentales qui permettent de résumer un ensemble de données et d'en comprendre les caractéristiques principales. Les mesures de tendance centrale (moyenne, médiane, mode) indiquent où se situe le « centre » des données, tandis que les mesures de dispersion (étendue, variance, écart-type, écart interquartile) quantifient la variabilité ou l'étalement des données autour de ce centre. Le choix de la mesure la plus pertinente dépend directement du type de variable et de son échelle de mesure.
Le mode est la valeur ou la modalité qui apparaît le plus fréquemment dans un ensemble de données. C'est la seule mesure de tendance centrale pertinente pour les variables nominales, mais elle peut être utilisée pour tous les types de variables. Une distribution peut avoir un mode (unimodale), plusieurs modes (multimodale) ou aucun mode si toutes les valeurs sont uniques. La médiane est la valeur qui divise l'ensemble des données ordonnées en deux parties égales, de sorte que 50% des observations sont inférieures ou égales à cette valeur, et 50% sont supérieures ou égales. Elle est pertinente pour les variables ordinales, d'intervalle et de ratio, étant moins sensible aux valeurs extrêmes que la moyenne. Enfin, la moyenne arithmétique est la somme de toutes les valeurs divisée par le nombre total d'observations. C'est la mesure la plus couramment utilisée pour les variables d'intervalle et de ratio, mais elle est très sensible aux valeurs aberrantes.
Les mesures de dispersion complètent l'information fournie par les mesures de tendance centrale. L'étendue est la différence entre la valeur maximale et la valeur minimale d'un ensemble de données ; elle donne une idée rapide de l'intervalle de variation mais est très sensible aux valeurs extrêmes. L'écart interquartile (EIQ) est la différence entre le troisième quartile (Q3) et le premier quartile (Q1), et représente l'étendue des 50% centraux des données, le rendant plus robuste aux valeurs aberrantes. La variance mesure la dispersion des données par rapport à la moyenne, en calculant la moyenne des carrés des écarts à la moyenne. L'écart-type est la racine carrée de la variance, et est exprimé dans la même unité que la variable d'origine, ce qui le rend plus interprétable que la variance.
Il est crucial d'adapter ces mesures à l'échelle de la variable. Pour une variable nominale comme le genre, seule la fréquence du mode (ex: « féminin » est la modalité la plus fréquente) a un sens. Calculer une moyenne pour des genres serait absurde. Pour une variable ordinale comme le niveau de satisfaction (Très faible = 1, Faible = 2, Moyenne = 3, Forte = 4, Très forte = 5), la médiane est informative (ex: la médiane est « Moyenne »), mais la moyenne pourrait induire en erreur si les intervalles entre les catégories ne sont pas égaux. Pour des variables de ratio comme l'âge, toutes les mesures sont appropriées : moyenne, médiane, mode, étendue, écart-type et variance peuvent toutes être calculées et interprétées de manière significative, offrant une vue complète de la distribution des âges.
Limites et pièges des variables statistiques
Malgré leur utilité, les variables statistiques présentent des limites et peuvent être source de pièges si elles ne sont pas manipulées avec rigueur. Une erreur courante est de traiter une variable qualitative ordinale comme une variable quantitative d'intervalle, notamment en lui attribuant des valeurs numériques et en calculant une moyenne. Par exemple, attribuer des scores de 1 à 5 à une échelle de satisfaction et calculer une moyenne de 3,2 suppose que la différence entre « insatisfait » (2) et « neutre » (3) est la même que celle entre « neutre » (3) et « satisfait » (4), ce qui n'est pas nécessairement vrai psychométriquement. Cela peut conduire à des interprétations erronées sur la signification de cette moyenne.
Un autre piège est la mauvaise définition opérationnelle des variables. Si une variable n'est pas clairement définie, ou si ses modalités ne sont pas mutuellement exclusives ou exhaustivement couvrantes, les données collectées seront de mauvaise qualité. Par exemple, si une question demande « Êtes-vous satisfait ? » avec les options « Oui » et « Non », cela ne permet pas de capturer les nuances de la satisfaction ou l'absence d'opinion. De même, les biais de mesure peuvent altérer la validité des données. Cela inclut les biais de désirabilité sociale (les répondants donnent des réponses qu'ils jugent acceptables socialement), les biais de rappel (difficulté à se souvenir précisément d'événements passés), ou des instruments de mesure mal calibrés.
La confusion entre corrélation et causalité est également un écueil majeur, surtout lorsque l'on analyse des relations entre variables. Ce n'est pas parce que deux variables varient ensemble (sont corrélées) qu'une cause l'autre. Une troisième variable, non observée (variable confondante), pourrait être à l'origine de la relation observée. Par exemple, on peut observer une corrélation positive entre la consommation de crème glacée et le nombre de noyades. Il serait erroné de conclure que la crème glacée cause les noyades ; la variable confondante est la température estivale, qui augmente à la fois la consommation de crème glacée et la fréquentation des zones de baignade. Une analyse multivariée rigoureuse est souvent nécessaire pour démêler ces relations.
Enfin, la généralisation abusive des résultats d'un échantillon à une population est un risque si l'échantillon n'est pas représentatif. Si un échantillon n'est pas sélectionné de manière aléatoire ou s'il souffre de biais de sélection (par exemple, un sondage en ligne qui ne touche que des personnes ayant accès à internet), les conclusions tirées sur la population entière seront invalides. Les limites de l'inférence statistique sont directement liées à la qualité de l'échantillon et à la rigueur de la méthodologie de collecte et d'analyse des variables. Il est impératif de toujours spécifier les limites de généralisation des résultats d'une étude.
Analyse des relations entre variables
L'analyse statistique ne se limite pas à la description de variables individuelles ; elle vise souvent à comprendre les relations et les associations entre plusieurs variables. Le choix des méthodes d'analyse bivariée ou multivariée dépend de la nature (qualitative ou quantitative) et de l'échelle de mesure des variables impliquées. L'objectif est de déceler des schémas, de tester des hypothèses et, si possible, de construire des modèles prédictifs.
Lorsque les deux variables sont qualitatives, on utilise généralement des tableaux de contingence pour afficher la distribution conjointe des fréquences. Le test du Chi-deux (χ²) est l'outil statistique le plus courant pour déterminer s'il existe une association significative entre les deux variables nominales ou ordinales. Si l'on s'intéresse à la relation entre une variable qualitative et une variable quantitative, des techniques comme l'analyse de la variance (ANOVA) ou des tests t sont employées. Par exemple, pour savoir si le revenu moyen (quantitative) diffère significativement entre différentes catégories socio-professionnelles (qualitative), l'ANOVA serait appropriée. Si la variable qualitative est dichotomique (deux catégories), un test t est suffisant.
Pour analyser la relation entre deux variables quantitatives, la visualisation initiale se fait souvent via un nuage de points (diagramme de dispersion). Ce graphique permet d'observer la direction (positive ou négative), la forme (linéaire ou non) et la force de la relation. Le coefficient de corrélation de Pearson est la mesure standard pour quantifier la force et la direction d'une relation linéaire entre deux variables de ratio ou d'intervalle. Sa valeur varie de -1 (corrélation linéaire négative parfaite) à +1 (corrélation linéaire positive parfaite), 0 indiquant l'absence de corrélation linéaire. La régression linéaire simple est ensuite utilisée pour modéliser cette relation, permettant de prédire la valeur d'une variable à partir de l'autre.
Un exemple illustre bien la démarche. Imaginons que nous voulions étudier la relation entre le nombre d'heures d'étude hebdomadaires (quantitative, ratio) et la note obtenue à un examen (quantitative, ratio). Nous commencerions par un nuage de points pour visualiser la tendance. Si une relation linéaire positive apparaît, nous calculerions le coefficient de corrélation de Pearson. Si ce coefficient est élevé, nous pourrions ensuite ajuster un modèle de régression linéaire pour estimer la note d'examen en fonction des heures d'étude. Ce modèle pourrait prédire, par exemple, qu'une heure d'étude supplémentaire est associée à une augmentation de 0,5 point à l'examen. Si nous souhaitions comparer les notes entre des étudiants ayant suivi différentes méthodes d'apprentissage (qualitative nominale), nous utiliserions une ANOVA pour déterminer si les moyennes de notes diffèrent significativement entre les groupes de méthodes.
f(x) = 0.5 * x + 5
Exemple de régression linéaire positive
A retenir :
À retenir :
- Les variables statistiques sont classées en qualitatives (nominales, ordinales) et quantitatives (discrètes, continues), ce qui détermine les méthodes d'analyse.
- Les échelles de mesure (nominale, ordinale, d'intervalle, de ratio) définissent la quantité d'information des données et les opérations mathématiques permises.
- La collecte de données doit être rigoureuse et représentative ; la présentation passe par des tableaux de fréquences et des graphiques adaptés (diagrammes en barres/circulaires pour qualitatif, histogrammes/bâtons pour quantitatif).
- Les mesures de tendance centrale (mode, médiane, moyenne) et de dispersion (étendue, EIQ, variance, écart-type) résument les données, mais leur pertinence varie selon le type de variable.
- Attention aux pièges : ne pas traiter une variable ordinale comme une quantitative, définir clairement les variables, éviter les biais de mesure et ne pas confondre corrélation et causalité.
- L'analyse des relations entre variables utilise des outils adaptés : Chi-deux pour deux qualitatives, ANOVA/tests t pour qualitative-quantitative, corrélation/régression pour deux quantitatives.
- Un zéro absolu distingue l'échelle de ratio de l'échelle d'intervalle, permettant des comparaisons de rapports significatives.
- La moyenne est sensible aux valeurs extrêmes, contrairement à la médiane, qui est plus robuste pour les distributions asymétriques ou avec des outliers.
- La variance et l'écart-type quantifient la dispersion autour de la moyenne, l'écart-type étant dans la même unité que la variable.
- L'inférence statistique n'est valide que si l'échantillon est représentatif de la population étudiée.
