DataManip Insights ÉPISODE 1 Nouvelle série · Les Fondamentaux de la Statistique
📊 Épisode 1 · Résumer un monde de chiffres

Statistiques
Descriptives

Un jeu de données brut, c'est une foule illisible. La statistique descriptive trouve les quelques nombres qui racontent son histoire — son centre, sa dispersion, sa forme.

🎯 L'analogie clé

Sur une planche de Galton, chaque bille dévale une rangée de clous et part au hasard, à gauche ou à droite. Une seule bille est totalement imprévisible. Mais des milliers de billes empilées dessinent toujours la même courbe en cloche.
C'est tout le projet de la statistique descriptive : transformer le chaos individuel d'une donnée brute en une forme collective lisible — un centre, une largeur, une silhouette.

Trouver le centre

Trois façons de définir
le centre d'un nuage de points.

Moyenne, médiane, mode : trois réponses différentes à la même question. Elles coïncident souvent — et divergent violemment dès qu'une valeur extrême s'invite dans les données.

Moyenne arithmétique :
x̄ = (Σxᵢ) / n
Moyenne
Centre de gravité des valeurs. Sensible aux valeurs extrêmes — une seule très grande valeur la déplace fortement.
Médiane
Valeur du milieu une fois les données triées. Ne regarde que le rang, pas l'ampleur — robuste aux outliers.
Mode
Valeur (ou catégorie) la plus fréquente. La seule utilisable sur des données non numériques.
La salle qui change de moyenne
Moyenne ▲
Médiane ┃
Écart moyenne−médiane
Fais glisser un point sur la règle. Regarde lequel des deux repères bouge le plus quand tu ajoutes un salaire extrême.

Même centre,
dispersion radicalement différente.

Deux archers peuvent viser exactement le même centre de cible. L'un touche un groupe serré, l'autre éparpille ses flèches sur toute la cible. Le centre ne dit rien de cette différence — la dispersion, si.

Variance & écart-type :
σ² = Σ(xᵢ − x̄)² / n  ·  σ = √σ²
On élève les écarts au carré pour empêcher les écarts positifs et négatifs de s'annuler, et pénaliser davantage les grands écarts. L'écart-type revient dans l'unité d'origine des données.
La cible de l'archer — règle la précision
Précision du tir
15
Distance moyenne au centre
Variance
Écart-type
Découper en quatre

La boîte à moustaches :
un résumé visuel en 5 nombres.

Imagine cent coureurs classés à l'arrivée d'un marathon. Le premier quartile (Q1) est la position du 25ᵉ : un quart du peloton est devant lui. La médiane est le 50ᵉ, le troisième quartile (Q3) le 75ᵉ. Ces trois bornes découpent la course en quatre groupes égaux.

Intervalle interquartile & seuil d'anomalie :
IQR = Q3 − Q1  ·  seuils = Q1 − 1.5·IQR / Q3 + 1.5·IQR
L'IQR contient la moitié centrale du peloton — ni les têtes de course, ni les retardataires. Tout point au-delà de 1.5×IQR de la boîte est considéré comme une valeur aberrante.
Construis ta boîte à moustaches
Q1
Médiane
Q3
IQR
Valeurs aberrantes

La forme compte
autant que la position.

Une distribution symétrique ressemble à une colline régulière — moyenne, médiane et mode se superposent au sommet. Une distribution asymétrique ressemble à une colline avec une longue pente d'un seul côté, qui tire la moyenne loin du sommet le plus fréquenté.

Trois reliefs, trois histoires
💶
Revenus d'un pays
Asymétrie à droite
La plupart des salaires sont modestes, une minorité très élevée étire la queue vers la droite. La moyenne dépasse largement la médiane.
Âge au décès
Asymétrie à gauche
Dans une population à forte espérance de vie, les décès se concentrent à un âge avancé, avec une traîne plus courte de décès précoces.
📝
Notes à un examen standard
Souvent symétrique
Quand un contrôle est bien calibré, les résultats se répartissent en cloche autour de la moyenne — c'est même un critère de qualité du contrôle.
Passer à l'implémentation

Toutes ces mesures,
en trois lignes de code.

numpy, pandas et scipy calculent en une ligne ce que ce cours vient de construire pas à pas. Voir la formule tourner sur de vraies données ferme la boucle.

Python · mesures_centrales.py
import numpy as np
from scipy import stats

notes = np.array([8, 10, 11, 12, 13, 14, 15, 17])

moyenne = np.mean(notes)
mediane = np.median(notes)
mode    = stats.mode(notes, keepdims=True).mode[0]

print(f"Moyenne={moyenne:.2f}, Médiane={mediane:.2f}, Mode={mode}")

# ── Avec un salaire extrême ajouté ──────────────────────
salaires = np.array([28,32,35,38,41,45,52,450])  # le patron rejoint le groupe
print(f"Moyenne={salaires.mean():.1f}k€  vs  Médiane={np.median(salaires):.1f}k€")
# → la moyenne explose, la médiane bouge à peine : robustesse aux outliers

📌 À retenir

Prochain épisode · Série Les Fondamentaux de la Statistique
Probabilités & Lois
Du hasard d'un tirage à la forme d'une distribution.
Variables aléatoires, loi normale, loi binomiale — les briques qui préparent les tests statistiques.