DataManip Insights ÉPISODE 1 Nouvelle série · Physics for Data Gratuit
🎲 Épisode 1 · Mesurer l'incertitude

Entropie &
Information

Un réseau de neurones et un gaz parfait obéissent à la même loi mathématique. Un simple dé truqué suffit pour comprendre pourquoi.

🎯 L'analogie clé

Un dé qui tombe toujours sur le même chiffre ne surprend jamais — il ne "contient" aucune information. Un dé parfaitement équilibré, lui, est le plus imprévisible possible : chaque lancer est une vraie surprise.
L'entropie est exactement ça : une mesure de surprise moyenne. Boltzmann l'a inventée pour compter les états d'un gaz. Shannon, 70 ans plus tard, a redécouvert la même formule pour compter des messages. Aujourd'hui, elle est au cœur de la fonction de coût qui entraîne la quasi-totalité des modèles de classification.

Deux formules, une seule idée

Boltzmann comptait des particules.
Shannon comptait des messages.

Un siècle sépare ces deux formules. Elles décrivent pourtant exactement la même chose : le nombre de configurations possibles d'un système, pondérées par leur probabilité.

Entropie de Shannon — théorie de l'information (1948) :
H = − Σ p(x) · log₂ p(x)
Entropie de Boltzmann — thermodynamique statistique (1877) :
S = k · log(W)
H (Shannon)
Nombre moyen de bits nécessaires pour encoder un résultat tiré de la distribution p. Se mesure en bits.
S (Boltzmann)
W = nombre de micro-états compatibles avec l'état macroscopique observé. k = constante de Boltzmann.
Le dé à 4 faces — règle chaque probabilité
Entropie H
Configurations effectives (2^H)
Entropie max possible
2.00 bits
Baisse une face à 0% : l'entropie chute. Remonte tout à 25% : elle revient à 2 bits — exactement log₂(4), le maximum théorique pour 4 issues.

Du texte à la génétique,
la même mesure revient partout.

Dès qu'un système a plusieurs états possibles avec des probabilités différentes, l'entropie donne une mesure universelle de son imprévisibilité.

🔤
Lettres d'une langue
H ≈ 4.1 bits / lettre (français)
Le "e" est bien plus fréquent que le "z" — l'entropie du français est plus basse que celle d'une distribution uniforme sur 26 lettres (log₂26 ≈ 4.7 bits), signe d'une structure exploitable pour la compression.
🧬
Position génétique
4 bases (A,T,C,G)
Une position très conservée dans l'évolution a une entropie proche de 0 (presque toujours la même base). Une position variable approche log₂(4) = 2 bits.
🤖
Sortie d'un classifieur
Confiance du modèle
Un modèle sûr de lui produit une distribution de probabilité à faible entropie (un pic net). Un modèle hésitant produit une entropie élevée — c'est un signal direct d'incertitude, utilisé en production pour déclencher une revue humaine.
Passer à l'implémentation

La fonction de coût la plus utilisée
en machine learning est une entropie.

Quand un modèle de classification est entraîné avec une cross-entropy loss, il minimise littéralement une quantité d'information — pas une formule choisie au hasard.

Python · entropie.py
import numpy as np

# dé équilibré vs dé truqué
p_equilibre = np.array([0.25, 0.25, 0.25, 0.25])
p_truque    = np.array([0.70, 0.15, 0.10, 0.05])

def entropie(p):
    return -np.sum(p * np.log2(p))

print(f"Équilibré : {entropie(p_equilibre):.2f} bits")  # → 2.00 bits (maximum)
print(f"Truqué :    {entropie(p_truque):.2f} bits")     # → 1.35 bits

📌 À retenir

Prochain épisode · Série Physics for Data
Marche aléatoire & Diffusion
Du mouvement brownien d'une particule de pollen aux modèles de génération d'images.
Comment le bruit aléatoire devient un outil de calcul.