Les Fondamentaux de la Statistique
10 épisodesDe la moyenne au machine learning : statistiques descriptives, probabilités, tests d'hypothèse, régression et ACP.
Statistiques Descriptives
Moyenne, médiane, variance, quartiles — résumer un jeu de données en quelques nombres.
🔒 Épisode 2Probabilités & Lois
Loi des grands nombres, loi binomiale, loi normale, et le piège du théorème de Bayes.
🔒 Épisode 3Échantillonnage & Intervalle de Confiance
Théorème central limite, erreur type, et comment encadrer une estimation.
🔒 Épisode 4Tests d'Hypothèse & p-value
H0, p-value, erreurs de type I et II — décider si un effet est réel ou dû au hasard.
🔒 Épisode 5ANOVA & Comparaisons Multiples
Comparer plus de deux groupes sans faire exploser le risque de fausse alerte.
🔒 Épisode 6Régression & Corrélation
Coefficient r, droite des moindres carrés, résidus, R² — et le piège corrélation/causalité.
🔒 Épisode 7Régression Multiple & Multicolinéarité
Combiner plusieurs variables explicatives, et gérer le piège des prédicteurs redondants.
🔒 Épisode 8Analyse Multivariée & ACP
Résumer des variables corrélées en quelques composantes principales, sans perdre l'essentiel.
🔒 Épisode 9Machine Learning & Python
Train/test split, sur-apprentissage, validation croisée — assembler tous les fondamentaux.
🔒 Épisode 10Séries Temporelles et Prévision
Décomposition tendance/saisonnalité/résidu, stationnarité, et panorama des 20 modèles de prévision — d'ARIMA au deep learning.
Finance Quantitative
9 épisodesLes mêmes outils statistiques appliqués aux marchés : risque, diversification, dérivés et décision automatisée.
Finance Quantitative
Intérêt composé, rendement et risque, diversification — les fondations mathématiques de l'investissement.
🔒 Épisode 2Ratio de Sharpe & Frontière Efficiente
Comparer des investissements par leur rendement ET leur risque, pas l'un sans l'autre.
🔒 Épisode 3Value at Risk & Gestion du Risque
Un seuil de perte statistique, et pourquoi les queues épaisses trompent les modèles paramétriques.
🔒 Épisode 4Séries Temporelles Financières
Autocorrélation, clustering de volatilité, moyennes mobiles — la mémoire cachée des marchés.
🔒 Épisode 5Introduction aux Produits Dérivés
Options, payoff, Black-Scholes — le droit sans l'obligation, et le prix de ce droit.
🔒 Épisode 6Corrélation & Contagion en Période de Crise
Pourquoi la diversification déçoit exactement quand on compte le plus dessus.
🔒 Épisode 7Trading Algorithmique
Transformer un signal statistique en règle de décision, et backtester honnêtement une stratégie.
🔒 Épisode 8Trading Haute Fréquence & Microstructure
Carnet d'ordres, spread bid-ask, impact de marché — l'anatomie cachée d'un "prix".
🔒 Épisode 9Cryptomonnaies & Finance Décentralisée
Volatilité extrême, teneurs de marché automatisés — les mêmes maths, une infrastructure nouvelle.
Physics for Data
10 épisodes + 1 bonusEntropie, diffusion, Fourier, physique statistique : les mêmes lois qui expliquent la matière expliquent aussi le machine learning.
Entropie & Information
Pourquoi un réseau de neurones et un gaz parfait obéissent à la même loi mathématique.
🔒 Épisode 2Marche Aléatoire & Diffusion
Du mouvement brownien d'une particule de pollen aux modèles de génération d'images.
🔒 Épisode 3Fourier & Analyse du Signal
Pourquoi ton assistant vocal, un ECG et une prévision météo décomposent le même type de signal.
🔒 Épisode 4Physique Statistique & Softmax
La fonction softmax d'un réseau de neurones a exactement la forme de la distribution de Boltzmann.
🔒 Épisode 5Mécanique des Systèmes Dynamiques
Pourquoi l'entraînement d'un réseau de neurones peut diverger, comme un pendule chaotique.
🔒 Épisode 6Simulation Monte Carlo
Comment les physiciens des années 1940 ont inventé la méthode que Wall Street utilise aujourd'hui.
🔒 Épisode 7Optimisation & Moindre Action
Pourquoi un rayon de lumière et une descente de gradient résolvent le même type de problème.
Gratuit Épisode 8Réseaux & Percolation
Pourquoi un réseau électrique qui tombe en panne en cascade et une rumeur virale obéissent à la même loi.
🔒 Épisode 9Physique des Files d'Attente
Pourquoi une file d'attente et un serveur informatique obéissent à la même loi mathématique.
🔒 Épisode 10Deep Learning & PINNs
Et si un réseau de neurones pouvait apprendre à respecter les lois de la physique, sans données ?
Bonus Épisode bonusValeurs Propres & Stabilité du Réseau Électrique
Pourquoi un réseau électrique tient... jusqu'à ce qu'il ne tienne plus. Manipulez 4 simulateurs interactifs.
Bonnes Pratiques en Analyse de Données
1 épisode Hors-sérieUn format ponctuel, pas une série de fond : prendre du recul sur les pièges qui reviennent, quel que soit le sujet étudié.
Machine Learning Fondamentaux
13 épisodesBiais-variance, Naive Bayes, malédiction de la dimension : les mécanismes derrière les modèles, expliqués avec des simulateurs qu'on manipule soi-même.
Biais & Variance
Pourquoi un modèle parfait sur ses données d'entraînement peut être un très mauvais modèle.
🔒 Épisode 2Naive Bayes
Une hypothèse d'indépendance presque toujours fausse — et un classificateur qui marche quand même.
🔒 Épisode 3La Malédiction de la Dimension
Pourquoi ajouter des variables à un modèle peut le rendre pire, pas meilleur.
🔒 Épisode 4Le Gradient qui Disparaît
Pourquoi les réseaux profonds ont mis 30 ans à devenir entraînables.
🔒 Épisode 5Arbres, Forêts & le Pouvoir du Vote
Bagging, Random Forest, et pourquoi voter à plusieurs modèles bat un seul expert.
🔒 Épisode 6La Régularisation
Pourquoi punir son propre modèle pendant l'entraînement le rend meilleur en production.
🔒 Épisode 7Le Test du Khi-2
Le détective statistique des tableaux de contingence.
🔒 Épisode 8La Loi des Grands Nombres & le Paradoxe du Parieur
Pourquoi l'intuition d'un joueur de casino trompe presque toujours.
🔒 Épisode 9Cross-Validation
Pourquoi une seule mesure de performance ment presque toujours.
🔒 Épisode 10Du Perceptron au Transformer
Une frise historique des réseaux de neurones, des origines aux modèles actuels.
🔒 Épisode 11Matrice de Confusion
Mon modèle a raison à 95% — est-ce vraiment bon ? Pourquoi un pourcentage seul ne dit rien.
🔒 Épisode 12Courbe ROC & AUC
Comparer deux modèles sans même choisir de seuil.
🔒 Épisode 13SHAP & Explicabilité
Le modèle dit 77% de risque. Mais pourquoi, exactement, pour cette ligne précise ?
Deep Learning & Réseaux de Neurones
10 épisodes Nouvelle sérieDu perceptron aux transformers : comment empiler des couches et des non-linéarités transforme une simple ligne droite en un outil capable d'apprendre presque n'importe quoi.
Du Neurone au Réseau
Pourquoi un neurone seul ne peut tracer qu'une ligne droite, et pourquoi empiler des neurones change tout.
🔒 Épisode 2Fonctions d'Activation
Sigmoïde, ReLU, tanh — pourquoi la non-linéarité est la seule chose qui rend un réseau plus puissant qu'une régression.
🔒 Épisode 3Backpropagation, pas à pas
La règle de la chaîne appliquée à un mini-réseau, calculée à la main puis vérifiée en direct.
🔒 Épisode 4Convolution & Vision
Pourquoi un filtre 3×3 détecte un contour, et comment un CNN construit des concepts de plus en plus abstraits.
🔒 Épisode 5Mémoire séquentielle : RNN & LSTM
Pourquoi prédire le mot suivant nécessite une mémoire, et pourquoi les RNN simples oublient vite.
🔒 Épisode 6Embeddings & Espaces Vectoriels
Pourquoi "roi - homme + femme ≈ reine" fonctionne mathématiquement.
🔒 Épisode 7Le Mécanisme d'Attention
La vraie mécanique derrière "Attention is All You Need", sans jargon.
🔒 Épisode 8Batch Normalization & Stabilité
Pourquoi normaliser entre les couches évite l'explosion ou la disparition du gradient.
🔒 Épisode 9Pooling & Hiérarchie de Features
Comment un CNN construit des représentations de plus en plus abstraites couche après couche.
🔒 Épisode 10Des Transformers aux LLM
Assembler attention, embeddings et couches pour comprendre l'architecture d'un LLM moderne.
LLM & GenAI
14 épisodes Nouvelle sérieDu tokenizer au prompt engineering : comment un LLM comprend, génère et s'adapte — les mécanismes derrière ChatGPT, Claude et les autres.
Tokenization
Comment un texte devient une suite de nombres avant même d'entrer dans le modèle.
🔒 Épisode 2Embeddings & Espace sémantique
Pourquoi « roi − homme + femme ≈ reine » fonctionne mathématiquement.
🔒 Épisode 3Self-Attention
Comment un mot peut regarder tous les autres mots d'une phrase pour se définir lui-même.
🔒 Épisode 4Positional Encoding
Pourquoi un Transformer, sans mémoire de l'ordre des mots, a besoin d'une astuce mathématique pour le retrouver.
🔒 Épisode 5Architecture Decoder-Only
Le masque causal : pourquoi un LLM ne voit jamais le futur pendant l'entraînement.
🔒 Épisode 6Next-Token Prediction & Loss
Le seul objectif d'entraînement d'un LLM : prédire le mot suivant, rien de plus.
🔒 Épisode 7Échantillonnage (Sampling)
Température, top-k, top-p : comment un LLM choisit un mot parmi des milliers de candidats.
🔒 Épisode 8Scaling Laws
Pourquoi plus de paramètres et plus de données donnent des modèles prévisiblement meilleurs.
🔒 Épisode 9RLHF & Alignment
Comment transformer un modèle qui prédit du texte en assistant qui essaie d'être utile.
🔒 Épisode 10RAG (Retrieval-Augmented Generation)
Pourquoi donner des documents à lire à un LLM plutôt que de tout lui faire mémoriser.
🔒 Épisode 11Fine-tuning & LoRA
Adapter un modèle à une tâche sans réentraîner des milliards de paramètres.
🔒 Épisode 12Évaluation & Hallucinations
Pourquoi un LLM peut affirmer un fait faux avec la même assurance qu'un fait vrai.
🔒 Épisode 13Prompt Engineering & In-Context Learning
Changer le comportement d'un modèle sans toucher à un seul de ses poids.
🔒 Épisode 14Recherche Vectorielle & Reranking
Comparer une requête à des millions de vecteurs, sans les comparer tous.
IA Agentique
9 épisodes Nouvelle sérieUn LLM qui répond une fois, c'est un modèle. Un LLM qui planifie, utilise des outils et itère, c'est un agent — les mécanismes derrière AutoGPT et les assistants qui agissent.
La Boucle ReAct
Un agent n'est pas un modèle différent : c'est le même LLM, appelé en boucle.
🔒 Épisode 2Function Calling
Choisir un outil suit exactement le même mécanisme que choisir un mot.
🔒 Épisode 3La mémoire d'un agent
Fenêtre de contexte limitée vs mémoire externe : le même RAG, appliqué à soi-même.
🔒 Épisode 4Planification
Pourquoi décomposer une tâche ne sert à rien sans identifier ses vraies dépendances.
🔒 Épisode 5L'érosion de la fiabilité
95% de fiabilité par étape peut donner moins de 60% de réussite sur 10 étapes.
🔒 Épisode 6Multi-agents
Pourquoi voter à plusieurs agents peut réparer ce qu'une chaîne d'étapes abîme.
🔒 Épisode 7MCP (Model Context Protocol)
Connecter 10 outils de plus coûte des tokens avant même la première réponse.
🔒 Épisode 8Sécurité & Injection de Prompt
Pour un LLM, une instruction et une donnée à lire se ressemblent trop.
🔒 Épisode 9AgentOps & Observabilité
L'épisode 5 a montré que la fiabilité s'effondre. Voici comment la mesurer pour de vrai.
À propos
Après 37 ans de terrain dans l'industrie de l'énergie (métrologie, systèmes de mesure, réseaux électriques et gaz), j'ai repris les études pour devenir data scientist — diplôme Bac+5 OpenClassrooms (RNCP Niveau 7) et diplôme d'ingénieur du CNAM. DataManip Insights, c'est le cours que j'aurais aimé avoir en commençant : pas des formules à apprendre par cœur, mais des simulateurs à manipuler pour vraiment comprendre pourquoi ces maths fonctionnent, pas juste les appliquer.