La meilleure technique de cuisine du monde ne sauve pas un plat fait avec des légumes pourris. En analyse de données, c'est exactement pareil — et la plupart des erreurs se glissent bien avant le premier calcul.
Un grand chef peut sublimer de bons ingrédients, mais aucune technique ne rattrape une viande avariée ou des légumes fanés. Le plat final ne sera jamais meilleur que ce qu'on y a mis au départ.
Une analyse de données suit la même logique : la méthode statistique la plus sophistiquée ne sauvera jamais une étude bâtie sur des données mal collectées, mal comprises, ou mal interprétées.
15 pièges classiques, regroupés en 4 étapes d'une analyse. Certaines erreurs sont rattrapables plus tard — d'autres, commises dès la collecte, ne le sont jamais complètement.
Aucune méthode d'analyse, aussi sophistiquée soit-elle, ne peut compenser des données mal collectées dès le départ.
Le simulateur de cet épisode repose sur une logique simple : chaque erreur pèse plus ou moins lourd selon l'étape où elle survient.
def score_fiabilite(erreurs_cochees, poids): """erreurs_cochees : liste de booléens, poids : liste de points perdus""" perte_totale = sum(p for e, p in zip(erreurs_cochees, poids) if e) return max(0, 100 - perte_totale) # Exemple : mauvais échantillon + pas de vérification des hypothèses score = score_fiabilite( erreurs_cochees=[True, False, False, True], poids=[9, 7, 6, 6] ) print(f"Fiabilité estimée : {score}%")