DataManip Insights ÉPISODE 1 Nouvelle série · LLM & GenAI Gratuit
🔤 Épisode 1 · La première étape de tout LLM

Avant de comprendre le langage,
il faut le découper.

Un modèle de langage ne lit jamais du texte. Il lit des nombres. La tokenization est le pont entre les mots et les vecteurs — et ce pont change tout.

🎯 L'analogie clé

Imaginez que vous devez ranger une bibliothèque entière dans des cartons de taille fixe. Si vous mettez un livre par carton, vous avez trop de cartons. Si vous découpez chaque page, vous perdez le sens. Le bon compromis : découper en chapitres ou en sections — assez petits pour être gérables, assez grands pour garder du sens. C’est exactement ce que fait un tokenizer.

Le problème fondamental

Un réseau de neurones ne comprend
que des nombres.

Avant toute chose, le texte doit être transformé en une séquence d’identifiants entiers. Chaque identifiant pointe vers une entrée d’un vocabulaire. La façon dont on découpe change la taille de ce vocabulaire, la longueur des séquences, et la capacité du modèle à généraliser.

🅰️
Niveau caractère
vocab ≈ 100–200
Très petit vocabulaire, séquences très longues. Le modèle doit réapprendre à composer les mots à chaque fois.
📖
Niveau mot
vocab ≈ 50k–500k+
Séquences courtes, mais explosion du vocabulaire et incapacité à gérer les mots rares ou nouveaux.
🧩
Niveau sous-mot (BPE)
vocab ≈ 30k–100k
Le compromis moderne. Les mots fréquents restent entiers, les rares sont découpés en morceaux réutilisables.
À vous de manipuler

Voyez comment le même texte
est découpé selon la méthode.

Tapez une phrase, changez de mode, et observez la différence. Le nombre de tokens et la nature des découpes changent radicalement.

Simulateur de Tokenization
Texte d’entrée
Méthode
Tokens produits
Nombre de tokens
—
Caractères
—
Ratio tokens / mots
—
Mode actif
—
Observez : en mode caractères, une phrase courte produit déjà des dizaines de tokens. En mode mots, les mots rares ou composés posent problème. Le mode sous-mots (BPE simplifié) trouve le juste milieu.
Byte Pair Encoding

L’algorithme qui a changé
la tokenization moderne.

BPE (Byte Pair Encoding) commence avec un vocabulaire de caractères, puis fusionne itérativement les paires de tokens les plus fréquentes. Les mots courants restent intacts ; les mots rares sont assemblés à partir de sous-unités réutilisables.

Étape Action Effet
0 Vocabulaire = tous les caractères Séquences très longues
1…N Fusionner la paire la plus fréquente Création progressive de sous-mots
Final Vocabulaire de taille fixée (ex. 50k) Compromis longueur / couverture
Pourquoi c’est puissant : un mot jamais vu pendant l’entraînement peut quand même être représenté s’il est composé de sous-mots connus. C’est ce qui permet aux LLM de gérer les noms propres, les néologismes et les fautes d’orthographe.
Les compromis concrets

Chaque choix de tokenization
a un coût.

📏
Longueur de séquence
Plus le découpage est fin, plus la séquence est longue → plus de calcul (attention est quadratique).
📚
Taille du vocabulaire
Un grand vocabulaire coûte cher en mémoire (matrice d’embeddings) et en données d’entraînement.
🌍
Couverture multilingue
Un tokenizer entraîné surtout sur l’anglais découpe mal d’autres langues → perte d’efficacité.
🆕
Mots hors vocabulaire
Avec les sous-mots, quasiment plus de “unk”. C’est l’un des grands avantages de BPE / WordPiece.
En pratique

Quelques lignes de Python.

Avec la bibliothèque tiktoken (utilisée par OpenAI) ou les tokenizers Hugging Face, on obtient le même résultat en quelques lignes.

Python
# Exemple avec tiktoken (tokenizer GPT-4 / GPT-3.5)
import tiktoken

enc = tiktoken.encoding_for_model("gpt-4")
text = "Les transformers ont révolutionné le NLP."

tokens = enc.encode(text)
print(tokens)
# [36494, 59894, 1002, 47736, 294, 350, 46080, 13]

print([enc.decode([t]) for t in tokens])
# ['Les', ' transformers', ' ont', ' révolutionné', ' le', ' N', 'LP', '.']

print(f"Nombre de tokens : {len(tokens)}")
Vérifiez votre compréhension

Quiz rapide.

Pourquoi les LLM modernes utilisent-ils majoritairement des tokenizers sous-mots (BPE / WordPiece) plutôt que des tokenizers au niveau mot ?

À retenir

ÉPISODE SUIVANT

Embeddings & Espace sémantique

Pourquoi « roi – homme + femme ≈ reine » fonctionne : la géométrie des vecteurs de mots.