L’essentiel
Pourquoi ne pas donner directement le texte au modèle ?
Un ordinateur reçoit du texte encodé sous forme de nombres, mais un modèle de langage à tokens ne travaille généralement pas directement avec les lettres visibles. Une étape d’encodage transforme d’abord le texte en une séquence d’identifiants issus d’un vocabulaire fini.
Le modèle utilise ensuite ces identifiants pour rechercher des représentations numériques apprises. À la sortie, l’opération inverse permet de convertir les tokens générés en texte affichable.
Cette séparation évite de créer une entrée différente pour chaque phrase possible. Elle impose toutefois un choix : quelles unités faut-il placer dans le vocabulaire ?
Du texte aux identifiants
Une chaîne de traitement courante comporte plusieurs opérations :
- Recevoir le texte exact. Les espaces, accents, retours à la ligne, majuscules et emoji font partie de l’entrée.
- Appliquer éventuellement une normalisation. Certains systèmes transforment certaines variantes Unicode ou espaces ; d’autres préservent davantage le texte.
- Segmenter selon un vocabulaire et des règles. Le tokenizer cherche une suite d’unités capables de représenter le texte.
- Associer un identifiant à chaque unité. La sortie de l’encodeur est une séquence d’entiers.
- Ajouter éventuellement des tokens spéciaux. Certaines architectures utilisent des marqueurs de début, de fin, de séparation ou de rôle.
Toutes ces étapes ne sont pas identiques dans tous les systèmes. Le mot « tokenizer » désigne souvent l’ensemble de cette chaîne, même lorsque plusieurs opérations internes sont distinguées.
Un token n’est ni forcément un mot, ni forcément un caractère
Prenons le texte imprévisible.
Un tokenizer pourrait le représenter comme :
imprévisible;im+prévisible;im+pré+visible;- une suite plus fine de caractères ou d’octets.
Ces exemples illustrent des possibilités, pas la sortie garantie d’un tokenizer réel. Pour connaître le véritable découpage, il faut exécuter le tokenizer exact, dans la bonne version, avec son vocabulaire et sa normalisation.
Un caractère visible n’est pas non plus toujours une unité simple. Un emoji peut combiner plusieurs points de code Unicode ; ces points de code deviennent plusieurs octets en UTF-8. Un tokenizer peut conserver la séquence entière, la fragmenter ou retomber sur des unités plus petites.
Pourquoi utiliser des sous-mots ?
Un vocabulaire contenant seulement des mots entiers rencontre vite des mots rares, des noms propres, des conjugaisons, des fautes ou des mots nouveaux. À l’autre extrême, un système fondé uniquement sur de très petites unités peut représenter presque tout, mais produit des séquences longues.
Les unités de sous-mot cherchent un compromis :
- conserver certaines unités fréquentes sous une forme compacte ;
- décomposer les formes rares en fragments réutilisables ;
- maintenir un vocabulaire de taille finie ;
- représenter des textes qui n’étaient pas présents tels quels lors de la construction du vocabulaire.
Des familles de méthodes comme BPE, WordPiece ou le modèle unigramme ne prennent pas exactement les mêmes décisions. Même deux tokenizers d’une même famille peuvent différer selon leurs données et leurs réglages.
Analogie : une boîte de pièces
Ce que cette analogie simplifie
Laboratoire : comparer deux tokenisations
Choisissez une phrase, un mot long, un emoji ou une ligne de code. Vérifiez que les deux profils reconstruisent le même texte, puis affichez les identifiants. Observez surtout ce qui change : les frontières et la longueur de la séquence.
Comparer deux découpages
Un texte, plusieurs tokenisations
Changez d’exemple et observez comment deux vocabulaires préparés représentent exactement le même texte avec des frontières différentes.
Les modèles apprennent.Vocabulaire fictif
Profil compact
Ce vocabulaire préparé contient plusieurs unités fréquentes de la phrase.
- Les
- ␠modèles
- ␠apprennent
- .
Vocabulaire fictif
Profil fragmenté
Ce vocabulaire préparé doit composer davantage de fragments pour produire exactement le même texte.
- L
- es
- ␠mod
- èles
- ␠appr
- ennent
- .
Un vocabulaire peut contenir un mot fréquent entier ou seulement des fragments permettant de le reconstruire.
Ce que cette démonstration ne montre pas
- Les profils et identifiants sont fictifs et préparés localement.
- Aucun tokenizer commercial ou open source n’est exécuté ici.
- Les vraies frontières dépendent de l’algorithme, du vocabulaire, de sa version, de la normalisation et du texte exact.
- Un plus petit nombre de tokens n’implique pas automatiquement un meilleur modèle ou une meilleure réponse.
Quelles conséquences pratiques ?
Pour un modèle qui utilise des tokens, le découpage influence la longueur de la séquence traitée. Cela peut avoir plusieurs effets :
- fenêtre de contexte : un texte plus fragmenté occupe davantage de positions dans une limite exprimée en tokens ;
- calcul et latence : des séquences plus longues demandent généralement davantage de traitement, avec des détails qui dépendent de l’architecture ;
- coût d’un service : certaines offres facturent selon un nombre de tokens, mais leurs règles et tokenizers doivent être vérifiés séparément ;
- langues et domaines : un vocabulaire peut être compact pour certains textes et beaucoup plus fragmenté pour d’autres langues, écritures ou types de contenu ;
- apprentissage : les frontières choisies modifient les unités sur lesquelles le modèle apprend des représentations.
Un faible nombre de tokens ne suffit pourtant pas à déclarer un tokenizer « meilleur ». La couverture, la qualité du modèle, les données, la robustesse, la vitesse et la tâche comptent aussi. Des études comparatives montrent que des métriques simples comme le nombre moyen de tokens ne prédisent pas toujours à elles seules la performance finale.
Trois nuances importantes
- Les tokens ne sont pas des concepts stockés dans des cases. Le sens dépend de représentations apprises et du contexte, pas seulement du fragment visible.
- Les espaces peuvent être intégrés aux unités. Dans certaines interfaces de visualisation, un marqueur spécial représente un espace au début d’un token.
- Tous les modèles de texte n’emploient pas des sous-mots classiques. Des architectures expérimentales ou spécialisées opèrent à l’échelle des octets, des caractères ou de segments appris autrement.
Présentation
La présentation résume le passage du texte aux identifiants et les compromis entre taille du vocabulaire et longueur des séquences.
Vérifiez votre compréhension
Le quiz distingue les propriétés générales d’un tokenizer des exemples préparés dans cette leçon.
Sans piège, avec explications
Quiz de compréhension
Le quiz ne bloque rien. Une erreur sert à préciser le modèle mental.
Trois idées à retenir
Concepts liés
Sources principales
Les sources ci-dessous couvrent plusieurs familles de tokenisation et leurs compromis. Elles ont été vérifiées le 27 juillet 2026. Les exemples interactifs de cette page ne reproduisent les sorties d’aucun article ou tokenizer cité.
- Neural Machine Translation of Rare Words with Subword Units — Rico Sennrich, Barry Haddow et Alexandra Birch (2016) (ouvre un nouvel onglet)Article fondateur sur l’emploi de BPE pour représenter les mots rares comme des suites de sous-mots.
- SentencePiece: A simple and language independent subword tokenizer and detokenizer for Neural Text Processing — Taku Kudo et John Richardson (2018) (ouvre un nouvel onglet)Présentation d’un tokenizer de sous-mots entraînable directement sur du texte brut, avec BPE et modèle unigramme.
- Byte Pair Encoding is Suboptimal for Language Model Pretraining — Kaj Bostrom et Greg Durrett (2020) (ouvre un nouvel onglet)Comparaison critique de BPE avec d’autres stratégies de vocabulaire pour le préentraînement de modèles de langage.
- ByT5: Towards a Token-Free Future with Pre-trained Byte-to-Byte Models — Linting Xue, Aditya Barua, Noah Constant, Rami Al-Rfou, Sharan Narang, Mihir Kale, Adam Roberts et Colin Raffel (2022) (ouvre un nouvel onglet)Étudie une architecture opérant directement sur les octets et rappelle que les sous-mots ne sont pas l’unique représentation possible.
- Tokenizer Choice For LLM Training: Negligible or Crucial? — Mehdi Ali et al. (2024) (ouvre un nouvel onglet)Étude contrôlée de l’influence du choix du tokenizer sur des modèles mono- et multilingues, avec des nuances sur les métriques simples.
Votre progression locale
Statut: Non commencée
La progression reste sur cet appareil.