Laboratoire 02 · Démonstration préparée

Un texte, plusieurs tokenisations

Comparez deux vocabulaires fictifs, affichez les identifiants et observez comment le même texte devient des séquences de longueurs différentes.

Comparer deux découpages

Un texte, plusieurs tokenisations

Changez d’exemple et observez comment deux vocabulaires préparés représentent exactement le même texte avec des frontières différentes.

Démonstration préparée
Texte originalLes modèles apprennent.

Vocabulaire fictif

Profil compact

4 tokens

Ce vocabulaire préparé contient plusieurs unités fréquentes de la phrase.

  1. Les
  2. ␠modèles
  3. ␠apprennent
  4. .

Vocabulaire fictif

Profil fragmenté

7 tokens

Ce vocabulaire préparé doit composer davantage de fragments pour produire exactement le même texte.

  1. L
  2. es
  3. ␠mod
  4. èles
  5. ␠appr
  6. ennent
  7. .

Un vocabulaire peut contenir un mot fréquent entier ou seulement des fragments permettant de le reconstruire.

Ce que cette démonstration ne montre pas
  • Les profils et identifiants sont fictifs et préparés localement.
  • Aucun tokenizer commercial ou open source n’est exécuté ici.
  • Les vraies frontières dépendent de l’algorithme, du vocabulaire, de sa version, de la normalisation et du texte exact.
  • Un plus petit nombre de tokens n’implique pas automatiquement un meilleur modèle ou une meilleure réponse.