Voyez le mécanisme en 30 secondes
Essai rapide · 30 secondes
Quel fragment vient ensuite ?
Le modèle ne rédige pas tout d’un bloc. Il évalue des suites possibles, en choisit une, puis recommence.
Le chat boit …
Choisissez une suite proposée par cette simulation :
- 01ContexteCe qui est déjà écrit
- 02ScoresLes suites sont comparées
- 03ChoixUn token est retenu
Probabilités fictives, préparées pour l’explication. Un vrai modèle compare un vocabulaire bien plus vaste.
Trois gestes, en boucle
Une réponse fluide paraît avoir été écrite d’un seul bloc. En réalité, les LLM génératifs autorégressifs enchaînent généralement de nombreuses décisions locales.
- 1
Lire le contexte
La demande, les instructions et les fragments déjà générés servent de point de départ.
- 2
Comparer les suites
Le modèle attribue un score aux tokens possibles. Le décodage transforme ces scores en choix.
- 3
Ajouter et recommencer
Le token retenu rejoint le contexte. La boucle repart avec une distribution différente.
À chaque tour, le contexte change. Le modèle calcule donc une nouvelle distribution pour le token suivant. Les implémentations efficaces peuvent réutiliser des calculs intermédiaires, mais le principe reste le même.
À vous de jouer
Faites varier la température et observez comment les probabilités se redistribuent. Commencez simplement par générer quelques tokens, puis comparez deux suites avec la même graine.
Laboratoire local
Génération token par token
Observez une distribution préparée, puis échantillonnez une suite reproductible. La température n’est qu’un élément du processus réel.
Commandes
Distribution actuelle
Contexte courantLe chat boit du
- lait68 %
- bouillon20 %
- jus12 %
Total normalisé: 100 %. Les pourcentages individuels peuvent présenter un écart d’arrondi.
Prêt. Choisissez un scénario, puis générez un token ou lancez la lecture.
Comparer deux générations
Même scénario, même graine : A utilise une température basse de 0,4 ; B utilise votre réglage actuel (1).
Génération A · T 0,4
Pas encore générée.
Génération B · T 1
Pas encore générée.
Ce que cette simulation ne montre pas
- Les candidats et probabilités sont écrits à l’avance, pas calculés.
- Il n’y a ni réseau neuronal, ni attention, ni véritable tokenizer.
- Un vrai système peut appliquer top-k, top-p, des pénalités et des règles d’arrêt supplémentaires.
- Une probabilité de token n’est pas une probabilité que l’affirmation soit vraie.
- La graine n’est reproductible qu’à l’intérieur de ce laboratoire.
Avez-vous saisi la boucle ?
Six questions courtes permettent de vérifier votre modèle mental. Chaque réponse est expliquée et aucune erreur ne bloque la suite.
Sans piège, avec explications
Quiz de compréhension
Le quiz ne bloque rien. Une erreur sert à préciser le modèle mental.
Gardez ces trois idées
Approfondir, sans ralentir
La mécanique essentielle est terminée. Ouvrez seulement les sujets dont vous avez besoin.
FondationsUn token n’est pas toujours un mot
Avant d’être traité par le modèle, le texte est converti en identifiants de tokens. Un token peut correspondre à un mot entier, un fragment, un signe de ponctuation ou une autre unité.
Deux tokenizers peuvent découper la même phrase différemment. Les exemples de cette leçon emploient parfois des mots entiers pour rester lisibles, sans représenter tous les découpages possibles.
Pendant l’inférence, les identifiants deviennent des représentations numériques que le modèle combine avec ses paramètres appris.
DécodageScores, probabilités et température
Le modèle produit un score, appelé logit, pour chaque token de son vocabulaire. Une normalisation, souvent la softmax, transforme ces scores en probabilités dont la somme vaut 1.
La température, strictement positive, modifie habituellement les scores avant leur normalisation :
pᵢ(T) = exp(zᵢ / T) / Σⱼ exp(zⱼ / T)
- En dessous de 1, la distribution se concentre généralement sur les tokens déjà les plus probables.
- À 1, la distribution préparée est conservée.
- Au-dessus de 1, les options secondaires gagnent généralement du poids.
Une température basse ne garantit pas toujours la même réponse. Le résultat dépend aussi de la stratégie de sélection, des filtres et du système réel.
Image mentaleL’analogie de la roulette qui change
Limite importantePlausible ne signifie pas vrai
Le préentraînement optimise souvent la prédiction de suites observées dans des données. Des ajustements supplémentaires peuvent améliorer le comportement du modèle, mais ils ne transforment pas la probabilité du token suivant en test automatique de vérité.
Une réponse fluide peut donc être exacte, incertaine ou fausse. On parle souvent d’hallucination lorsqu’une sortie est plausible mais fausse, non étayée ou incompatible avec la source demandée.
Les probabilités de ce laboratoire sont préparées localement. Il n’utilise ni véritable LLM, ni réseau neuronal, ni API.
Mode formateurOuvrir la présentation en huit étapes
Cette présentation peut servir de révision ou de support devant un groupe.
RéférencesConsulter les concepts et les sources
Concepts liés
Les sources ci-dessous sont des articles primaires, vérifiés pour cette leçon le 26 juillet 2026. Les formulations décrivent le cas courant des LLM génératifs autorégressifs, pas toutes les architectures possibles.
- Attention Is All You Need — Ashish Vaswani, Noam Shazeer, Niki Parmar, Jakob Uszkoreit, Llion Jones, Aidan N. Gomez, Łukasz Kaiser et Illia Polosukhin (2017) (ouvre un nouvel onglet)Article primaire présentant l’architecture Transformer, le masquage causal et le principe de génération autorégressive du décodeur.
- Language Models are Few-Shot Learners — Tom B. Brown et al. (2020) (ouvre un nouvel onglet)Article primaire décrivant GPT-3 comme un grand modèle de langage autorégressif et documentant ses capacités comme ses limites.
- SentencePiece: A simple and language independent subword tokenizer and detokenizer for Neural Text Processing — Taku Kudo et John Richardson (2018) (ouvre un nouvel onglet)Source primaire sur la tokenisation en unités sous-lexicales et sur la dépendance du découpage au tokenizer.
- The Curious Case of Neural Text Degeneration — Ari Holtzman, Jan Buys, Li Du, Maxwell Forbes et Yejin Choi (2020) (ouvre un nouvel onglet)Étudie l’influence des stratégies de décodage et de l’échantillonnage sur les textes générés.
- TruthfulQA: Measuring How Models Mimic Human Falsehoods — Stephanie Lin, Jacob Hilton et Owain Evans (2022) (ouvre un nouvel onglet)Montre expérimentalement que des modèles de langage peuvent produire des réponses fausses mais plausibles.
Votre progression locale
Statut: Non commencée
La progression reste sur cet appareil.