Comprendre les LLM · Leçon 01

Comment un LLM génère-t-il une réponse ?

Comment une réponse apparemment complète est-elle produite à partir de choix successifs de tokens ?

Niveau
Débutant
Durée essentielle
7 min
Mise à jour
27 juillet 2026
Prérequis
Aucun
Progression
Non commencée

Voyez le mécanisme en 30 secondes

Essai rapide · 30 secondes

Quel fragment vient ensuite ?

Le modèle ne rédige pas tout d’un bloc. Il évalue des suites possibles, en choisit une, puis recommence.

À vous
Contexte actuel

Le chat boit

Choisissez une suite proposée par cette simulation :

  1. 01ContexteCe qui est déjà écrit
  2. 02ScoresLes suites sont comparées
  3. 03ChoixUn token est retenu

Probabilités fictives, préparées pour l’explication. Un vrai modèle compare un vocabulaire bien plus vaste.

Trois gestes, en boucle

Une réponse fluide paraît avoir été écrite d’un seul bloc. En réalité, les LLM génératifs autorégressifs enchaînent généralement de nombreuses décisions locales.

  1. 1

    Lire le contexte

    La demande, les instructions et les fragments déjà générés servent de point de départ.

  2. 2

    Comparer les suites

    Le modèle attribue un score aux tokens possibles. Le décodage transforme ces scores en choix.

  3. 3

    Ajouter et recommencer

    Le token retenu rejoint le contexte. La boucle repart avec une distribution différente.

À chaque tour, le contexte change. Le modèle calcule donc une nouvelle distribution pour le token suivant. Les implémentations efficaces peuvent réutiliser des calculs intermédiaires, mais le principe reste le même.

À vous de jouer

Faites varier la température et observez comment les probabilités se redistribuent. Commencez simplement par générer quelques tokens, puis comparez deux suites avec la même graine.

Laboratoire local

Génération token par token

Observez une distribution préparée, puis échantillonnez une suite reproductible. La température n’est qu’un élément du processus réel.

Simulation pédagogique

Commandes

Observer comment plusieurs suites plausibles reçoivent des probabilités différentes.
1,0
À 1 : la distribution préparée est conservée. Dans un vrai système, d’autres filtres et réglages interviennent.
Même graine + mêmes réglages = même suite dans cette simulation.

Distribution actuelle

Contexte courantLe chat boit du

  • lait68 %
  • bouillon20 %
  • jus12 %

Total normalisé: 100 %. Les pourcentages individuels peuvent présenter un écart d’arrondi.

Prêt. Choisissez un scénario, puis générez un token ou lancez la lecture.

Comparer deux générations

Même scénario, même graine : A utilise une température basse de 0,4 ; B utilise votre réglage actuel (1).

Génération A · T 0,4

Pas encore générée.

Génération B · T 1

Pas encore générée.

Ce que cette simulation ne montre pas
  • Les candidats et probabilités sont écrits à l’avance, pas calculés.
  • Il n’y a ni réseau neuronal, ni attention, ni véritable tokenizer.
  • Un vrai système peut appliquer top-k, top-p, des pénalités et des règles d’arrêt supplémentaires.
  • Une probabilité de token n’est pas une probabilité que l’affirmation soit vraie.
  • La graine n’est reproductible qu’à l’intérieur de ce laboratoire.

Avez-vous saisi la boucle ?

Six questions courtes permettent de vérifier votre modèle mental. Chaque réponse est expliquée et aucune erreur ne bloque la suite.

Sans piège, avec explications

Quiz de compréhension

Le quiz ne bloque rien. Une erreur sert à préciser le modèle mental.

Question 1 sur 6
Un LLM génératif autorégressif décide nécessairement toute sa réponse avant d’afficher le premier token.

Gardez ces trois idées

Approfondir, sans ralentir

La mécanique essentielle est terminée. Ouvrez seulement les sujets dont vous avez besoin.

FondationsUn token n’est pas toujours un mot

Avant d’être traité par le modèle, le texte est converti en identifiants de tokens. Un token peut correspondre à un mot entier, un fragment, un signe de ponctuation ou une autre unité.

Deux tokenizers peuvent découper la même phrase différemment. Les exemples de cette leçon emploient parfois des mots entiers pour rester lisibles, sans représenter tous les découpages possibles.

Pendant l’inférence, les identifiants deviennent des représentations numériques que le modèle combine avec ses paramètres appris.

DécodageScores, probabilités et température

Le modèle produit un score, appelé logit, pour chaque token de son vocabulaire. Une normalisation, souvent la softmax, transforme ces scores en probabilités dont la somme vaut 1.

La température, strictement positive, modifie habituellement les scores avant leur normalisation :

pᵢ(T) = exp(zᵢ / T) / Σⱼ exp(zⱼ / T)

  • En dessous de 1, la distribution se concentre généralement sur les tokens déjà les plus probables.
  • À 1, la distribution préparée est conservée.
  • Au-dessus de 1, les options secondaires gagnent généralement du poids.

Une température basse ne garantit pas toujours la même réponse. Le résultat dépend aussi de la stratégie de sélection, des filtres et du système réel.

Image mentaleL’analogie de la roulette qui change
Limite importantePlausible ne signifie pas vrai

Le préentraînement optimise souvent la prédiction de suites observées dans des données. Des ajustements supplémentaires peuvent améliorer le comportement du modèle, mais ils ne transforment pas la probabilité du token suivant en test automatique de vérité.

Une réponse fluide peut donc être exacte, incertaine ou fausse. On parle souvent d’hallucination lorsqu’une sortie est plausible mais fausse, non étayée ou incompatible avec la source demandée.

Les probabilités de ce laboratoire sont préparées localement. Il n’utilise ni véritable LLM, ni réseau neuronal, ni API.

Mode formateurOuvrir la présentation en huit étapes

Cette présentation peut servir de révision ou de support devant un groupe.

Lorsque la présentation est focalisée, utilisez les flèches gauche et droite pour changer de diapositive.

La question

Comment une réponse apparaît-elle ?

Une réponse fluide donne l’impression d’avoir été écrite d’un seul bloc.

Pourtant, les LLM génératifs autorégressifs produisent généralement leur sortie par une suite de décisions locales.

Suivons un cycle complet, du contexte au prochain token.

Diapositive 1 : Comment une réponse apparaît-elle ?

1 / 8
RéférencesConsulter les concepts et les sources

Concepts liés

Les sources ci-dessous sont des articles primaires, vérifiés pour cette leçon le 26 juillet 2026. Les formulations décrivent le cas courant des LLM génératifs autorégressifs, pas toutes les architectures possibles.

Sources primaires

Votre progression locale

Statut: Non commencée

La progression reste sur cet appareil.