Suivez ce message

S01 · Tout commence par un message

Message préparé : Écris un message pour prévenir que je serai en retard.

Réponse préparée — rédigée par notre équipe
Choix imposés, calculs enregistrés. Aucun appel modèle en direct.

Le même message quitte l’application ; aucune réponse n’a été ajoutée.

Lire la réponse préparée (hors de l’entrée du modèle)

Bonjour, je serai un peu en retard. Désolé pour l’attente !

Avec quoi suis-je en train d’échanger quand j’écris ?

Vous écrivez dans une application. C’est l’interface, pas le modèle de langage lui-même.

La réponse est rédigée ; les calculs du modèle le long du chemin imposé ont été enregistrés séparément. Aucun appel modèle en direct.

  1. VousUne demande préparée.
  2. ApplicationL’écran où vous écrivez.
  3. Votre messageLa demande, pas la réponse.
L’interface n’est pas le modèle.◇ Schéma pédagogique · formes et distances illustratives, pas une mesure du modèle.

La réponse est rédigée ; les calculs du modèle le long du chemin imposé ont été enregistrés séparément. Aucun appel modèle en direct.

Montrez-moi

La réponse sera-t-elle déjà cachée dans ce message ?

L’application prépare une demande. Produire la réponse est une autre étape.

Approfondir

Cet exemple suit un assistant hébergé à distance. La personne, l’ordinateur et le trajet sont des schémas pédagogiques, pas l’enregistrement d’une vraie conversation.

This scene in English

S02 · La demande arrive au serveur

Message préparé : Écris un message pour prévenir que je serai en retard.

Le modèle reçoit-il seulement le texte que je vois ?

Un serveur est un ordinateur qui exécute des logiciels. Le modèle est le calcul appris qu’utilise ce logiciel ; ce n’est pas le serveur lui-même.

L’application prépare l’entrée. Ouvrez l’enveloppe de cet exemple pour voir exactement ce qu’elle contenait.

  1. ApplicationPrépare l’entrée.
  2. ServeurLa machine qui héberge.
  3. ModèleLe calcul appris, exécuté ici.
Serveur ≠ modèle : la machine exécute le calcul.◇ Schéma pédagogique · formes et distances illustratives, pas une mesure du modèle.

Entrée enregistrée — la cible rédigée reste hors de la demande initiale.

Montrez-moi

L’entrée pourrait-elle contenir autre chose que le message visible ?

Message utilisateur
Écris un message pour prévenir que je serai en retard.
Système implicite du template officiel
You are a helpful AI assistant named SmolLM, trained by Hugging Face
Historique / outils
Absents dans cet exemple.
Inspecter l’entrée complète
<|im_start|>system
You are a helpful AI assistant named SmolLM, trained by Hugging Face<|im_end|>
<|im_start|>user
Écris un message pour prévenir que je serai en retard.<|im_end|>
<|im_start|>assistant
Rôles et template exact
[
  {
    "role": "user",
    "content": "Écris un message pour prévenir que je serai en retard."
  }
]
{% for message in messages %}{% if loop.first and messages[0]['role'] != 'system' %}{{ '<|im_start|>system
You are a helpful AI assistant named SmolLM, trained by Hugging Face<|im_end|>
' }}{% endif %}{{'<|im_start|>' + message['role'] + '
' + message['content'] + '<|im_end|>' + '
'}}{% endfor %}{% if add_generation_prompt %}{{ '<|im_start|>assistant
' }}{% endif %}

Les marqueurs im_start / im_end délimitent les rôles ; le préfixe assistant ouvre la continuation. Aucune normalisation du message ; rien omis dans la sérialisation ci-dessus.

Ce que l’application envoie et ce que sa bulle de message affiche ne sont pas forcément identiques.

Approfondir

Montrer l’entrée sérialisée complète en plus de ses sections lisibles. Si les consignes ou l’historique sont absents, indiquer absents dans cet exemple. Nommer les marqueurs spéciaux et le formatage omis.

D’autres systèmes exécutent le modèle localement. Ce dessin ne décrit ni tous les réseaux ni la politique de confidentialité de chaque fournisseur.

This scene in English

S03 · Le modèle a été entraîné avant ce message

Message préparé : Écris un message pour prévenir que je serai en retard.

Qu’est-ce qui avait déjà été appris avant l’envoi ?

Un grand modèle de langage, ou LLM, est un modèle informatique entraîné à traiter et produire du texte.

Pendant l’entraînement, exemples, prédictions et écarts mesurés servent à ajuster des nombres appelés paramètres. Pendant cette réponse, ces nombres appris restent fixes.

  1. Avant votre messageL’entraînement ajuste les paramètres.
  2. Modèle entraînéDes paramètres appris, pas des fiches.
  3. MaintenantParamètres fixes pendant cette réponse.
Entraînement ≠ génération : le message arrive après l’apprentissage.◇ Schéma pédagogique · formes et distances illustratives, pas une mesure du modèle.

L’entraînement reste un schéma pédagogique ; les calculs d’inférence ultérieurs utilisent des paramètres fixes.

Montrez-moi

Ce nouveau message réentraîne-t-il le modèle ?

Avant cette conversation : entraînement

◇ Schéma pédagogique — simplifié, non mesuré · □ □ ◇ → □ ◇ ◇

Exemple → prédiction → écart mesuré → ajustement des paramètres. Ces marques représentent un changement passé, sans chiffre de training inventé.

Présent : inférence, paramètres fixes 🔒

◇ Schéma pédagogique — simplifié, non mesuré

□ ◇ ◇ → 🔒 · Marques symboliques, pas des valeurs capturées.

Pendant l’entraînement, exemples, prédictions et écarts mesurés servent à ajuster des nombres appelés paramètres. Pendant cette réponse, ces nombres appris restent fixes.

L’entraînement change les réglages appris. Utiliser ces réglages pour traiter une entrée s’appelle l’inférence.

Approfondir

Le schéma d’entraînement montre un principe, pas une capture de l’entraînement de ce modèle. Une prédiction est comparée à la cible d’un exemple ; une procédure d’optimisation ajuste les paramètres à partir d’un écart mesuré.

Les paramètres ne sont pas des tiroirs contenant chacun un mot ou un souvenir. Un modèle peut néanmoins mémoriser certains éléments d’entraînement. Des entraînements supplémentaires peuvent améliorer le suivi des consignes ; ils ne sont pas montrés ici.

This scene in English

S04 · Le texte devient des tokens

Message préparé : Écris un message pour prévenir que je serai en retard.

Le modèle reçoit-il une liste de mots entiers ?

Un tokenizer transforme le texte en unités appelées tokens et en identifiants numériques. Un token n’est pas forcément un mot entier.

Un identifiant désigne une entrée du vocabulaire de ce tokenizer. Un nombre plus grand ne désigne pas un mot plus important.

  1. Texte d’entréeL’enveloppe complète, pas seulement la bulle.
  2. TokenizerDécoupe selon ses règles.
  3. Tokens ordonnésUn fragment, une position et un ID.
Tokenisation ≠ compréhension. Tuiles symboliques ici ; découpage exact à inspecter ci-dessous.◇ Schéma pédagogique · formes et distances illustratives, pas une mesure du modèle.

Résultat du tokenizer vérifié — fragments et IDs exacts, non inventés pour le récit.

Montrez-moi

Chaque tuile correspondra-t-elle à un mot entier ?

○ Trace capturée — pièces BPE brutes (Ġ espace, Ċ saut de ligne). Les offsets sont des points de code Unicode, parfois partagés ; un décodage unitaire peut être incomplet.

  1. <|im_start|> · ID 1
  2. system · ID 9690
  3. Ċ · ID 198
  4. You · ID 2683
  5. Ġare · ID 359
  6. Ġa · ID 253
  7. Ġhelpful · ID 5356
  8. ĠAI · ID 5646
  9. Ġassistant · ID 11173
  10. Ġnamed · ID 3365
  11. ĠSm · ID 3511
  12. ol · ID 308
  13. LM · ID 34519
  14. , · ID 28
  15. Ġtrained · ID 7018
  16. Ġby · ID 411
  17. ĠH · ID 407
  18. ugging · ID 19712
  19. ĠFace · ID 8182
  20. <|im_end|> · ID 2
  21. Ċ · ID 198
  22. <|im_start|> · ID 1
  23. user · ID 4093
  24. Ċ · ID 198
  25. Ãī · ID 39614
  26. c · ID 83
  27. ris · ID 4593
  28. Ġun · ID 551
  29. Ġmessage · ID 3714
  30. Ġpour · ID 18244
  31. Ġpr · ID 694
  32. é · ID 2756
  33. ven · ID 1241
  34. ir · ID 337
  35. Ġque · ID 10168
  36. Ġje · ID 16718
  37. Ġser · ID 1236
  38. ai · ID 2554
  39. Ġen · ID 430
  40. Ġretard · ID 26278
  41. . · ID 30
  42. <|im_end|> · ID 2
  43. Ċ · ID 198
  44. <|im_start|> · ID 1
  45. ass · ID 520
  46. istant · ID 9531
  47. Ċ · ID 198

    Position inspectée 46 · ID 198 · [201, 202) · Décodage unitaire: "\n"

<|im_start|>system
You are a helpful AI assistant named SmolLM, trained by Hugging Face<|im_end|>
<|im_start|>user
Écris un message pour prévenir que je serai en retard.<|im_end|>
<|im_start|>assistant

La tokenisation seule ne comprend pas la phrase. D’autres tokenizers peuvent la découper autrement.

Le fragment, son identifiant et sa place dans la séquence sont des choses différentes.

Approfondir

Un caractère affiché peut couvrir plusieurs tokens, et un token ne se décode pas forcément en un caractère Unicode complet à lui seul. Les fragments regroupés pour l’affichage doivent lister leurs tokens sous-jacents, sans se faire passer pour un seul token.

Le décodage de la séquence complète suit les règles du tokenizer. Si une normalisation change l’entrée, montrer séparément les formes originale et normalisée ; ne pas promettre une égalité octet par octet.

This scene in English

S05 · Un identifiant désigne une liste de nombres

Message préparé : Écris un message pour prévenir que je serai en retard.

Que peut calculer le modèle à partir d’un identifiant ?

Un identifiant sélectionne une ligne d’une table apprise : une liste de nombres appelée embedding. Cette représentation de départ sert aux calculs.

Le modèle tient aussi compte des positions dans la séquence. Les quelques valeurs montrées ici ne sont pas une carte complète du sens.

  1. Fragment → IDL’identité du token reste la même.
  2. Table appriseL’ID désigne une ligne.
  3. ReprésentationUne liste de nombres pour calculer.
Consulter une ligne ne réentraîne pas la table. Valeurs capturées ci-dessous, pas une carte du sens.◇ Schéma pédagogique · formes et distances illustratives, pas une mesure du modèle.

Consultation de table enregistrée — dimensions sélectionnées ; l’espacement n’est pas une distance sémantique.

Montrez-moi

L’identifiant du token est-il déjà toute sa représentation ?

Précision d’affichage : les derniers chiffres des nombres peuvent varier à l’export, sans renormalisation. Données canoniques et SHA256 : manifeste des traces.

Position 46 · Ċ → ID 198 → ligne de table apprise. Les paramètres restent fixes.

□ Vue réduite documentée du prompt initial : dimensions 0, 1, 2, 3, 4, 5, 6, 7 / 576. Valeurs signées de la capture ; pas d’axe humain ni d’échelle couleur quantitative.

Position 46 · Ċ → ID 198 → ligne de table apprise

Embedding
DimensionEmbedding
0-0.2119140625
1-0.1201171875
20.1728515625
30.056396484375
40.216796875
5-0.0308837890625
60.169921875
7-0.16796875

RoPE traite les positions par rotation dans l’attention, pas par un axe psychologique ni une addition systématique à cette table.

L’identifiant permet de trouver une ligne apprise ; cette liste de valeurs participe ensuite aux calculs.

Approfondir

Un vecteur est une liste ordonnée de nombres ; une dimension est une place numérotée de cette liste. Chaque case affichée doit nommer sa dimension et son point d’extraction. Préférer des dimensions sélectionnées, sauf besoin d’une projection explicitement documentée ; aucune de ces vues ne rend l’espace complet tridimensionnel.

La façon d’introduire la position dépend de l’architecture retenue. L02 doit la documenter ; le dessin ne doit pas supposer qu’on additionne toujours une position à l’embedding.

This scene in English

S06 · Le contexte transforme la représentation

Message préparé : Écris un message pour prévenir que je serai en retard.

Comment l’entrée environnante agit-elle sur la représentation d’un token ?

Le modèle comporte des étapes successives de calcul appelées couches. Dans une couche, l’attention combine les informations des positions autorisées, jamais celles des positions suivantes ici.

D’autres transformations apprises modifient aussi la représentation. Les tokens originaux et les paramètres appris restent fixes pendant cette réponse.

  1. Sources autoriséesLa position inspectée et celles qui précèdent. Jamais le futur.
  2. Une couche ouverteAttention, puis autres calculs dont le MLP.
  3. Même position, aprèsUne représentation transformée, pas un nouveau token.
Le contexte change la représentation, pas les paramètres ni les IDs. Liens schématiques ; poids réels à inspecter ci-dessous.◇ Schéma pédagogique · formes et distances illustratives, pas une mesure du modèle.

États et attention enregistrés — mêmes préfixe et position ; vue réduite, pas explication complète.

Montrez-moi

Une position antérieure peut-elle lire un token suivant dans ce modèle ?

Précision d’affichage : les derniers chiffres des nombres peuvent varier à l’export, sans renormalisation. Données canoniques et SHA256 : manifeste des traces.

Même position inspectée 46 · Ċ · ID 198. Avant et après la même couche ; le texte et les paramètres restent fixes.

Couche 0 · tête 0 · indices base zéro. Entrée du bloc → RMSNorm, attention, résiduel, RMSNorm, MLP SiLU, résiduel → sortie du même bloc. Aucun nouveau token.

□ Vue réduite documentée du prompt initial : dimensions 0, 1, 2, 3, 4, 5, 6, 7 / 576. Valeurs signées de la capture ; pas d’axe humain ni d’échelle couleur quantitative.

Position 46 · Ċ → ID 198 → ligne de table apprise

Même position, avant/après la couche
DimensionAvantAprès
0-0.21191406250.2611467242240906
1-0.12011718750.38337385654449463
20.17285156250.6567775011062622
30.0563964843751.648341417312622
40.2167968750.10010802000761032
5-0.03088378906250.18014803528785703
60.1699218750.23515748977661133
7-0.16796875-0.022570863366127018

RoPE traite les positions par rotation dans l’attention, pas par un axe psychologique ni une addition systématique à cette table.

Sources d’attention autorisées — prompt initial
  1. 0 · <|im_start|> · 0.026725977659225464
  2. 1 · system · 0.04963835328817368
  3. 2 · Ċ · 0.011997961439192297
  4. 3 · You · 0.00980914942920208
  5. 4 · Ġare · 0.03442519158124924
  6. 5 · Ġa · 0.03587106615304947
  7. 6 · Ġhelpful · 0.011090868152678013
  8. 7 · ĠAI · 0.02505892515182495
  9. 8 · Ġassistant · 0.014532403089106085
  10. 9 · Ġnamed · 0.007473553065210581
  11. 10 · ĠSm · 0.0072178589180111885
  12. 11 · ol · 0.018568789586424828
  13. 12 · LM · 0.007869393564760685
  14. 13 · , · 0.003013758221641183
  15. 14 · Ġtrained · 0.03314068168401718
  16. 15 · Ġby · 0.0020901267416775227
  17. 16 · ĠH · 0.004633747972548008
  18. 17 · ugging · 0.016797970980405807
  19. 18 · ĠFace · 0.01832457259297371
  20. 19 · <|im_end|> · 0.03805198520421982
  21. 20 · Ċ · 0.01134332362562418
  22. 21 · <|im_start|> · 0.032385051250457764
  23. 22 · user · 0.017451483756303787
  24. 23 · Ċ · 0.015037097036838531
  25. 24 · Ãī · 0.02421461045742035
  26. 25 · c · 0.03470586612820625
  27. 26 · ris · 0.01725437119603157
  28. 27 · Ġun · 0.010100603103637695
  29. 28 · Ġmessage · 0.03214215487241745
  30. 29 · Ġpour · 0.01045569870620966
  31. 30 · Ġpr · 0.014588957652449608
  32. 31 · é · 0.05043886974453926
  33. 32 · ven · 0.02845172956585884
  34. 33 · ir · 0.029869219288229942
  35. 34 · Ġque · 0.00638422230258584
  36. 35 · Ġje · 0.01012976747006178
  37. 36 · Ġser · 0.014183315448462965
  38. 37 · ai · 0.0193825364112854
  39. 38 · Ġen · 0.0053899469785392284
  40. 39 · Ġretard · 0.03540363535284996
  41. 40 · . · 0.003282587742432952
  42. 41 · <|im_end|> · 0.05170406401157379
  43. 42 · Ċ · 0.008082968182861805
  44. 43 · <|im_start|> · 0.05317793786525726
  45. 44 · ass · 0.04472203552722931
  46. 45 · istant · 0.039488811045885086
  47. 46 · Ċ · 0.0038967933505773544

× Positions futures interdites: aucune position future dans cette entrée.

Toute la ligne autorisée est affichée, sans renormaliser. Paramètres et IDs inchangés, représentations calculées différentes.

Le contexte contribue à de nouvelles valeurs calculées, pas à une réécriture du texte initial ni à un nouvel entraînement.

Approfondir

Une tête est un calcul d’attention au sein d’une couche. Afficher son identité, la ligne sélectionnée, les liens omis et leurs poids, sans renormaliser un sous-ensemble caché comme s’il était complet.

La transformation appliquée à chaque position, souvent appelée MLP, change également les valeurs. La normalisation remet des valeurs intermédiaires à l’échelle ; les connexions résiduelles transportent des valeurs antérieures à côté d’une transformation. Leur ordre relève de l’architecture retenue. Une seule carte d’attention n’explique pas entièrement la cause d’une réponse.

This scene in English

S07 · Les scores du modèle ne sont pas notre choix imposé

Message préparé : Écris un message pour prévenir que je serai en retard.

Qui décide du prochain token dans cet exemple pédagogique ?

À la dernière position de l’entrée complète, la représentation finale du modèle donne des scores pour les tokens suivants possibles. Ces scores peuvent être convertis en probabilités.

Scores conditionnels enregistrés. Choix imposé — non sélectionné par le modèle. La probabilité n’est pas la vérité.

  1. Représentation finaleÀ la dernière position du préfixe.
  2. ○ Maximum calculéLe meilleur score du modèle, pas l’auteur de la réponse.
  3. ◇ Cible du scriptLe token imposé, même si son score est plus faible.
Probabilité ≠ vérité. Calculer des scores et imposer un choix sont deux opérations distinctes.◇ Schéma pédagogique · formes et distances illustratives, pas une mesure du modèle.

Scores conditionnels enregistrés. Choix imposé — non sélectionné par le modèle. La probabilité n’est pas la vérité.

Montrez-moi

Le token imposé doit-il forcément avoir le score maximal du modèle ?

Précision d’affichage : les derniers chiffres des nombres peuvent varier à l’export, sans renormalisation. Données canoniques et SHA256 : manifeste des traces.

Contexte exact de ce choix
<|im_start|>system
You are a helpful AI assistant named SmolLM, trained by Hugging Face<|im_end|>
<|im_start|>user
Écris un message pour prévenir que je serai en retard.<|im_end|>
<|im_start|>assistant

Calculs du modèle enregistrés — pour le préfixe affiché · Préfixe du pas 0 · Vue réduite documentée

Représentation finale à la dernière position → logits → softmax du vocabulaire complet.

Probabilité ≠ vérité. Ces scores concernent la continuation du préfixe, pas la fiabilité d’une affirmation.

Maximum du modèle (argmax)

Je · ID 46719 · rank / rang 1

Logit 29.521896362304688 · P 0.12436846336982604 · log(P) -2.08450664070498

Le plus probable pour ce préfixe. Il ne décide pas du token ajouté dans notre exemple.

Choix imposé — non sélectionné par le modèle

Bon · ID 30904 · rank / rang 29

Logit 26.679283142089844 · P 0.0072473466173351 · log(P) -4.927119860919824

Cible hors top 8 — non remontée dans le classement.

Choix imposé — non sélectionné par le modèle · Bon · ID 30904
De la représentation aux probabilités

d0: -1.4330589771270752 d1: -1.9094539880752563 d2: 0.4182783365249634 d3: 0.11701548844575882 d4: 0.7645692825317383 d5: -0.747779369354248 d6: -0.947211742401123 d7: -0.19573858380317688

8 meilleurs candidats et cible imposée. Valeurs de la fixture affichées par le navigateur, notation scientifique si nécessaire ; aucune renormalisation. Logsumexp du vocabulaire complet: 31.606403003009667

  • Je · ID 46719 · rank / rang 1

    Logit 29.521896362304688 · P 0.12436846336982604 · log(P) -2.08450664070498

  • I · ID 57 · rank / rang 2

    Logit 29.077938079833984 · P 0.07978139690651247 · log(P) -2.528464923175683

  • P · ID 64 · rank / rang 3

    Logit 28.49665069580078 · P 0.044612004043674706 · log(P) -3.109752307208886

  • " · ID 18 · rank / rang 4

    Logit 28.16761016845703 · P 0.03210341608057901 · log(P) -3.438792834552636

  • Ãī · ID 39614 · rank / rang 5

    Logit 28.03687286376953 · P 0.028169086119563484 · log(P) -3.569530139240136

  • Il · ID 39393 · rank / rang 6

    Logit 27.938257217407227 · P 0.025523752606602605 · log(P) -3.668145785602441

  • A · ID 49 · rank / rang 7

    Logit 27.872241973876953 · P 0.02389320836796328 · log(P) -3.7341610291327143

  • O · ID 63 · rank / rang 8

    Logit 27.860122680664062 · P 0.023605387187452087 · log(P) -3.746280322345605

Autres tokens : 0.6106959387004912 · 49143 candidats omis.

Ce sont les tokens qui ne sont ni dans le top 8 ni la cible imposée. La probabilité de la cible compte une seule fois, même lorsqu’elle figure dans les deux panneaux. other_probability = masse hors UNION(top8, cible).

Le maximum départage les égalités par ID croissant. Le script impose la cible, même si elle coïncide avec lui. Température 1, aucun filtre ni tirage.

La boucle ordinaire, différente de notre exemple

Dans une génération autorégressive ordinaire, une règle de décodage choisit le token suivant à partir des scores du contexte courant, étend ce contexte et recommence. Elle n’exige pas une réponse complète écrite à l’avance.

Inspecter ≠ sélectionner ≠ ajouter. Aucun token encore ajouté.

L’inspection ne change ni le choix imposé par le script ni les valeurs enregistrées.

Approfondir

Dans une génération autorégressive ordinaire, une règle de décodage choisit le token suivant à partir des scores du contexte courant, étend ce contexte et recommence. Elle n’exige pas une réponse complète écrite à l’avance.

La masse Autres exclut l’union des huit meilleurs candidats et de la cible imposée. Une cible hors top 8 est retirée une seule fois ; aucun softmax sur la seule liste visible.

This scene in English

S08 · Ajouter un token, puis recommencer

Message préparé : Écris un message pour prévenir que je serai en retard.

Qu’est-ce qui change après le choix du premier token ?

Dans une génération ordinaire, chaque token choisi rejoint le contexte utilisé au pas suivant.

Calculs enregistrés pour les préfixes successifs ; tokens imposés par le script. Fin du chemin préparé — pas arrêt choisi par le modèle.

  1. Préfixe actuelL’entrée et les tokens déjà ajoutés.
  2. ◇ Choix imposéLe script fixe le token ; ses scores sont capturés.
  3. Préfixe étenduL’ajout change le contexte du calcul suivant.
Entraînement ≠ génération : les paramètres restent fixes. Ici, on rejoue un chemin guidé, pas une génération autonome.◇ Schéma pédagogique · formes et distances illustratives, pas une mesure du modèle.

Calculs enregistrés pour les préfixes successifs ; tokens imposés par le script. Fin du chemin préparé — pas arrêt choisi par le modèle.

Montrez-moi

Le pas suivant peut-il continuer avec l’ancien contexte ?

Précision d’affichage : les derniers chiffres des nombres peuvent varier à l’export, sans renormalisation. Données canoniques et SHA256 : manifeste des traces.

Tokens imposés ajoutés : 22 / 22.

Bonjour, je serai un peu en retard. Désolé pour l’attente !
Préfixe qui a produit le dernier token ajouté · ID 5728
<|im_start|>system
You are a helpful AI assistant named SmolLM, trained by Hugging Face<|im_end|>
<|im_start|>user
Écris un message pour prévenir que je serai en retard.<|im_end|>
<|im_start|>assistant
Bonjour, je serai un peu en retard. Désolé pour l’attente
Préfixe final — aucun prochain choix capturé · 47 + 22 tokens
<|im_start|>system
You are a helpful AI assistant named SmolLM, trained by Hugging Face<|im_end|>
<|im_start|>user
Écris un message pour prévenir que je serai en retard.<|im_end|>
<|im_start|>assistant
Bonjour, je serai un peu en retard. Désolé pour l’attente !

1, 9690, 198, 2683, 359, 253, 5356, 5646, 11173, 3365, 3511, 308, 34519, 28, 7018, 411, 407, 19712, 8182, 2, 198, 1, 4093, 198, 39614, 83, 4593, 551, 3714, 18244, 694, 2756, 1241, 337, 10168, 16718, 1236, 2554, 430, 26278, 30, 2, 198, 1, 520, 9531, 198, 30904, 24583, 28, 16718, 1236, 2554, 551, 610, 101, 430, 26278, 30, 422, 2756, 4806, 2756, 18244, 303, 417, 2192, 25583, 5728

Fin du chemin préparé — pas arrêt choisi par le modèle: prepared_sequence_end · 22 tokens. Aucun EOS ajouté, aucune distribution terminale inventée.

Journal exact de tous les pas
g=0 → 1 · ID 30904
<|im_start|>system
You are a helpful AI assistant named SmolLM, trained by Hugging Face<|im_end|>
<|im_start|>user
Écris un message pour prévenir que je serai en retard.<|im_end|>
<|im_start|>assistant

1, 9690, 198, 2683, 359, 253, 5356, 5646, 11173, 3365, 3511, 308, 34519, 28, 7018, 411, 407, 19712, 8182, 2, 198, 1, 4093, 198, 39614, 83, 4593, 551, 3714, 18244, 694, 2756, 1241, 337, 10168, 16718, 1236, 2554, 430, 26278, 30, 2, 198, 1, 520, 9531, 198

Calculs du modèle enregistrés — pour le préfixe affiché · Préfixe du pas 0 · Vue réduite documentée

Représentation finale à la dernière position → logits → softmax du vocabulaire complet.

Probabilité ≠ vérité. Ces scores concernent la continuation du préfixe, pas la fiabilité d’une affirmation.

Maximum du modèle (argmax)

Je · ID 46719 · rank / rang 1

Logit 29.521896362304688 · P 0.12436846336982604 · log(P) -2.08450664070498

Le plus probable pour ce préfixe. Il ne décide pas du token ajouté dans notre exemple.

Choix imposé — non sélectionné par le modèle

Bon · ID 30904 · rank / rang 29

Logit 26.679283142089844 · P 0.0072473466173351 · log(P) -4.927119860919824

Cible hors top 8 — non remontée dans le classement.

Choix imposé — non sélectionné par le modèle · Bon · ID 30904
De la représentation aux probabilités

d0: -1.4330589771270752 d1: -1.9094539880752563 d2: 0.4182783365249634 d3: 0.11701548844575882 d4: 0.7645692825317383 d5: -0.747779369354248 d6: -0.947211742401123 d7: -0.19573858380317688

8 meilleurs candidats et cible imposée. Valeurs de la fixture affichées par le navigateur, notation scientifique si nécessaire ; aucune renormalisation. Logsumexp du vocabulaire complet: 31.606403003009667

  • Je · ID 46719 · rank / rang 1

    Logit 29.521896362304688 · P 0.12436846336982604 · log(P) -2.08450664070498

  • I · ID 57 · rank / rang 2

    Logit 29.077938079833984 · P 0.07978139690651247 · log(P) -2.528464923175683

  • P · ID 64 · rank / rang 3

    Logit 28.49665069580078 · P 0.044612004043674706 · log(P) -3.109752307208886

  • " · ID 18 · rank / rang 4

    Logit 28.16761016845703 · P 0.03210341608057901 · log(P) -3.438792834552636

  • Ãī · ID 39614 · rank / rang 5

    Logit 28.03687286376953 · P 0.028169086119563484 · log(P) -3.569530139240136

  • Il · ID 39393 · rank / rang 6

    Logit 27.938257217407227 · P 0.025523752606602605 · log(P) -3.668145785602441

  • A · ID 49 · rank / rang 7

    Logit 27.872241973876953 · P 0.02389320836796328 · log(P) -3.7341610291327143

  • O · ID 63 · rank / rang 8

    Logit 27.860122680664062 · P 0.023605387187452087 · log(P) -3.746280322345605

Autres tokens : 0.6106959387004912 · 49143 candidats omis.

Ce sont les tokens qui ne sont ni dans le top 8 ni la cible imposée. La probabilité de la cible compte une seule fois, même lorsqu’elle figure dans les deux panneaux. other_probability = masse hors UNION(top8, cible).

Le maximum départage les égalités par ID croissant. Le script impose la cible, même si elle coïncide avec lui. Température 1, aucun filtre ni tirage.

La boucle ordinaire, différente de notre exemple

Dans une génération autorégressive ordinaire, une règle de décodage choisit le token suivant à partir des scores du contexte courant, étend ce contexte et recommence. Elle n’exige pas une réponse complète écrite à l’avance.

Bon
g=1 → 2 · ID 24583
<|im_start|>system
You are a helpful AI assistant named SmolLM, trained by Hugging Face<|im_end|>
<|im_start|>user
Écris un message pour prévenir que je serai en retard.<|im_end|>
<|im_start|>assistant
Bon

1, 9690, 198, 2683, 359, 253, 5356, 5646, 11173, 3365, 3511, 308, 34519, 28, 7018, 411, 407, 19712, 8182, 2, 198, 1, 4093, 198, 39614, 83, 4593, 551, 3714, 18244, 694, 2756, 1241, 337, 10168, 16718, 1236, 2554, 430, 26278, 30, 2, 198, 1, 520, 9531, 198, 30904

Calculs du modèle enregistrés — pour le préfixe affiché · Préfixe du pas 1 · Vue réduite documentée

Représentation finale à la dernière position → logits → softmax du vocabulaire complet.

Probabilité ≠ vérité. Ces scores concernent la continuation du préfixe, pas la fiabilité d’une affirmation.

Maximum du modèle (argmax)

jour · ID 24583 · rank / rang 1

Logit 22.073823928833008 · P 0.973072909789434 · log(P) -0.027296266623576315

Le plus probable pour ce préfixe. Il ne décide pas du token ajouté dans notre exemple.

Choix imposé — non sélectionné par le modèle

jour · ID 24583 · rank / rang 1

Logit 22.073823928833008 · P 0.973072909789434 · log(P) -0.027296266623576315

Cible déjà comprise dans le top 8 ; sa probabilité n’est comptée qu’une fois.

Choix imposé — non sélectionné par le modèle · jour · ID 24583
De la représentation aux probabilités

d0: -2.9087820053100586 d1: -3.610962867736816 d2: 0.3395976126194 d3: -1.3137314319610596 d4: 0.6003316640853882 d5: -1.84756863117218 d6: -0.7222286462783813 d7: -3.3083014488220215

8 meilleurs candidats et cible imposée. Valeurs de la fixture affichées par le navigateur, notation scientifique si nécessaire ; aucune renormalisation. Logsumexp du vocabulaire complet: 22.101120195456584

  • jour · ID 24583 · rank / rang 1

    Logit 22.073823928833008 · P 0.973072909789434 · log(P) -0.027296266623576315

  • ne · ID 662 · rank / rang 2

    Logit 17.506574630737305 · P 0.010106812629785364 · log(P) -4.594545564719279

  • so · ID 559 · rank / rang 3

    Logit 17.02890968322754 · P 0.0062685481120451315 · log(P) -5.072210512229045

  • ci · ID 605 · rank / rang 4

    Logit 15.676040649414062 · P 0.0016204043760471578 · log(P) -6.425079546042522

  • , · ID 28 · rank / rang 5

    Logit 15.345574378967283 · P 0.0011644041098775766 · log(P) -6.755545816489299

  • Ġcourage · ID 9664 · rank / rang 6

    Logit 14.765352249145508 · P 0.0006518031581414293 · log(P) -7.335767946311076

  • Ġvoyage · ID 19102 · rank / rang 7

    Logit 14.70380687713623 · P 0.0006128972107917511 · log(P) -7.397313318320354

  • Ġj · ID 544 · rank / rang 8

    Logit 14.18800926208496 · P 0.0003659144725706563 · log(P) -7.913110933371623

Autres tokens : 0.006136306141304985 · 49144 candidats omis.

Ce sont les tokens qui ne sont ni dans le top 8 ni la cible imposée. La probabilité de la cible compte une seule fois, même lorsqu’elle figure dans les deux panneaux. other_probability = masse hors UNION(top8, cible).

Le maximum départage les égalités par ID croissant. Le script impose la cible, même si elle coïncide avec lui. Température 1, aucun filtre ni tirage.

La boucle ordinaire, différente de notre exemple

Dans une génération autorégressive ordinaire, une règle de décodage choisit le token suivant à partir des scores du contexte courant, étend ce contexte et recommence. Elle n’exige pas une réponse complète écrite à l’avance.

Bonjour
g=2 → 3 · ID 28
<|im_start|>system
You are a helpful AI assistant named SmolLM, trained by Hugging Face<|im_end|>
<|im_start|>user
Écris un message pour prévenir que je serai en retard.<|im_end|>
<|im_start|>assistant
Bonjour

1, 9690, 198, 2683, 359, 253, 5356, 5646, 11173, 3365, 3511, 308, 34519, 28, 7018, 411, 407, 19712, 8182, 2, 198, 1, 4093, 198, 39614, 83, 4593, 551, 3714, 18244, 694, 2756, 1241, 337, 10168, 16718, 1236, 2554, 430, 26278, 30, 2, 198, 1, 520, 9531, 198, 30904, 24583

Calculs du modèle enregistrés — pour le préfixe affiché · Préfixe du pas 2 · Vue réduite documentée

Représentation finale à la dernière position → logits → softmax du vocabulaire complet.

Probabilité ≠ vérité. Ces scores concernent la continuation du préfixe, pas la fiabilité d’une affirmation.

Maximum du modèle (argmax)

. · ID 30 · rank / rang 1

Logit 13.586103439331056 · P 0.4137145018573275 · log(P) -0.8825791520867821

Le plus probable pour ce préfixe. Il ne décide pas du token ajouté dans notre exemple.

Choix imposé — non sélectionné par le modèle

, · ID 28 · rank / rang 2

Logit 13.579950332641602 · P 0.4111766881147335 · log(P) -0.8887322587762352

Cible déjà comprise dans le top 8 ; sa probabilité n’est comptée qu’une fois.

Choix imposé — non sélectionné par le modèle · , · ID 28
De la représentation aux probabilités

d0: -0.228873074054718 d1: -2.201641082763672 d2: 0.7894116044044495 d3: 0.24131017923355105 d4: 2.032252311706543 d5: -2.2423629760742188 d6: -2.132188081741333 d7: -0.17613479495048523

8 meilleurs candidats et cible imposée. Valeurs de la fixture affichées par le navigateur, notation scientifique si nécessaire ; aucune renormalisation. Logsumexp du vocabulaire complet: 14.468682591417837

  • . · ID 30 · rank / rang 1

    Logit 13.586103439331056 · P 0.4137145018573275 · log(P) -0.8825791520867821

  • , · ID 28 · rank / rang 2

    Logit 13.579950332641602 · P 0.4111766881147335 · log(P) -0.8887322587762352

  • ! · ID 17 · rank / rang 3

    Logit 12.090697288513184 · P 0.09273722684783088 · log(P) -2.377985302904653

  • Ġet · ID 1482 · rank / rang 4

    Logit 9.719011306762695 · P 0.008654539615568337 · log(P) -4.749671284655141

  • ĠÃł · ID 25782 · rank / rang 5

    Logit 9.417637825012209 · P 0.006402640686783166 · log(P) -5.05104476640563

  • Ġm · ID 283 · rank / rang 6

    Logit 9.19094467163086 · P 0.0051039633184630446 · log(P) -5.277737919786977

  • ... · ID 2026 · rank / rang 7

    Logit 9.06790542602539 · P 0.0045130721758345465 · log(P) -5.400777165392446

  • Ġ! · ID 5728 · rank / rang 8

    Logit 8.841423988342285 · P 0.0035984265335611476 · log(P) -5.627258603075552

Autres tokens : 0.054098940849897456 · 49144 candidats omis.

Ce sont les tokens qui ne sont ni dans le top 8 ni la cible imposée. La probabilité de la cible compte une seule fois, même lorsqu’elle figure dans les deux panneaux. other_probability = masse hors UNION(top8, cible).

Le maximum départage les égalités par ID croissant. Le script impose la cible, même si elle coïncide avec lui. Température 1, aucun filtre ni tirage.

La boucle ordinaire, différente de notre exemple

Dans une génération autorégressive ordinaire, une règle de décodage choisit le token suivant à partir des scores du contexte courant, étend ce contexte et recommence. Elle n’exige pas une réponse complète écrite à l’avance.

Bonjour,
g=3 → 4 · ID 16718
<|im_start|>system
You are a helpful AI assistant named SmolLM, trained by Hugging Face<|im_end|>
<|im_start|>user
Écris un message pour prévenir que je serai en retard.<|im_end|>
<|im_start|>assistant
Bonjour,

1, 9690, 198, 2683, 359, 253, 5356, 5646, 11173, 3365, 3511, 308, 34519, 28, 7018, 411, 407, 19712, 8182, 2, 198, 1, 4093, 198, 39614, 83, 4593, 551, 3714, 18244, 694, 2756, 1241, 337, 10168, 16718, 1236, 2554, 430, 26278, 30, 2, 198, 1, 520, 9531, 198, 30904, 24583, 28

Calculs du modèle enregistrés — pour le préfixe affiché · Préfixe du pas 3 · Vue réduite documentée

Représentation finale à la dernière position → logits → softmax du vocabulaire complet.

Probabilité ≠ vérité. Ces scores concernent la continuation du préfixe, pas la fiabilité d’une affirmation.

Maximum du modèle (argmax)

Ġje · ID 16718 · rank / rang 1

Logit 15.923510551452637 · P 0.271015143215405 · log(P) -1.305580580639976

Le plus probable pour ce préfixe. Il ne décide pas du token ajouté dans notre exemple.

Choix imposé — non sélectionné par le modèle

Ġje · ID 16718 · rank / rang 1

Logit 15.923510551452637 · P 0.271015143215405 · log(P) -1.305580580639976

Cible déjà comprise dans le top 8 ; sa probabilité n’est comptée qu’une fois.

Choix imposé — non sélectionné par le modèle · Ġje · ID 16718
De la représentation aux probabilités

d0: -1.1670832633972168 d1: -1.5306396484375 d2: 1.0043869018554688 d3: 0.31430262327194214 d4: 3.0947186946868896 d5: -1.0508641004562378 d6: -0.5993603467941284 d7: -0.9445556998252868

8 meilleurs candidats et cible imposée. Valeurs de la fixture affichées par le navigateur, notation scientifique si nécessaire ; aucune renormalisation. Logsumexp du vocabulaire complet: 17.229091132092613

  • Ġje · ID 16718 · rank / rang 1

    Logit 15.923510551452637 · P 0.271015143215405 · log(P) -1.305580580639976

  • Ġm · ID 283 · rank / rang 2

    Logit 14.233381271362305 · P 0.050001120653742605 · log(P) -2.995709860730308

  • Ġmes · ID 11450 · rank / rang 3

    Logit 14.04343605041504 · P 0.041351148546722435 · log(P) -3.1856550816775737

  • Ġj · ID 544 · rank / rang 4

    Logit 13.919782638549805 · P 0.036541433656369374 · log(P) -3.309308493542808

  • Ġc · ID 265 · rank / rang 5

    Logit 13.90509033203125 · P 0.036008480455433915 · log(P) -3.324000800061363

  • Ġvot · ID 11279 · rank / rang 6

    Logit 13.81171417236328 · P 0.03279835360801841 · log(P) -3.4173769597293315

  • Ġv · ID 386 · rank / rang 7

    Logit 13.787216186523438 · P 0.03200462211340283 · log(P) -3.4418749455691753

  • Ġon · ID 335 · rank / rang 8

    Logit 13.680167198181152 · P 0.02875556590123552 · log(P) -3.5489239339114604

Autres tokens : 0.47152413184966857 · 49144 candidats omis.

Ce sont les tokens qui ne sont ni dans le top 8 ni la cible imposée. La probabilité de la cible compte une seule fois, même lorsqu’elle figure dans les deux panneaux. other_probability = masse hors UNION(top8, cible).

Le maximum départage les égalités par ID croissant. Le script impose la cible, même si elle coïncide avec lui. Température 1, aucun filtre ni tirage.

La boucle ordinaire, différente de notre exemple

Dans une génération autorégressive ordinaire, une règle de décodage choisit le token suivant à partir des scores du contexte courant, étend ce contexte et recommence. Elle n’exige pas une réponse complète écrite à l’avance.

Bonjour, je
g=4 → 5 · ID 1236
<|im_start|>system
You are a helpful AI assistant named SmolLM, trained by Hugging Face<|im_end|>
<|im_start|>user
Écris un message pour prévenir que je serai en retard.<|im_end|>
<|im_start|>assistant
Bonjour, je

1, 9690, 198, 2683, 359, 253, 5356, 5646, 11173, 3365, 3511, 308, 34519, 28, 7018, 411, 407, 19712, 8182, 2, 198, 1, 4093, 198, 39614, 83, 4593, 551, 3714, 18244, 694, 2756, 1241, 337, 10168, 16718, 1236, 2554, 430, 26278, 30, 2, 198, 1, 520, 9531, 198, 30904, 24583, 28, 16718

Calculs du modèle enregistrés — pour le préfixe affiché · Préfixe du pas 4 · Vue réduite documentée

Représentation finale à la dernière position → logits → softmax du vocabulaire complet.

Probabilité ≠ vérité. Ces scores concernent la continuation du préfixe, pas la fiabilité d’une affirmation.

Maximum du modèle (argmax)

Ġv · ID 386 · rank / rang 1

Logit 16.843231201171875 · P 0.20722109270515315 · log(P) -1.573968975007908

Le plus probable pour ce préfixe. Il ne décide pas du token ajouté dans notre exemple.

Choix imposé — non sélectionné par le modèle

Ġser · ID 1236 · rank / rang 7

Logit 14.995488166809082 · P 0.032656478856201994 · log(P) -3.421712009370701

Cible déjà comprise dans le top 8 ; sa probabilité n’est comptée qu’une fois.

Choix imposé — non sélectionné par le modèle · Ġser · ID 1236
De la représentation aux probabilités

d0: 0.24815835058689115 d1: -0.4923732280731201 d2: -0.9667584896087646 d3: -0.1231997087597847 d4: 0.8510195016860962 d5: -2.6437599658966064 d6: 1.4744571447372437 d7: 0.8924923539161682

8 meilleurs candidats et cible imposée. Valeurs de la fixture affichées par le navigateur, notation scientifique si nécessaire ; aucune renormalisation. Logsumexp du vocabulaire complet: 18.417200176179783

  • Ġv · ID 386 · rank / rang 1

    Logit 16.843231201171875 · P 0.20722109270515315 · log(P) -1.573968975007908

  • Ġsu · ID 393 · rank / rang 2

    Logit 16.455942153930664 · P 0.1406813293095 · log(P) -1.961258022249119

  • Ġpe · ID 610 · rank / rang 3

    Logit 15.698829650878906 · P 0.06598218317449493 · log(P) -2.7183705253008767

  • Ġne · ID 420 · rank / rang 4

    Logit 15.423049926757812 · P 0.05007916380961869 · log(P) -2.9941502494219705

  • Ġp · ID 273 · rank / rang 5

    Logit 15.245500564575195 · P 0.04193226873412697 · log(P) -3.1716996116045877

  • Ġn · ID 304 · rank / rang 6

    Logit 15.236151695251465 · P 0.041542076204710635 · log(P) -3.181048480928318

  • Ġser · ID 1236 · rank / rang 7

    Logit 14.995488166809082 · P 0.032656478856201994 · log(P) -3.421712009370701

  • Ġtrou · ID 4872 · rank / rang 8

    Logit 14.87564182281494 · P 0.028968149276948404 · log(P) -3.5415583533648416

Autres tokens : 0.3909372579292436 · 49144 candidats omis.

Ce sont les tokens qui ne sont ni dans le top 8 ni la cible imposée. La probabilité de la cible compte une seule fois, même lorsqu’elle figure dans les deux panneaux. other_probability = masse hors UNION(top8, cible).

Le maximum départage les égalités par ID croissant. Le script impose la cible, même si elle coïncide avec lui. Température 1, aucun filtre ni tirage.

La boucle ordinaire, différente de notre exemple

Dans une génération autorégressive ordinaire, une règle de décodage choisit le token suivant à partir des scores du contexte courant, étend ce contexte et recommence. Elle n’exige pas une réponse complète écrite à l’avance.

Bonjour, je ser
g=5 → 6 · ID 2554
<|im_start|>system
You are a helpful AI assistant named SmolLM, trained by Hugging Face<|im_end|>
<|im_start|>user
Écris un message pour prévenir que je serai en retard.<|im_end|>
<|im_start|>assistant
Bonjour, je ser

1, 9690, 198, 2683, 359, 253, 5356, 5646, 11173, 3365, 3511, 308, 34519, 28, 7018, 411, 407, 19712, 8182, 2, 198, 1, 4093, 198, 39614, 83, 4593, 551, 3714, 18244, 694, 2756, 1241, 337, 10168, 16718, 1236, 2554, 430, 26278, 30, 2, 198, 1, 520, 9531, 198, 30904, 24583, 28, 16718, 1236

Calculs du modèle enregistrés — pour le préfixe affiché · Préfixe du pas 5 · Vue réduite documentée

Représentation finale à la dernière position → logits → softmax du vocabulaire complet.

Probabilité ≠ vérité. Ces scores concernent la continuation du préfixe, pas la fiabilité d’une affirmation.

Maximum du modèle (argmax)

ai · ID 2554 · rank / rang 1

Logit 31.34700584411621 · P 0.8413105765076481 · log(P) -0.17279439287994336

Le plus probable pour ce préfixe. Il ne décide pas du token ajouté dans notre exemple.

Choix imposé — non sélectionné par le modèle

ai · ID 2554 · rank / rang 1

Logit 31.34700584411621 · P 0.8413105765076481 · log(P) -0.17279439287994336

Cible déjà comprise dans le top 8 ; sa probabilité n’est comptée qu’une fois.

Choix imposé — non sélectionné par le modèle · ai · ID 2554
De la représentation aux probabilités

d0: 0.04796348139643669 d1: -1.136173129081726 d2: 1.0586717128753662 d3: 1.0563223361968994 d4: 2.424827337265014 d5: -3.112288236618042 d6: 2.120153427124023 d7: 0.2560725808143616

8 meilleurs candidats et cible imposée. Valeurs de la fixture affichées par le navigateur, notation scientifique si nécessaire ; aucune renormalisation. Logsumexp du vocabulaire complet: 31.51980023699615

  • ai · ID 2554 · rank / rang 1

    Logit 31.34700584411621 · P 0.8413105765076481 · log(P) -0.17279439287994336

  • a · ID 81 · rank / rang 2

    Logit 28.919668197631836 · P 0.07426377182570972 · log(P) -2.6001320393643184

  • ais · ID 10117 · rank / rang 3

    Logit 28.868629455566406 · P 0.0705685443351365 · log(P) -2.651170781429748

  • as · ID 292 · rank / rang 4

    Logit 26.361080169677734 · P 0.005749053379842532 · log(P) -5.15872006731842

  • ie · ID 519 · rank / rang 5

    Logit 25.32353782653809 · P 0.002037030007837164 · log(P) -6.196262410458068

  • ait · ID 2889 · rank / rang 6

    Logit 24.91974449157715 · P 0.001360292205375306 · log(P) -6.600055745419006

  • oit · ID 39874 · rank / rang 7

    Logit 24.235183715820312 · P 0.000686011256709263 · log(P) -7.284616521175842

  • ons · ID 707 · rank / rang 8

    Logit 24.207691192626953 · P 0.000667407973660835 · log(P) -7.312109044369201

Autres tokens : 0.00335731250807944 · 49144 candidats omis.

Ce sont les tokens qui ne sont ni dans le top 8 ni la cible imposée. La probabilité de la cible compte une seule fois, même lorsqu’elle figure dans les deux panneaux. other_probability = masse hors UNION(top8, cible).

Le maximum départage les égalités par ID croissant. Le script impose la cible, même si elle coïncide avec lui. Température 1, aucun filtre ni tirage.

La boucle ordinaire, différente de notre exemple

Dans une génération autorégressive ordinaire, une règle de décodage choisit le token suivant à partir des scores du contexte courant, étend ce contexte et recommence. Elle n’exige pas une réponse complète écrite à l’avance.

Bonjour, je serai
g=6 → 7 · ID 551
<|im_start|>system
You are a helpful AI assistant named SmolLM, trained by Hugging Face<|im_end|>
<|im_start|>user
Écris un message pour prévenir que je serai en retard.<|im_end|>
<|im_start|>assistant
Bonjour, je serai

1, 9690, 198, 2683, 359, 253, 5356, 5646, 11173, 3365, 3511, 308, 34519, 28, 7018, 411, 407, 19712, 8182, 2, 198, 1, 4093, 198, 39614, 83, 4593, 551, 3714, 18244, 694, 2756, 1241, 337, 10168, 16718, 1236, 2554, 430, 26278, 30, 2, 198, 1, 520, 9531, 198, 30904, 24583, 28, 16718, 1236, 2554

Calculs du modèle enregistrés — pour le préfixe affiché · Préfixe du pas 6 · Vue réduite documentée

Représentation finale à la dernière position → logits → softmax du vocabulaire complet.

Probabilité ≠ vérité. Ces scores concernent la continuation du préfixe, pas la fiabilité d’une affirmation.

Maximum du modèle (argmax)

Ġen · ID 430 · rank / rang 1

Logit 21.85861587524414 · P 0.4396672976430814 · log(P) -0.8217369798094403

Le plus probable pour ce préfixe. Il ne décide pas du token ajouté dans notre exemple.

Choix imposé — non sélectionné par le modèle

Ġun · ID 551 · rank / rang 41

Logit 16.834623336791992 · P 0.0028922240126537926 · log(P) -5.845729518261589

Cible hors top 8 — non remontée dans le classement.

Choix imposé — non sélectionné par le modèle · Ġun · ID 551
De la représentation aux probabilités

d0: -0.5852891802787781 d1: -1.926147222518921 d2: 0.49363112449646 d3: 0.6814907193183899 d4: 1.1125035285949707 d5: -2.7482149600982666 d6: -0.6264455318450928 d7: 0.12376491725444794

8 meilleurs candidats et cible imposée. Valeurs de la fixture affichées par le navigateur, notation scientifique si nécessaire ; aucune renormalisation. Logsumexp du vocabulaire complet: 22.68035285505358

  • Ġen · ID 430 · rank / rang 1

    Logit 21.85861587524414 · P 0.4396672976430814 · log(P) -0.8217369798094403

  • ĠÃł · ID 25782 · rank / rang 2

    Logit 19.3731689453125 · P 0.036619151524235234 · log(P) -3.307183909741081

  • Ġin · ID 281 · rank / rang 3

    Logit 18.90243148803711 · P 0.022870180763615786 · log(P) -3.777921367016471

  • Ġa · ID 253 · rank / rang 4

    Logit 18.891342163085938 · P 0.022617966922677465 · log(P) -3.7890106919676434

  • Ġpr · ID 694 · rank / rang 5

    Logit 18.86572265625 · P 0.022045865533862914 · log(P) -3.814630198803581

  • Ġenc · ID 1570 · rank / rang 6

    Logit 18.595014572143555 · P 0.016817449297912016 · log(P) -4.085338282910026

  • Ġinv · ID 797 · rank / rang 7

    Logit 18.496395111083984 · P 0.01523807964865089 · log(P) -4.1839577439695965

  • Ġn · ID 304 · rank / rang 8

    Logit 18.33666229248047 · P 0.012988504751651316 · log(P) -4.343690562573112

Autres tokens : 0.40824327990166065 · 49143 candidats omis.

Ce sont les tokens qui ne sont ni dans le top 8 ni la cible imposée. La probabilité de la cible compte une seule fois, même lorsqu’elle figure dans les deux panneaux. other_probability = masse hors UNION(top8, cible).

Le maximum départage les égalités par ID croissant. Le script impose la cible, même si elle coïncide avec lui. Température 1, aucun filtre ni tirage.

La boucle ordinaire, différente de notre exemple

Dans une génération autorégressive ordinaire, une règle de décodage choisit le token suivant à partir des scores du contexte courant, étend ce contexte et recommence. Elle n’exige pas une réponse complète écrite à l’avance.

Bonjour, je serai un
g=7 → 8 · ID 610
<|im_start|>system
You are a helpful AI assistant named SmolLM, trained by Hugging Face<|im_end|>
<|im_start|>user
Écris un message pour prévenir que je serai en retard.<|im_end|>
<|im_start|>assistant
Bonjour, je serai un

1, 9690, 198, 2683, 359, 253, 5356, 5646, 11173, 3365, 3511, 308, 34519, 28, 7018, 411, 407, 19712, 8182, 2, 198, 1, 4093, 198, 39614, 83, 4593, 551, 3714, 18244, 694, 2756, 1241, 337, 10168, 16718, 1236, 2554, 430, 26278, 30, 2, 198, 1, 520, 9531, 198, 30904, 24583, 28, 16718, 1236, 2554, 551

Calculs du modèle enregistrés — pour le préfixe affiché · Préfixe du pas 7 · Vue réduite documentée

Représentation finale à la dernière position → logits → softmax du vocabulaire complet.

Probabilité ≠ vérité. Ces scores concernent la continuation du préfixe, pas la fiabilité d’une affirmation.

Maximum du modèle (argmax)

Ġmessage · ID 3714 · rank / rang 1

Logit 20.616283416748047 · P 0.6625438297054671 · log(P) -0.4116685652641188

Le plus probable pour ce préfixe. Il ne décide pas du token ajouté dans notre exemple.

Choix imposé — non sélectionné par le modèle

Ġpe · ID 610 · rank / rang 14

Logit 15.46423053741455 · P 0.003834480007589331 · log(P) -5.563721444597615

Cible hors top 8 — non remontée dans le classement.

Choix imposé — non sélectionné par le modèle · Ġpe · ID 610
De la représentation aux probabilités

d0: -1.3401639461517334 d1: -2.4986860752105713 d2: -1.5055934190750122 d3: 0.4252994358539582 d4: 0.7995864748954773 d5: -1.8998100757598877 d6: -2.2451865673065186 d7: 0.4825330376625061

8 meilleurs candidats et cible imposée. Valeurs de la fixture affichées par le navigateur, notation scientifique si nécessaire ; aucune renormalisation. Logsumexp du vocabulaire complet: 21.02795198201217

  • Ġmessage · ID 3714 · rank / rang 1

    Logit 20.616283416748047 · P 0.6625438297054671 · log(P) -0.4116685652641188

  • Ġm · ID 283 · rank / rang 2

    Logit 17.60266876220703 · P 0.03254006369340639 · log(P) -3.4252832198051344

  • Ġdé · ID 32564 · rank / rang 3

    Logit 16.703170776367188 · P 0.013236445839373494 · log(P) -4.324781205644978

  • Ġperson · ID 1055 · rank / rang 4

    Logit 16.681598663330078 · P 0.012953965536438253 · log(P) -4.3463533186820875

  • Ġj · ID 544 · rank / rang 5

    Logit 16.48642349243164 · P 0.010657104824502418 · log(P) -4.541528489580525

  • Ġbon · ID 14047 · rank / rang 6

    Logit 16.18437957763672 · P 0.007878857252274725 · log(P) -4.843572404375447

  • Ġn · ID 304 · rank / rang 7

    Logit 16.132854461669922 · P 0.00748317942609542 · log(P) -4.895097520342244

  • Ġprob · ID 2245 · rank / rang 8

    Logit 16.108356475830078 · P 0.007302083897297316 · log(P) -4.9195955061820875

Autres tokens : 0.2415699898175541 · 49143 candidats omis.

Ce sont les tokens qui ne sont ni dans le top 8 ni la cible imposée. La probabilité de la cible compte une seule fois, même lorsqu’elle figure dans les deux panneaux. other_probability = masse hors UNION(top8, cible).

Le maximum départage les égalités par ID croissant. Le script impose la cible, même si elle coïncide avec lui. Température 1, aucun filtre ni tirage.

La boucle ordinaire, différente de notre exemple

Dans une génération autorégressive ordinaire, une règle de décodage choisit le token suivant à partir des scores du contexte courant, étend ce contexte et recommence. Elle n’exige pas une réponse complète écrite à l’avance.

Bonjour, je serai un pe
g=8 → 9 · ID 101
<|im_start|>system
You are a helpful AI assistant named SmolLM, trained by Hugging Face<|im_end|>
<|im_start|>user
Écris un message pour prévenir que je serai en retard.<|im_end|>
<|im_start|>assistant
Bonjour, je serai un pe

1, 9690, 198, 2683, 359, 253, 5356, 5646, 11173, 3365, 3511, 308, 34519, 28, 7018, 411, 407, 19712, 8182, 2, 198, 1, 4093, 198, 39614, 83, 4593, 551, 3714, 18244, 694, 2756, 1241, 337, 10168, 16718, 1236, 2554, 430, 26278, 30, 2, 198, 1, 520, 9531, 198, 30904, 24583, 28, 16718, 1236, 2554, 551, 610

Calculs du modèle enregistrés — pour le préfixe affiché · Préfixe du pas 8 · Vue réduite documentée

Représentation finale à la dernière position → logits → softmax du vocabulaire complet.

Probabilité ≠ vérité. Ces scores concernent la continuation du préfixe, pas la fiabilité d’une affirmation.

Maximum du modèle (argmax)

u · ID 101 · rank / rang 1

Logit 30.223201751708984 · P 0.9683290499021606 · log(P) -0.032183321882975235

Le plus probable pour ce préfixe. Il ne décide pas du token ajouté dans notre exemple.

Choix imposé — non sélectionné par le modèle

u · ID 101 · rank / rang 1

Logit 30.223201751708984 · P 0.9683290499021606 · log(P) -0.032183321882975235

Cible déjà comprise dans le top 8 ; sa probabilité n’est comptée qu’une fois.

Choix imposé — non sélectionné par le modèle · u · ID 101
De la représentation aux probabilités

d0: -1.5508224964141846 d1: 0.18414363265037537 d2: 0.309644490480423 d3: -1.1496139764785769 d4: 0.7827787399291992 d5: 0.2243398278951645 d6: -0.9707961082458496 d7: 0.8376893401145935

8 meilleurs candidats et cible imposée. Valeurs de la fixture affichées par le navigateur, notation scientifique si nécessaire ; aucune renormalisation. Logsumexp du vocabulaire complet: 30.25538507359196

  • u · ID 101 · rank / rang 1

    Logit 30.223201751708984 · P 0.9683290499021606 · log(P) -0.032183321882975235

  • ut · ID 316 · rank / rang 2

    Logit 25.99802017211914 · P 0.014159565142368855 · log(P) -4.257364901472819

  • ur · ID 315 · rank / rang 3

    Logit 24.934144973754883 · P 0.004886689982742085 · log(P) -5.321240099837077

  • uple · ID 11447 · rank / rang 4

    Logit 24.545934677124023 · P 0.003314493701842442 · log(P) -5.709450396467936

  • ine · ID 462 · rank / rang 5

    Logit 24.206768035888672 · P 0.002361125096591271 · log(P) -6.048617037703288

  • int · ID 591 · rank / rang 6

    Logit 24.1330509185791 · P 0.002193330410280305 · log(P) -6.122334155012858

  • au · ID 603 · rank / rang 7

    Logit 23.788991928100582 · P 0.0015548236541216955 · log(P) -6.466393145491374

  • cl · ID 497 · rank / rang 8

    Logit 23.24001121520996 · P 0.0008979700353894512 · log(P) -7.015373858381999

Autres tokens : 0.002302952074501911 · 49144 candidats omis.

Ce sont les tokens qui ne sont ni dans le top 8 ni la cible imposée. La probabilité de la cible compte une seule fois, même lorsqu’elle figure dans les deux panneaux. other_probability = masse hors UNION(top8, cible).

Le maximum départage les égalités par ID croissant. Le script impose la cible, même si elle coïncide avec lui. Température 1, aucun filtre ni tirage.

La boucle ordinaire, différente de notre exemple

Dans une génération autorégressive ordinaire, une règle de décodage choisit le token suivant à partir des scores du contexte courant, étend ce contexte et recommence. Elle n’exige pas une réponse complète écrite à l’avance.

Bonjour, je serai un peu
g=9 → 10 · ID 430
<|im_start|>system
You are a helpful AI assistant named SmolLM, trained by Hugging Face<|im_end|>
<|im_start|>user
Écris un message pour prévenir que je serai en retard.<|im_end|>
<|im_start|>assistant
Bonjour, je serai un peu

1, 9690, 198, 2683, 359, 253, 5356, 5646, 11173, 3365, 3511, 308, 34519, 28, 7018, 411, 407, 19712, 8182, 2, 198, 1, 4093, 198, 39614, 83, 4593, 551, 3714, 18244, 694, 2756, 1241, 337, 10168, 16718, 1236, 2554, 430, 26278, 30, 2, 198, 1, 520, 9531, 198, 30904, 24583, 28, 16718, 1236, 2554, 551, 610, 101

Calculs du modèle enregistrés — pour le préfixe affiché · Préfixe du pas 9 · Vue réduite documentée

Représentation finale à la dernière position → logits → softmax du vocabulaire complet.

Probabilité ≠ vérité. Ces scores concernent la continuation du préfixe, pas la fiabilité d’une affirmation.

Maximum du modèle (argmax)

ĠÃł · ID 25782 · rank / rang 1

Logit 21.922157287597656 · P 0.11263367191710656 · log(P) -2.1836145678637315

Le plus probable pour ce préfixe. Il ne décide pas du token ajouté dans notre exemple.

Choix imposé — non sélectionné par le modèle

Ġen · ID 430 · rank / rang 3

Logit 21.296825408935547 · P 0.06026845499602337 · log(P) -2.808946446525841

Cible déjà comprise dans le top 8 ; sa probabilité n’est comptée qu’une fois.

Choix imposé — non sélectionné par le modèle · Ġen · ID 430
De la représentation aux probabilités

d0: -0.92387193441391 d1: -1.8891764879226685 d2: -0.05699828267097473 d3: 1.1937453746795654 d4: 1.915796995162964 d5: -1.885244607925415 d6: -2.0967979431152344 d7: 0.463190883398056

8 meilleurs candidats et cible imposée. Valeurs de la fixture affichées par le navigateur, notation scientifique si nécessaire ; aucune renormalisation. Logsumexp du vocabulaire complet: 24.105771855461388

  • ĠÃł · ID 25782 · rank / rang 1

    Logit 21.922157287597656 · P 0.11263367191710656 · log(P) -2.1836145678637315

  • Ġplus · ID 8055 · rank / rang 2

    Logit 21.305438995361328 · P 0.06078982475006533 · log(P) -2.8003328601000597

  • Ġen · ID 430 · rank / rang 3

    Logit 21.296825408935547 · P 0.06026845499602337 · log(P) -2.808946446525841

  • Ġpr · ID 694 · rank / rang 4

    Logit 20.854461669921875 · P 0.03872343969041945 · log(P) -3.251310185539513

  • Ġde · ID 367 · rank / rang 5

    Logit 20.723941802978516 · P 0.03398520308479383 · log(P) -3.381830052482872

  • Ġm · ID 283 · rank / rang 6

    Logit 20.488082885742188 · P 0.026844643645416943 · log(P) -3.6176889697192

  • Ġdé · ID 32564 · rank / rang 7

    Logit 20.382795333862305 · P 0.02416194216314387 · log(P) -3.722976521599083

  • Ġd · ID 287 · rank / rang 8

    Logit 20.33281517028809 · P 0.022984006254679216 · log(P) -3.772956685173302

Autres tokens : 0.6196088134983518 · 49144 candidats omis.

Ce sont les tokens qui ne sont ni dans le top 8 ni la cible imposée. La probabilité de la cible compte une seule fois, même lorsqu’elle figure dans les deux panneaux. other_probability = masse hors UNION(top8, cible).

Le maximum départage les égalités par ID croissant. Le script impose la cible, même si elle coïncide avec lui. Température 1, aucun filtre ni tirage.

La boucle ordinaire, différente de notre exemple

Dans une génération autorégressive ordinaire, une règle de décodage choisit le token suivant à partir des scores du contexte courant, étend ce contexte et recommence. Elle n’exige pas une réponse complète écrite à l’avance.

Bonjour, je serai un peu en
g=10 → 11 · ID 26278
<|im_start|>system
You are a helpful AI assistant named SmolLM, trained by Hugging Face<|im_end|>
<|im_start|>user
Écris un message pour prévenir que je serai en retard.<|im_end|>
<|im_start|>assistant
Bonjour, je serai un peu en

1, 9690, 198, 2683, 359, 253, 5356, 5646, 11173, 3365, 3511, 308, 34519, 28, 7018, 411, 407, 19712, 8182, 2, 198, 1, 4093, 198, 39614, 83, 4593, 551, 3714, 18244, 694, 2756, 1241, 337, 10168, 16718, 1236, 2554, 430, 26278, 30, 2, 198, 1, 520, 9531, 198, 30904, 24583, 28, 16718, 1236, 2554, 551, 610, 101, 430

Calculs du modèle enregistrés — pour le préfixe affiché · Préfixe du pas 10 · Vue réduite documentée

Représentation finale à la dernière position → logits → softmax du vocabulaire complet.

Probabilité ≠ vérité. Ces scores concernent la continuation du préfixe, pas la fiabilité d’une affirmation.

Maximum du modèle (argmax)

Ġretard · ID 26278 · rank / rang 1

Logit 30.131881713867188 · P 0.9976111806758564 · log(P) -0.002391677105080703

Le plus probable pour ce préfixe. Il ne décide pas du token ajouté dans notre exemple.

Choix imposé — non sélectionné par le modèle

Ġretard · ID 26278 · rank / rang 1

Logit 30.131881713867188 · P 0.9976111806758564 · log(P) -0.002391677105080703

Cible déjà comprise dans le top 8 ; sa probabilité n’est comptée qu’une fois.

Choix imposé — non sélectionné par le modèle · Ġretard · ID 26278
De la représentation aux probabilités

d0: -1.138788104057312 d1: -1.195247769355774 d2: -1.459794998168945 d3: 0.13725727796554563 d4: 0.3723635971546173 d5: -1.2121572494506836 d6: -2.3445231914520264 d7: -0.549301028251648

8 meilleurs candidats et cible imposée. Valeurs de la fixture affichées par le navigateur, notation scientifique si nécessaire ; aucune renormalisation. Logsumexp du vocabulaire complet: 30.134273390972268

  • Ġretard · ID 26278 · rank / rang 1

    Logit 30.131881713867188 · P 0.9976111806758564 · log(P) -0.002391677105080703

  • Ġret · ID 829 · rank / rang 2

    Logit 22.270763397216797 · P 0.00038452183070837977 · log(P) -7.863509993755471

  • ret · ID 3274 · rank / rang 3

    Logit 21.86779022216797 · P 0.00025698748550074586 · log(P) -8.2664831688043

  • Ġr · ID 412 · rank / rang 4

    Logit 21.71356964111328 · P 0.0002202595906182039 · log(P) -8.420703749858987

  • Ġt · ID 252 · rank / rang 5

    Logit 20.580989837646484 · P 0.00007096785333911661 · log(P) -9.553283553325784

  • Ġde · ID 367 · rank / rang 6

    Logit 20.128887176513672 · P 0.00004515605337922712 · log(P) -10.005386214458596

  • Ġfa · ID 3561 · rank / rang 7

    Logit 20.042749404907227 · P 0.000041429225921236606 · log(P) -10.091523986065042

  • Ġrapp · ID 26510 · rank / rang 8

    Logit 19.607234954833984 · P 0.000026801882345587853 · log(P) -10.527038436138284

Autres tokens : 0.0013426954023329472 · 49144 candidats omis.

Ce sont les tokens qui ne sont ni dans le top 8 ni la cible imposée. La probabilité de la cible compte une seule fois, même lorsqu’elle figure dans les deux panneaux. other_probability = masse hors UNION(top8, cible).

Le maximum départage les égalités par ID croissant. Le script impose la cible, même si elle coïncide avec lui. Température 1, aucun filtre ni tirage.

La boucle ordinaire, différente de notre exemple

Dans une génération autorégressive ordinaire, une règle de décodage choisit le token suivant à partir des scores du contexte courant, étend ce contexte et recommence. Elle n’exige pas une réponse complète écrite à l’avance.

Bonjour, je serai un peu en retard
g=11 → 12 · ID 30
<|im_start|>system
You are a helpful AI assistant named SmolLM, trained by Hugging Face<|im_end|>
<|im_start|>user
Écris un message pour prévenir que je serai en retard.<|im_end|>
<|im_start|>assistant
Bonjour, je serai un peu en retard

1, 9690, 198, 2683, 359, 253, 5356, 5646, 11173, 3365, 3511, 308, 34519, 28, 7018, 411, 407, 19712, 8182, 2, 198, 1, 4093, 198, 39614, 83, 4593, 551, 3714, 18244, 694, 2756, 1241, 337, 10168, 16718, 1236, 2554, 430, 26278, 30, 2, 198, 1, 520, 9531, 198, 30904, 24583, 28, 16718, 1236, 2554, 551, 610, 101, 430, 26278

Calculs du modèle enregistrés — pour le préfixe affiché · Préfixe du pas 11 · Vue réduite documentée

Représentation finale à la dernière position → logits → softmax du vocabulaire complet.

Probabilité ≠ vérité. Ces scores concernent la continuation du préfixe, pas la fiabilité d’une affirmation.

Maximum du modèle (argmax)

. · ID 30 · rank / rang 1

Logit 27.974336624145508 · P 0.7305039770296866 · log(P) -0.31402060354927386

Le plus probable pour ce préfixe. Il ne décide pas du token ajouté dans notre exemple.

Choix imposé — non sélectionné par le modèle

. · ID 30 · rank / rang 1

Logit 27.974336624145508 · P 0.7305039770296866 · log(P) -0.31402060354927386

Cible déjà comprise dans le top 8 ; sa probabilité n’est comptée qu’une fois.

Choix imposé — non sélectionné par le modèle · . · ID 30
De la représentation aux probabilités

d0: -0.06603647768497467 d1: -1.3273259401321411 d2: -0.5162432789802551 d3: 1.526349425315857 d4: 1.752465844154358 d5: -1.5746952295303345 d6: -1.8733279705047607 d7: 0.07422294467687607

8 meilleurs candidats et cible imposée. Valeurs de la fixture affichées par le navigateur, notation scientifique si nécessaire ; aucune renormalisation. Logsumexp du vocabulaire complet: 28.28835722769478

  • . · ID 30 · rank / rang 1

    Logit 27.974336624145508 · P 0.7305039770296866 · log(P) -0.31402060354927386

  • , · ID 28 · rank / rang 2

    Logit 25.764177322387695 · P 0.08012399511334305 · log(P) -2.5241799053070864

  • Ġpour · ID 18244 · rank / rang 3

    Logit 25.3084716796875 · P 0.050798647538637075 · log(P) -2.9798855480072817

  • ĠÃł · ID 25782 · rank / rang 4

    Logit 23.964195251464844 · P 0.013244644774236654 · log(P) -4.324161976229938

  • Ġet · ID 1482 · rank / rang 5

    Logit 23.802162170410156 · P 0.01126341904356481 · log(P) -4.486195057284625

  • ! · ID 17 · rank / rang 6

    Logit 23.71979331970215 · P 0.010372845386813772 · log(P) -4.568563907992633

  • Ġdans · ID 44612 · rank / rang 7

    Logit 23.583797454833984 · P 0.009053899112814054 · log(P) -4.704559772860797

  • Ġque · ID 10168 · rank / rang 8

    Logit 23.421276092529297 · P 0.007695795523484625 · log(P) -4.867081135165485

Autres tokens : 0.08694277647741898 · 49144 candidats omis.

Ce sont les tokens qui ne sont ni dans le top 8 ni la cible imposée. La probabilité de la cible compte une seule fois, même lorsqu’elle figure dans les deux panneaux. other_probability = masse hors UNION(top8, cible).

Le maximum départage les égalités par ID croissant. Le script impose la cible, même si elle coïncide avec lui. Température 1, aucun filtre ni tirage.

La boucle ordinaire, différente de notre exemple

Dans une génération autorégressive ordinaire, une règle de décodage choisit le token suivant à partir des scores du contexte courant, étend ce contexte et recommence. Elle n’exige pas une réponse complète écrite à l’avance.

Bonjour, je serai un peu en retard.
g=12 → 13 · ID 422
<|im_start|>system
You are a helpful AI assistant named SmolLM, trained by Hugging Face<|im_end|>
<|im_start|>user
Écris un message pour prévenir que je serai en retard.<|im_end|>
<|im_start|>assistant
Bonjour, je serai un peu en retard.

1, 9690, 198, 2683, 359, 253, 5356, 5646, 11173, 3365, 3511, 308, 34519, 28, 7018, 411, 407, 19712, 8182, 2, 198, 1, 4093, 198, 39614, 83, 4593, 551, 3714, 18244, 694, 2756, 1241, 337, 10168, 16718, 1236, 2554, 430, 26278, 30, 2, 198, 1, 520, 9531, 198, 30904, 24583, 28, 16718, 1236, 2554, 551, 610, 101, 430, 26278, 30

Calculs du modèle enregistrés — pour le préfixe affiché · Préfixe du pas 12 · Vue réduite documentée

Représentation finale à la dernière position → logits → softmax du vocabulaire complet.

Probabilité ≠ vérité. Ces scores concernent la continuation du préfixe, pas la fiabilité d’une affirmation.

Maximum du modèle (argmax)

<|im_end|> · ID 2 · rank / rang 1

Logit 14.987017631530762 · P 0.5087251127780099 · log(P) -0.6758474617943371

Le plus probable pour ce préfixe. Il ne décide pas du token ajouté dans notre exemple.

Choix imposé — non sélectionné par le modèle

ĠD · ID 422 · rank / rang 12

Logit 10.63726043701172 · P 0.006567614144740871 · log(P) -5.02560465631338

Cible hors top 8 — non remontée dans le classement.

Choix imposé — non sélectionné par le modèle · ĠD · ID 422
De la représentation aux probabilités

d0: -1.5081180334091189 d1: -1.9106686115264893 d2: 0.5811565518379211 d3: 0.6886863112449646 d4: 1.591434359550476 d5: -0.9471566677093506 d6: -0.4676462709903717 d7: -0.7724117636680603

8 meilleurs candidats et cible imposée. Valeurs de la fixture affichées par le navigateur, notation scientifique si nécessaire ; aucune renormalisation. Logsumexp du vocabulaire complet: 15.6628650933251

  • <|im_end|> · ID 2 · rank / rang 1

    Logit 14.987017631530762 · P 0.5087251127780099 · log(P) -0.6758474617943371

  • Ċ · ID 198 · rank / rang 2

    Logit 13.445426940917969 · P 0.10888770551772772 · log(P) -2.21743815240713

  • ĠĊ · ID 3717 · rank / rang 3

    Logit 12.367053985595703 · P 0.03703799105950669 · log(P) -3.2958111077293957

  • ĠPour · ID 32846 · rank / rang 4

    Logit 11.957664489746094 · P 0.024595282970935425 · log(P) -3.705200603579005

  • ĊĊ · ID 1116 · rank / rang 5

    Logit 11.592865943908691 · P 0.017077403033237445 · log(P) -4.069999149416407

  • ĠJe · ID 5816 · rank / rang 6

    Logit 11.559093475341797 · P 0.016510287327133024 · log(P) -4.103771617983302

  • ĠI · ID 339 · rank / rang 7

    Logit 11.434996604919434 · P 0.014583442219337134 · log(P) -4.227868488405665

  • ĠV · ID 717 · rank / rang 8

    Logit 11.321467399597168 · P 0.01301831985754346 · log(P) -4.341397693727931

Autres tokens : 0.25299684109182885 · 49143 candidats omis.

Ce sont les tokens qui ne sont ni dans le top 8 ni la cible imposée. La probabilité de la cible compte une seule fois, même lorsqu’elle figure dans les deux panneaux. other_probability = masse hors UNION(top8, cible).

Le maximum départage les égalités par ID croissant. Le script impose la cible, même si elle coïncide avec lui. Température 1, aucun filtre ni tirage.

La boucle ordinaire, différente de notre exemple

Dans une génération autorégressive ordinaire, une règle de décodage choisit le token suivant à partir des scores du contexte courant, étend ce contexte et recommence. Elle n’exige pas une réponse complète écrite à l’avance.

Bonjour, je serai un peu en retard. D
g=13 → 14 · ID 2756
<|im_start|>system
You are a helpful AI assistant named SmolLM, trained by Hugging Face<|im_end|>
<|im_start|>user
Écris un message pour prévenir que je serai en retard.<|im_end|>
<|im_start|>assistant
Bonjour, je serai un peu en retard. D

1, 9690, 198, 2683, 359, 253, 5356, 5646, 11173, 3365, 3511, 308, 34519, 28, 7018, 411, 407, 19712, 8182, 2, 198, 1, 4093, 198, 39614, 83, 4593, 551, 3714, 18244, 694, 2756, 1241, 337, 10168, 16718, 1236, 2554, 430, 26278, 30, 2, 198, 1, 520, 9531, 198, 30904, 24583, 28, 16718, 1236, 2554, 551, 610, 101, 430, 26278, 30, 422

Calculs du modèle enregistrés — pour le préfixe affiché · Préfixe du pas 13 · Vue réduite documentée

Représentation finale à la dernière position → logits → softmax du vocabulaire complet.

Probabilité ≠ vérité. Ces scores concernent la continuation du préfixe, pas la fiabilité d’une affirmation.

Maximum du modèle (argmax)

' · ID 23 · rank / rang 1

Logit 27.338125228881836 · P 0.6712172561695814 · log(P) -0.398662414729376

Le plus probable pour ce préfixe. Il ne décide pas du token ajouté dans notre exemple.

Choix imposé — non sélectionné par le modèle

é · ID 2756 · rank / rang 4

Logit 24.296804428100582 · P 0.03206522352174758 · log(P) -3.439983215510626

Cible déjà comprise dans le top 8 ; sa probabilité n’est comptée qu’une fois.

Choix imposé — non sélectionné par le modèle · é · ID 2756
De la représentation aux probabilités

d0: -1.195767164230347 d1: -2.6633524894714355 d2: -0.8023663759231567 d3: -0.9104528427124025 d4: 0.350973516702652 d5: -2.1821889877319336 d6: -1.276976227760315 d7: -1.6820309162139893

8 meilleurs candidats et cible imposée. Valeurs de la fixture affichées par le navigateur, notation scientifique si nécessaire ; aucune renormalisation. Logsumexp du vocabulaire complet: 27.736787643611212

  • ' · ID 23 · rank / rang 1

    Logit 27.338125228881836 · P 0.6712172561695814 · log(P) -0.398662414729376

  • ans · ID 487 · rank / rang 2

    Logit 25.628631591796875 · P 0.12146172920169317 · log(P) -2.108156051814337

  • ès · ID 42623 · rank / rang 3

    Logit 24.408802032470703 · P 0.03586527896849571 · log(P) -3.327985611140509

  • é · ID 2756 · rank / rang 4

    Logit 24.296804428100582 · P 0.03206522352174758 · log(P) -3.439983215510626

  • âĢĻ · ID 417 · rank / rang 5

    Logit 23.726099014282227 · P 0.018120912347542047 · log(P) -4.010688629328985

  • ont · ID 1866 · rank / rang 6

    Logit 23.690601348876953 · P 0.01748894530115377 · log(P) -4.046186294734259

  • és · ID 17842 · rank / rang 7

    Logit 23.539133071899418 · P 0.015030789148403351 · log(P) -4.197654571711798

  • ure · ID 424 · rank / rang 8

    Logit 23.38759422302246 · P 0.012917227149295909 · log(P) -4.349193420588751

Autres tokens : 0.07583263819208819 · 49144 candidats omis.

Ce sont les tokens qui ne sont ni dans le top 8 ni la cible imposée. La probabilité de la cible compte une seule fois, même lorsqu’elle figure dans les deux panneaux. other_probability = masse hors UNION(top8, cible).

Le maximum départage les égalités par ID croissant. Le script impose la cible, même si elle coïncide avec lui. Température 1, aucun filtre ni tirage.

La boucle ordinaire, différente de notre exemple

Dans une génération autorégressive ordinaire, une règle de décodage choisit le token suivant à partir des scores du contexte courant, étend ce contexte et recommence. Elle n’exige pas une réponse complète écrite à l’avance.

Bonjour, je serai un peu en retard. Dé
g=14 → 15 · ID 4806
<|im_start|>system
You are a helpful AI assistant named SmolLM, trained by Hugging Face<|im_end|>
<|im_start|>user
Écris un message pour prévenir que je serai en retard.<|im_end|>
<|im_start|>assistant
Bonjour, je serai un peu en retard. Dé

1, 9690, 198, 2683, 359, 253, 5356, 5646, 11173, 3365, 3511, 308, 34519, 28, 7018, 411, 407, 19712, 8182, 2, 198, 1, 4093, 198, 39614, 83, 4593, 551, 3714, 18244, 694, 2756, 1241, 337, 10168, 16718, 1236, 2554, 430, 26278, 30, 2, 198, 1, 520, 9531, 198, 30904, 24583, 28, 16718, 1236, 2554, 551, 610, 101, 430, 26278, 30, 422, 2756

Calculs du modèle enregistrés — pour le préfixe affiché · Préfixe du pas 14 · Vue réduite documentée

Représentation finale à la dernière position → logits → softmax du vocabulaire complet.

Probabilité ≠ vérité. Ces scores concernent la continuation du préfixe, pas la fiabilité d’une affirmation.

Maximum du modèle (argmax)

j · ID 90 · rank / rang 1

Logit 28.399314880371097 · P 0.3359542555528255 · log(P) -1.0907802724754134

Le plus probable pour ce préfixe. Il ne décide pas du token ajouté dans notre exemple.

Choix imposé — non sélectionné par le modèle

sol · ID 4806 · rank / rang 2

Logit 28.202484130859375 · P 0.2759291850789397 · log(P) -1.2876110219871322

Cible déjà comprise dans le top 8 ; sa probabilité n’est comptée qu’une fois.

Choix imposé — non sélectionné par le modèle · sol · ID 4806
De la représentation aux probabilités

d0: -1.5557963848114014 d1: -1.0562338829040527 d2: 1.2607582807540894 d3: -1.620851993560791 d4: 1.0365076065063477 d5: 1.12365460395813 d6: -1.4210118055343628 d7: 0.3036811947822571

8 meilleurs candidats et cible imposée. Valeurs de la fixture affichées par le navigateur, notation scientifique si nécessaire ; aucune renormalisation. Logsumexp du vocabulaire complet: 29.490095152846507

  • j · ID 90 · rank / rang 1

    Logit 28.399314880371097 · P 0.3359542555528255 · log(P) -1.0907802724754134

  • sol · ID 4806 · rank / rang 2

    Logit 28.202484130859375 · P 0.2759291850789397 · log(P) -1.2876110219871322

  • cou · ID 36122 · rank / rang 3

    Logit 26.466882705688477 · P 0.048644698567167154 · log(P) -3.0232124471580306

  • f · ID 86 · rank / rang 4

    Logit 26.371353149414062 · P 0.04421275294123599 · log(P) -3.1187420034324447

  • c · ID 83 · rank / rang 5

    Logit 26.197275161743164 · P 0.03714894186103291 · log(P) -3.292819991103343

  • p · ID 96 · rank / rang 6

    Logit 25.54354476928711 · P 0.019321237807103903 · log(P) -3.946550383559398

  • lic · ID 709 · rank / rang 7

    Logit 25.38472366333008 · P 0.016483894106945066 · log(P) -4.105371489516429

  • con · ID 607 · rank / rang 8

    Logit 25.245101928710938 · P 0.014335830816328502 · log(P) -4.24499322413557

Autres tokens : 0.2079692032684217 · 49144 candidats omis.

Ce sont les tokens qui ne sont ni dans le top 8 ni la cible imposée. La probabilité de la cible compte une seule fois, même lorsqu’elle figure dans les deux panneaux. other_probability = masse hors UNION(top8, cible).

Le maximum départage les égalités par ID croissant. Le script impose la cible, même si elle coïncide avec lui. Température 1, aucun filtre ni tirage.

La boucle ordinaire, différente de notre exemple

Dans une génération autorégressive ordinaire, une règle de décodage choisit le token suivant à partir des scores du contexte courant, étend ce contexte et recommence. Elle n’exige pas une réponse complète écrite à l’avance.

Bonjour, je serai un peu en retard. Désol
g=15 → 16 · ID 2756
<|im_start|>system
You are a helpful AI assistant named SmolLM, trained by Hugging Face<|im_end|>
<|im_start|>user
Écris un message pour prévenir que je serai en retard.<|im_end|>
<|im_start|>assistant
Bonjour, je serai un peu en retard. Désol

1, 9690, 198, 2683, 359, 253, 5356, 5646, 11173, 3365, 3511, 308, 34519, 28, 7018, 411, 407, 19712, 8182, 2, 198, 1, 4093, 198, 39614, 83, 4593, 551, 3714, 18244, 694, 2756, 1241, 337, 10168, 16718, 1236, 2554, 430, 26278, 30, 2, 198, 1, 520, 9531, 198, 30904, 24583, 28, 16718, 1236, 2554, 551, 610, 101, 430, 26278, 30, 422, 2756, 4806

Calculs du modèle enregistrés — pour le préfixe affiché · Préfixe du pas 15 · Vue réduite documentée

Représentation finale à la dernière position → logits → softmax du vocabulaire complet.

Probabilité ≠ vérité. Ces scores concernent la continuation du préfixe, pas la fiabilité d’une affirmation.

Maximum du modèle (argmax)

é · ID 2756 · rank / rang 1

Logit 33.35481262207031 · P 0.49284186631440463 · log(P) -0.707566914376244

Le plus probable pour ce préfixe. Il ne décide pas du token ajouté dans notre exemple.

Choix imposé — non sélectionné par le modèle

é · ID 2756 · rank / rang 1

Logit 33.35481262207031 · P 0.49284186631440463 · log(P) -0.707566914376244

Cible déjà comprise dans le top 8 ; sa probabilité n’est comptée qu’une fois.

Choix imposé — non sélectionné par le modèle · é · ID 2756
De la représentation aux probabilités

d0: -0.06437170505523682 d1: -2.404874324798584 d2: -1.0103013515472412 d3: -1.0836488008499146 d4: 1.6632883548736572 d5: -1.3793132305145264 d6: -0.2849445641040802 d7: -0.868305504322052

8 meilleurs candidats et cible imposée. Valeurs de la fixture affichées par le navigateur, notation scientifique si nécessaire ; aucune renormalisation. Logsumexp du vocabulaire complet: 34.06237953644656

  • é · ID 2756 · rank / rang 1

    Logit 33.35481262207031 · P 0.49284186631440463 · log(P) -0.707566914376244

  • er · ID 259 · rank / rang 2

    Logit 33.025875091552734 · P 0.3546923642101004 · log(P) -1.036504444893822

  • ent · ID 293 · rank / rang 3

    Logit 30.61857032775879 · P 0.03194277658526872 · log(P) -3.4438092086877674

  • és · ID 17842 · rank / rang 4

    Logit 30.384836196899418 · P 0.025285015294978203 · log(P) -3.6775433395471424

  • ons · ID 707 · rank / rang 5

    Logit 29.74675750732422 · P 0.013358237688440447 · log(P) -4.315622029122338

  • ere · ID 518 · rank / rang 6

    Logit 29.464643478393555 · P 0.01007461829667694 · log(P) -4.597736058053002

  • ez · ID 12421 · rank / rang 7

    Logit 29.335134506225582 · P 0.008850821227310901 · log(P) -4.7272450302209705

  • ant · ID 403 · rank / rang 8

    Logit 29.121137619018555 · P 0.007145718467101506 · log(P) -4.941241917428002

Autres tokens : 0.05580858191571894 · 49144 candidats omis.

Ce sont les tokens qui ne sont ni dans le top 8 ni la cible imposée. La probabilité de la cible compte une seule fois, même lorsqu’elle figure dans les deux panneaux. other_probability = masse hors UNION(top8, cible).

Le maximum départage les égalités par ID croissant. Le script impose la cible, même si elle coïncide avec lui. Température 1, aucun filtre ni tirage.

La boucle ordinaire, différente de notre exemple

Dans une génération autorégressive ordinaire, une règle de décodage choisit le token suivant à partir des scores du contexte courant, étend ce contexte et recommence. Elle n’exige pas une réponse complète écrite à l’avance.

Bonjour, je serai un peu en retard. Désolé
g=16 → 17 · ID 18244
<|im_start|>system
You are a helpful AI assistant named SmolLM, trained by Hugging Face<|im_end|>
<|im_start|>user
Écris un message pour prévenir que je serai en retard.<|im_end|>
<|im_start|>assistant
Bonjour, je serai un peu en retard. Désolé

1, 9690, 198, 2683, 359, 253, 5356, 5646, 11173, 3365, 3511, 308, 34519, 28, 7018, 411, 407, 19712, 8182, 2, 198, 1, 4093, 198, 39614, 83, 4593, 551, 3714, 18244, 694, 2756, 1241, 337, 10168, 16718, 1236, 2554, 430, 26278, 30, 2, 198, 1, 520, 9531, 198, 30904, 24583, 28, 16718, 1236, 2554, 551, 610, 101, 430, 26278, 30, 422, 2756, 4806, 2756

Calculs du modèle enregistrés — pour le préfixe affiché · Préfixe du pas 16 · Vue réduite documentée

Représentation finale à la dernière position → logits → softmax du vocabulaire complet.

Probabilité ≠ vérité. Ces scores concernent la continuation du préfixe, pas la fiabilité d’une affirmation.

Maximum du modèle (argmax)

, · ID 28 · rank / rang 1

Logit 23.07224464416504 · P 0.3908964379869968 · log(P) -0.9393126185629476

Le plus probable pour ce préfixe. Il ne décide pas du token ajouté dans notre exemple.

Choix imposé — non sélectionné par le modèle

Ġpour · ID 18244 · rank / rang 2

Logit 21.982139587402344 · P 0.1314120233354711 · log(P) -2.029417675325643

Cible déjà comprise dans le top 8 ; sa probabilité n’est comptée qu’une fois.

Choix imposé — non sélectionné par le modèle · Ġpour · ID 18244
De la représentation aux probabilités

d0: -0.35173583030700684 d1: -2.460622787475586 d2: -0.8888871073722839 d3: 1.3130075931549072 d4: 2.203940153121948 d5: -2.009690761566162 d6: -1.2561668157577517 d7: 0.5549207925796509

8 meilleurs candidats et cible imposée. Valeurs de la fixture affichées par le navigateur, notation scientifique si nécessaire ; aucune renormalisation. Logsumexp du vocabulaire complet: 24.011557262727987

  • , · ID 28 · rank / rang 1

    Logit 23.07224464416504 · P 0.3908964379869968 · log(P) -0.9393126185629476

  • Ġpour · ID 18244 · rank / rang 2

    Logit 21.982139587402344 · P 0.1314120233354711 · log(P) -2.029417675325643

  • Ġde · ID 367 · rank / rang 3

    Logit 21.618186950683594 · P 0.09132138307709146 · log(P) -2.393370312044393

  • ĠÃł · ID 25782 · rank / rang 4

    Logit 20.834583282470703 · P 0.04171168472244552 · log(P) -3.1769739802572836

  • ment · ID 358 · rank / rang 5

    Logit 20.458236694335938 · P 0.028629415710036504 · log(P) -3.5533205683920492

  • Ġet · ID 1482 · rank / rang 6

    Logit 20.45423698425293 · P 0.028515135044467725 · log(P) -3.557320278475057

  • . · ID 30 · rank / rang 7

    Logit 20.37336540222168 · P 0.02629985480578331 · log(P) -3.638191860506307

  • Ġdes · ID 708 · rank / rang 8

    Logit 20.202564239501953 · P 0.02217049289175417 · log(P) -3.8089930232260336

Autres tokens : 0.239043572425954 · 49144 candidats omis.

Ce sont les tokens qui ne sont ni dans le top 8 ni la cible imposée. La probabilité de la cible compte une seule fois, même lorsqu’elle figure dans les deux panneaux. other_probability = masse hors UNION(top8, cible).

Le maximum départage les égalités par ID croissant. Le script impose la cible, même si elle coïncide avec lui. Température 1, aucun filtre ni tirage.

La boucle ordinaire, différente de notre exemple

Dans une génération autorégressive ordinaire, une règle de décodage choisit le token suivant à partir des scores du contexte courant, étend ce contexte et recommence. Elle n’exige pas une réponse complète écrite à l’avance.

Bonjour, je serai un peu en retard. Désolé pour
g=17 → 18 · ID 303
<|im_start|>system
You are a helpful AI assistant named SmolLM, trained by Hugging Face<|im_end|>
<|im_start|>user
Écris un message pour prévenir que je serai en retard.<|im_end|>
<|im_start|>assistant
Bonjour, je serai un peu en retard. Désolé pour

1, 9690, 198, 2683, 359, 253, 5356, 5646, 11173, 3365, 3511, 308, 34519, 28, 7018, 411, 407, 19712, 8182, 2, 198, 1, 4093, 198, 39614, 83, 4593, 551, 3714, 18244, 694, 2756, 1241, 337, 10168, 16718, 1236, 2554, 430, 26278, 30, 2, 198, 1, 520, 9531, 198, 30904, 24583, 28, 16718, 1236, 2554, 551, 610, 101, 430, 26278, 30, 422, 2756, 4806, 2756, 18244

Calculs du modèle enregistrés — pour le préfixe affiché · Préfixe du pas 17 · Vue réduite documentée

Représentation finale à la dernière position → logits → softmax du vocabulaire complet.

Probabilité ≠ vérité. Ces scores concernent la continuation du préfixe, pas la fiabilité d’une affirmation.

Maximum du modèle (argmax)

Ġque · ID 10168 · rank / rang 1

Logit 22.000659942626953 · P 0.17737335397837742 · log(P) -1.729498423441381

Le plus probable pour ce préfixe. Il ne décide pas du token ajouté dans notre exemple.

Choix imposé — non sélectionné par le modèle

Ġl · ID 303 · rank / rang 13

Logit 19.26510238647461 · P 0.011504051749821833 · log(P) -4.465055979593725

Cible hors top 8 — non remontée dans le classement.

Choix imposé — non sélectionné par le modèle · Ġl · ID 303
De la représentation aux probabilités

d0: -0.4146004915237427 d1: -2.4115827083587646 d2: -1.0639809370040894 d3: -0.3564538359642029 d4: 1.4848241806030271 d5: -1.501789689064026 d6: -1.1314128637313845 d7: -0.3448684513568878

8 meilleurs candidats et cible imposée. Valeurs de la fixture affichées par le navigateur, notation scientifique si nécessaire ; aucune renormalisation. Logsumexp du vocabulaire complet: 23.730158366068338

  • Ġque · ID 10168 · rank / rang 1

    Logit 22.000659942626953 · P 0.17737335397837742 · log(P) -1.729498423441381

  • Ġpr · ID 694 · rank / rang 2

    Logit 21.787015914916992 · P 0.14325307593082273 · log(P) -1.943142451151342

  • Ġles · ID 8897 · rank / rang 3

    Logit 20.521217346191406 · P 0.040399372760048666 · log(P) -3.208941019876928

  • Ġv · ID 386 · rank / rang 4

    Logit 20.306640625 · P 0.03259756322611731 · log(P) -3.423517741068334

  • Ġpre · ID 622 · rank / rang 5

    Logit 20.188682556152344 · P 0.02897054050658537 · log(P) -3.5414758099159904

  • Ġfaire · ID 33315 · rank / rang 6

    Logit 20.16339874267578 · P 0.028247237228523535 · log(P) -3.566759623392553

  • Ġob · ID 794 · rank / rang 7

    Logit 19.57173538208008 · P 0.015632190706771354 · log(P) -4.158422983988256

  • Ġne · ID 420 · rank / rang 8

    Logit 19.458335876464844 · P 0.01395632470482857 · log(P) -4.27182248960349

Autres tokens : 0.5080662892081035 · 49143 candidats omis.

Ce sont les tokens qui ne sont ni dans le top 8 ni la cible imposée. La probabilité de la cible compte une seule fois, même lorsqu’elle figure dans les deux panneaux. other_probability = masse hors UNION(top8, cible).

Le maximum départage les égalités par ID croissant. Le script impose la cible, même si elle coïncide avec lui. Température 1, aucun filtre ni tirage.

La boucle ordinaire, différente de notre exemple

Dans une génération autorégressive ordinaire, une règle de décodage choisit le token suivant à partir des scores du contexte courant, étend ce contexte et recommence. Elle n’exige pas une réponse complète écrite à l’avance.

Bonjour, je serai un peu en retard. Désolé pour l
g=18 → 19 · ID 417
<|im_start|>system
You are a helpful AI assistant named SmolLM, trained by Hugging Face<|im_end|>
<|im_start|>user
Écris un message pour prévenir que je serai en retard.<|im_end|>
<|im_start|>assistant
Bonjour, je serai un peu en retard. Désolé pour l

1, 9690, 198, 2683, 359, 253, 5356, 5646, 11173, 3365, 3511, 308, 34519, 28, 7018, 411, 407, 19712, 8182, 2, 198, 1, 4093, 198, 39614, 83, 4593, 551, 3714, 18244, 694, 2756, 1241, 337, 10168, 16718, 1236, 2554, 430, 26278, 30, 2, 198, 1, 520, 9531, 198, 30904, 24583, 28, 16718, 1236, 2554, 551, 610, 101, 430, 26278, 30, 422, 2756, 4806, 2756, 18244, 303

Calculs du modèle enregistrés — pour le préfixe affiché · Préfixe du pas 18 · Vue réduite documentée

Représentation finale à la dernière position → logits → softmax du vocabulaire complet.

Probabilité ≠ vérité. Ces scores concernent la continuation du préfixe, pas la fiabilité d’une affirmation.

Maximum du modèle (argmax)

' · ID 23 · rank / rang 1

Logit 26.58047103881836 · P 0.7939485998027865 · log(P) -0.2307365555952039

Le plus probable pour ce préfixe. Il ne décide pas du token ajouté dans notre exemple.

Choix imposé — non sélectionné par le modèle

âĢĻ · ID 417 · rank / rang 3

Logit 23.28300666809082 · P 0.029357685023358417 · log(P) -3.528200926322743

Cible déjà comprise dans le top 8 ; sa probabilité n’est comptée qu’une fois.

Choix imposé — non sélectionné par le modèle · âĢĻ · ID 417
De la représentation aux probabilités

d0: 0.4742283821105957 d1: -2.9220564365386963 d2: 0.6760870814323425 d3: -2.3815877437591553 d4: -0.24279721081256864 d5: -2.092230319976806 d6: 0.22786517441272736 d7: -0.0019353069365024569

8 meilleurs candidats et cible imposée. Valeurs de la fixture affichées par le navigateur, notation scientifique si nécessaire ; aucune renormalisation. Logsumexp du vocabulaire complet: 26.811207594413563

  • ' · ID 23 · rank / rang 1

    Logit 26.58047103881836 · P 0.7939485998027865 · log(P) -0.2307365555952039

  • ui · ID 9010 · rank / rang 2

    Logit 24.43160820007324 · P 0.09258766122297712 · log(P) -2.379599394340321

  • âĢĻ · ID 417 · rank / rang 3

    Logit 23.28300666809082 · P 0.029357685023358417 · log(P) -3.528200926322743

  • ancer · ID 5844 · rank / rang 4

    Logit 22.817401885986328 · P 0.018429443401637515 · log(P) -3.993805708427235

  • Ãł · ID 16739 · rank / rang 5

    Logit 22.7864990234375 · P 0.017868630832231037 · log(P) -4.024708570976063

  • ors · ID 579 · rank / rang 6

    Logit 22.267602920532227 · P 0.01063500166383099 · log(P) -4.543604673881337

  • u · ID 101 · rank / rang 7

    Logit 21.71937561035156 · P 0.006146748820241902 · log(P) -5.091831984062001

  • ider · ID 1310 · rank / rang 8

    Logit 21.69364547729492 · P 0.005990609511927778 · log(P) -5.117562117118641

Autres tokens : 0.02503561972100917 · 49144 candidats omis.

Ce sont les tokens qui ne sont ni dans le top 8 ni la cible imposée. La probabilité de la cible compte une seule fois, même lorsqu’elle figure dans les deux panneaux. other_probability = masse hors UNION(top8, cible).

Le maximum départage les égalités par ID croissant. Le script impose la cible, même si elle coïncide avec lui. Température 1, aucun filtre ni tirage.

La boucle ordinaire, différente de notre exemple

Dans une génération autorégressive ordinaire, une règle de décodage choisit le token suivant à partir des scores du contexte courant, étend ce contexte et recommence. Elle n’exige pas une réponse complète écrite à l’avance.

Bonjour, je serai un peu en retard. Désolé pour l’
g=19 → 20 · ID 2192
<|im_start|>system
You are a helpful AI assistant named SmolLM, trained by Hugging Face<|im_end|>
<|im_start|>user
Écris un message pour prévenir que je serai en retard.<|im_end|>
<|im_start|>assistant
Bonjour, je serai un peu en retard. Désolé pour l’

1, 9690, 198, 2683, 359, 253, 5356, 5646, 11173, 3365, 3511, 308, 34519, 28, 7018, 411, 407, 19712, 8182, 2, 198, 1, 4093, 198, 39614, 83, 4593, 551, 3714, 18244, 694, 2756, 1241, 337, 10168, 16718, 1236, 2554, 430, 26278, 30, 2, 198, 1, 520, 9531, 198, 30904, 24583, 28, 16718, 1236, 2554, 551, 610, 101, 430, 26278, 30, 422, 2756, 4806, 2756, 18244, 303, 417

Calculs du modèle enregistrés — pour le préfixe affiché · Préfixe du pas 19 · Vue réduite documentée

Représentation finale à la dernière position → logits → softmax du vocabulaire complet.

Probabilité ≠ vérité. Ces scores concernent la continuation du préfixe, pas la fiabilité d’une affirmation.

Maximum du modèle (argmax)

é · ID 2756 · rank / rang 1

Logit 28.10407257080078 · P 0.10216014153827954 · log(P) -2.281213681801887

Le plus probable pour ce préfixe. Il ne décide pas du token ajouté dans notre exemple.

Choix imposé — non sélectionné par le modèle

att · ID 2192 · rank / rang 44

Logit 25.036632537841797 · P 0.004754547669920524 · log(P) -5.3486537147608715

Cible hors top 8 — non remontée dans le classement.

Choix imposé — non sélectionné par le modèle · att · ID 2192
De la représentation aux probabilités

d0: -1.3192960023880005 d1: -2.4273276329040527 d2: 0.876036524772644 d3: 0.2819659113883972 d4: 2.6876282691955566 d5: -1.2806217670440674 d6: -2.075014352798462 d7: -1.0896666049957275

8 meilleurs candidats et cible imposée. Valeurs de la fixture affichées par le navigateur, notation scientifique si nécessaire ; aucune renormalisation. Logsumexp du vocabulaire complet: 30.38528625260267

  • é · ID 2756 · rank / rang 1

    Logit 28.10407257080078 · P 0.10216014153827954 · log(P) -2.281213681801887

  • util · ID 13695 · rank / rang 2

    Logit 27.54944610595703 · P 0.058669214378683554 · log(P) -2.835840146645637

  • a · ID 81 · rank / rang 3

    Logit 27.354000091552734 · P 0.04825353637919209 · log(P) -3.031286161049934

  • ad · ID 344 · rank / rang 4

    Logit 27.0710391998291 · P 0.036361416500449315 · log(P) -3.314247052773567

  • on · ID 258 · rank / rang 5

    Logit 26.953777313232425 · P 0.03233810769523536 · log(P) -3.4315089393702465

  • en · ID 264 · rank / rang 6

    Logit 26.777305603027344 · P 0.027106529217641017 · log(P) -3.6079806495753246

  • ent · ID 293 · rank / rang 7

    Logit 26.704811096191406 · P 0.02521099282391334 · log(P) -3.680475156411262

  • expl · ID 13403 · rank / rang 8

    Logit 26.600879669189453 · P 0.022722342591747404 · log(P) -3.7844065834132152

Autres tokens : 0.642423171204938 · 49143 candidats omis.

Ce sont les tokens qui ne sont ni dans le top 8 ni la cible imposée. La probabilité de la cible compte une seule fois, même lorsqu’elle figure dans les deux panneaux. other_probability = masse hors UNION(top8, cible).

Le maximum départage les égalités par ID croissant. Le script impose la cible, même si elle coïncide avec lui. Température 1, aucun filtre ni tirage.

La boucle ordinaire, différente de notre exemple

Dans une génération autorégressive ordinaire, une règle de décodage choisit le token suivant à partir des scores du contexte courant, étend ce contexte et recommence. Elle n’exige pas une réponse complète écrite à l’avance.

Bonjour, je serai un peu en retard. Désolé pour l’att
g=20 → 21 · ID 25583
<|im_start|>system
You are a helpful AI assistant named SmolLM, trained by Hugging Face<|im_end|>
<|im_start|>user
Écris un message pour prévenir que je serai en retard.<|im_end|>
<|im_start|>assistant
Bonjour, je serai un peu en retard. Désolé pour l’att

1, 9690, 198, 2683, 359, 253, 5356, 5646, 11173, 3365, 3511, 308, 34519, 28, 7018, 411, 407, 19712, 8182, 2, 198, 1, 4093, 198, 39614, 83, 4593, 551, 3714, 18244, 694, 2756, 1241, 337, 10168, 16718, 1236, 2554, 430, 26278, 30, 2, 198, 1, 520, 9531, 198, 30904, 24583, 28, 16718, 1236, 2554, 551, 610, 101, 430, 26278, 30, 422, 2756, 4806, 2756, 18244, 303, 417, 2192

Calculs du modèle enregistrés — pour le préfixe affiché · Préfixe du pas 20 · Vue réduite documentée

Représentation finale à la dernière position → logits → softmax du vocabulaire complet.

Probabilité ≠ vérité. Ces scores concernent la continuation du préfixe, pas la fiabilité d’une affirmation.

Maximum du modèle (argmax)

ente · ID 25583 · rank / rang 1

Logit 28.93265724182129 · P 0.4297667642182811 · log(P) -0.8445126262460896

Le plus probable pour ce préfixe. Il ne décide pas du token ajouté dans notre exemple.

Choix imposé — non sélectionné par le modèle

ente · ID 25583 · rank / rang 1

Logit 28.93265724182129 · P 0.4297667642182811 · log(P) -0.8445126262460896

Cible déjà comprise dans le top 8 ; sa probabilité n’est comptée qu’une fois.

Choix imposé — non sélectionné par le modèle · ente · ID 25583
De la représentation aux probabilités

d0: -0.0564066581428051 d1: -2.1269919872283936 d2: -3.0177788734436035 d3: -0.22479365766048431 d4: 1.206722617149353 d5: 0.46896734833717346 d6: 0.14685629308223724 d7: -0.3378193974494934

8 meilleurs candidats et cible imposée. Valeurs de la fixture affichées par le navigateur, notation scientifique si nécessaire ; aucune renormalisation. Logsumexp du vocabulaire complet: 29.77716986806738

  • ente · ID 25583 · rank / rang 1

    Logit 28.93265724182129 · P 0.4297667642182811 · log(P) -0.8445126262460896

  • end · ID 486 · rank / rang 2

    Logit 28.476776123046875 · P 0.27242450612080654 · log(P) -1.3003937450205036

  • a · ID 81 · rank / rang 3

    Logit 26.398128509521484 · P 0.034080109685808865 · log(P) -3.3790413585458943

  • én · ID 25288 · rank / rang 4

    Logit 26.361780166625977 · P 0.03286359721453363 · log(P) -3.415389701441402

  • aque · ID 21825 · rank / rang 5

    Logit 26.327831268310547 · P 0.03176663989478779 · log(P) -3.449338599756832

  • ache · ID 4390 · rank / rang 6

    Logit 25.780506134033203 · P 0.018376846777525376 · log(P) -3.996663734034175

  • ribution · ID 2865 · rank / rang 7

    Logit 25.647262573242188 · P 0.01608436985779338 · log(P) -4.129907294825191

  • raction · ID 4550 · rank / rang 8

    Logit 25.586322784423828 · P 0.015133460135450062 · log(P) -4.1908470836435505

Autres tokens : 0.14950370609501165 · 49144 candidats omis.

Ce sont les tokens qui ne sont ni dans le top 8 ni la cible imposée. La probabilité de la cible compte une seule fois, même lorsqu’elle figure dans les deux panneaux. other_probability = masse hors UNION(top8, cible).

Le maximum départage les égalités par ID croissant. Le script impose la cible, même si elle coïncide avec lui. Température 1, aucun filtre ni tirage.

La boucle ordinaire, différente de notre exemple

Dans une génération autorégressive ordinaire, une règle de décodage choisit le token suivant à partir des scores du contexte courant, étend ce contexte et recommence. Elle n’exige pas une réponse complète écrite à l’avance.

Bonjour, je serai un peu en retard. Désolé pour l’attente
g=21 → 22 · ID 5728
<|im_start|>system
You are a helpful AI assistant named SmolLM, trained by Hugging Face<|im_end|>
<|im_start|>user
Écris un message pour prévenir que je serai en retard.<|im_end|>
<|im_start|>assistant
Bonjour, je serai un peu en retard. Désolé pour l’attente

1, 9690, 198, 2683, 359, 253, 5356, 5646, 11173, 3365, 3511, 308, 34519, 28, 7018, 411, 407, 19712, 8182, 2, 198, 1, 4093, 198, 39614, 83, 4593, 551, 3714, 18244, 694, 2756, 1241, 337, 10168, 16718, 1236, 2554, 430, 26278, 30, 2, 198, 1, 520, 9531, 198, 30904, 24583, 28, 16718, 1236, 2554, 551, 610, 101, 430, 26278, 30, 422, 2756, 4806, 2756, 18244, 303, 417, 2192, 25583

Calculs du modèle enregistrés — pour le préfixe affiché · Préfixe du pas 21 · Vue réduite documentée

Représentation finale à la dernière position → logits → softmax du vocabulaire complet.

Probabilité ≠ vérité. Ces scores concernent la continuation du préfixe, pas la fiabilité d’une affirmation.

Maximum du modèle (argmax)

Ġde · ID 367 · rank / rang 1

Logit 19.76018524169922 · P 0.26358916583249925 · log(P) -1.333363577985626

Le plus probable pour ce préfixe. Il ne décide pas du token ajouté dans notre exemple.

Choix imposé — non sélectionné par le modèle

Ġ! · ID 5728 · rank / rang 34

Logit 14.895868301391602 · P 0.002034143326918745 · log(P) -6.197680518293243

Cible hors top 8 — non remontée dans le classement.

Choix imposé — non sélectionné par le modèle · Ġ! · ID 5728
De la représentation aux probabilités

d0: -0.44645583629608154 d1: -1.9366849660873413 d2: 0.14388827979564667 d3: 1.7878212928771973 d4: 1.154832124710083 d5: -2.3193790912628174 d6: -1.7544182538986206 d7: 0.11435741931200027

8 meilleurs candidats et cible imposée. Valeurs de la fixture affichées par le navigateur, notation scientifique si nécessaire ; aucune renormalisation. Logsumexp du vocabulaire complet: 21.093548819684845

  • Ġde · ID 367 · rank / rang 1

    Logit 19.76018524169922 · P 0.26358916583249925 · log(P) -1.333363577985626

  • , · ID 28 · rank / rang 2

    Logit 19.417009353637695 · P 0.18702004674148187 · log(P) -1.676539466047149

  • . · ID 30 · rank / rang 3

    Logit 19.38578224182129 · P 0.18127019371315675 · log(P) -1.7077665778635556

  • Ġd · ID 287 · rank / rang 4

    Logit 17.877456665039062 · P 0.04011150192919608 · log(P) -3.216092154645782

  • ĠÃł · ID 25782 · rank / rang 5

    Logit 17.41886329650879 · P 0.02535737857686727 · log(P) -3.674685523176056

  • Ġpour · ID 18244 · rank / rang 6

    Logit 16.93649673461914 · P 0.015653635556170307 · log(P) -4.157052085065704

  • Ġet · ID 1482 · rank / rang 7

    Logit 16.91623878479004 · P 0.015339715417233493 · log(P) -4.177310034894806

  • Ġdes · ID 708 · rank / rang 8

    Logit 16.851329803466797 · P 0.014375656608655248 · log(P) -4.242219016218048

Autres tokens : 0.2552485622978202 · 49143 candidats omis.

Ce sont les tokens qui ne sont ni dans le top 8 ni la cible imposée. La probabilité de la cible compte une seule fois, même lorsqu’elle figure dans les deux panneaux. other_probability = masse hors UNION(top8, cible).

Le maximum départage les égalités par ID croissant. Le script impose la cible, même si elle coïncide avec lui. Température 1, aucun filtre ni tirage.

La boucle ordinaire, différente de notre exemple

Dans une génération autorégressive ordinaire, une règle de décodage choisit le token suivant à partir des scores du contexte courant, étend ce contexte et recommence. Elle n’exige pas une réponse complète écrite à l’avance.

Bonjour, je serai un peu en retard. Désolé pour l’attente !

Aucun cache KV dans cette capture ; la visite rejoue les préfixes, elle ne recalcule pas le modèle.

Calculs enregistrés pour les préfixes successifs ; tokens imposés par le script. Fin du chemin préparé — pas arrêt choisi par le modèle.

Approfondir

Dans une génération autorégressive ordinaire, une règle de décodage choisit le token suivant à partir des scores du contexte courant, étend ce contexte et recommence. Elle n’exige pas une réponse complète écrite à l’avance.

Le préfixe évalué contient l’entrée initiale et seulement les tokens déjà imposés. Aucun cache KV dans cette capture. La fin préparée n’est ni un EOS choisi ni une limite de longueur atteinte.

This scene in English

S09 · La réponse préparée revient à l’écran

Message préparé : Écris un message pour prévenir que je serai en retard.

Chaque morceau qui apparaît est-il un nouveau token du modèle ?

Réponse préparée — décodée depuis le chemin imposé. Le modèle n’a pas librement choisi ce texte ; le retour est mis en scène.

Générer des tokens, transporter des données et afficher du texte sont des étapes différentes. Leur rythme est simplifié dans cette démonstration.

  1. Vous, au même posteLe trajet revient au point de départ.
  2. ApplicationAffiche le texte décodé.
  3. Réponse préparéeÉcrite par notre équipe, pas choisie librement par le modèle.
Le retour affiche, il ne génère plus. Caractère ≠ token ≠ paquet réseau.◇ Schéma pédagogique · formes et distances illustratives, pas une mesure du modèle.

Réponse préparée — décodée depuis le chemin imposé. Le modèle n’a pas librement choisi ce texte ; le retour est mis en scène.

Montrez-moi

Un morceau réseau, un token et un caractère visible sont-ils forcément la même chose ?

Réponse préparée — décodée depuis le chemin imposé. Le modèle n’a pas librement choisi ce texte ; le retour est mis en scène.

Réponse préparée — rédigée par notre équipe

Bonjour, je serai un peu en retard. Désolé pour l’attente !

Fin du chemin préparé — pas arrêt choisi par le modèle: prepared_sequence_end · 22 tokens. Aucun EOS ajouté, aucune distribution terminale inventée.

IDs et décodage de sortie

30904, 24583, 28, 16718, 1236, 2554, 551, 610, 101, 430, 26278, 30, 422, 2756, 4806, 2756, 18244, 303, 417, 2192, 25583, 5728

Bonjour, je serai un peu en retard. Désolé pour l’attente !

Décodage : skip_special_tokens=false ; clean_up_tokenization_spaces=false. Aucun token spécial ajouté ni découpage réseau mesuré. Caractère ≠ token ≠ paquet.

Formatage et transport n’acheminent pas forcément un token à la fois. Un caractère visible peut nécessiter plusieurs tokens.

Approfondir

Les options exactes du décodeur, le traitement des tokens spéciaux et les normalisations relèvent du manifeste de capture. La vue lisible doit conserver l’accès aux IDs bruts et au texte décodé, y compris espaces et sauts de ligne.

Le retour vers l’écran n’est ni une capture réseau ni une mesure de latence. Il peut rejouer une sortie déjà complète ; il ne doit pas prétendre que le modèle calcule encore.

This scene in English

S10 · Expliquer le mécanisme et notre exception

Message préparé : Écris un message pour prévenir que je serai en retard.

Que ferait une génération ordinaire différemment de notre exemple rédigé ?

L’application prépare une entrée. Un modèle entraîné calcule des tokens suivants possibles ; une règle de décodage en choisit un, l’ajoute au contexte et recommence. L’application affiche le texte obtenu.

La démonstration de chemin imposé n’établit ni génération autonome ni vérité factuelle.

  1. L’application prépareMessage, enveloppe et tokens.
  2. Le modèle calculeReprésentations, puis scores conditionnels.
  3. L’application afficheIci, les tokens de la réponse écrite par notre équipe.
Un mécanisme explicable, avec des limites. Les cinq distinctions ci-dessous restent vraies même si la phrase semble plausible.◇ Schéma pédagogique · formes et distances illustratives, pas une mesure du modèle.

La démonstration de chemin imposé n’établit ni génération autonome ni vérité factuelle.

Montrez-moi

Que doit-il se passer avant de choisir le token suivant ?

Cinq distinctions à garder

  • Serveur ≠ modèle

    La machine héberge le logiciel qui exécute le calcul appris.

    Revoir S02
  • Tokenisation ≠ compréhension

    Découper le texte et lui attribuer des IDs prépare le calcul ; cela ne prouve pas une compréhension.

    Revoir S04
  • Entraînement ≠ génération

    L’apprentissage ajuste les paramètres avant la conversation. Ils restent fixes pendant cette réponse.

    Revoir S03
  • Probabilité ≠ vérité

    Un score élevé pour une continuation ne vérifie pas les faits. Le maximum n’est pas une garantie.

    Revoir S07
  • Guidé ≠ autonome

    Notre équipe a écrit la réponse et imposé ses tokens. Les calculs conditionnels capturés ne prouvent pas que le modèle aurait choisi ce texte.

    Revoir S08

Le voyage ne valide aucune leçon à votre place. Continuez avec les six leçons existantes. Ouvrir les leçons

Expliquez à voix haute ou pour vous-même. Votre explication n’est ni collectée ni enregistrée.

Avant que le modèle traite la demande…

L’entrée est préparée maintenant ; les paramètres appris existent déjà. Revoir S02–S03.

Avant de sélectionner le token suivant…

Les scores concernent les suites sous ce contexte, pas la vérification des faits. Revoir S06–S07.

Dans une génération ordinaire, après le choix d’un token…

Le token rejoint le préfixe pour le calcul suivant. Dans notre exemple seulement, le script impose ce token. Revoir S08.

Quand la réponse apparaît…

L’affichage n’est pas un test de vérité et son rythme n’est pas le temps de génération. Revoir S09–S10.

Voir une explication de référence

Dans une génération autorégressive ordinaire, une règle de décodage choisit le token suivant à partir des scores du contexte courant, étend ce contexte et recommence. Elle n’exige pas une réponse complète écrite à l’avance. Calculs enregistrés pour les préfixes successifs ; tokens imposés par le script. Fin du chemin préparé — pas arrêt choisi par le modèle. La démonstration de chemin imposé n’établit ni génération autonome ni vérité factuelle.

La démonstration de chemin imposé n’établit ni génération autonome ni vérité factuelle.

Approfondir

Le modèle n’est pas l’assistant entier. Une application peut ajouter recherche, outils ou mémoire externe, avec leurs comportements et autorisations. Ne montrer ces capacités comme utilisées que si la trace les contient vraiment.

Les six leçons existantes et leurs laboratoires restent disponibles maintenant. Elles approfondissent génération, tokens, variation, hallucinations, contexte et systèmes ; leurs simulations préparées ne sont pas la trace capturée de ce modèle.

This scene in English

Voici la version de lecture complète. Les commandes interactives nécessitent JavaScript ; les explications et les sources, non.

Site existant · Explorer les six leçons

Explorer les six leçons

Provenance, sources et limites de cette capture

Introduction de la proposition éditoriale d’origine, désormais liée aux données vérifiées :

Notre équipe a rédigé la réponse de l’exemple pour garder un récit facile à suivre. Ce voyage proposé montrerait les calculs du modèle le long de ce chemin imposé, pas une réponse générée librement. Aucun modèle n’est appelé pendant une visite.

Dans une génération autorégressive ordinaire, une règle de décodage choisit le token suivant à partir des scores du contexte courant, étend ce contexte et recommence. Elle n’exige pas une réponse complète écrite à l’avance.

HuggingFaceTB/SmolLM2-135M-Instruct · 12fd25f77366fa6b3b4b768ec3050bf629380bac · Apache-2.0 · float32 · CPU · PyTorch 2.8.0+cpu · Transformers 4.57.6. Seed 0 de reproductibilité, pas de tirage. La capture n’est pas en direct.

SHA256 5af571cbf074e6d21a03528d2330792e532ca608f24ac70a143f6b369968ab8c

journey-guided-trace-v1 · late-authored-v1 · fr

Manifeste des traces · Modèle / tokenizer

Une tête et une couche du prompt initial, huit dimensions choisies ; aucun poids distribué. Les diagrammes et la caméra ne représentent pas des mesures de transport ou de latence.