Suivez ce message
S01 · Tout commence par un message
Réponse préparée — rédigée par notre équipe
Choix imposés, calculs enregistrés. Aucun appel modèle en direct.
Le même message quitte l’application ; aucune réponse n’a été ajoutée.
Lire la réponse préparée (hors de l’entrée du modèle)
Bonjour, je serai un peu en retard. Désolé pour l’attente !
Avec quoi suis-je en train d’échanger quand j’écris ?
Vous écrivez dans une application. C’est l’interface, pas le modèle de langage lui-même.
La réponse est rédigée ; les calculs du modèle le long du chemin imposé ont été enregistrés séparément. Aucun appel modèle en direct.
- VousUne demande préparée.
- ApplicationL’écran où vous écrivez.
- Votre messageLa demande, pas la réponse.
La réponse est rédigée ; les calculs du modèle le long du chemin imposé ont été enregistrés séparément. Aucun appel modèle en direct.
Montrez-moi
La réponse sera-t-elle déjà cachée dans ce message ?
L’application prépare une demande. Produire la réponse est une autre étape.
Approfondir
Cet exemple suit un assistant hébergé à distance. La personne, l’ordinateur et le trajet sont des schémas pédagogiques, pas l’enregistrement d’une vraie conversation.
S02 · La demande arrive au serveur
Le modèle reçoit-il seulement le texte que je vois ?
Un serveur est un ordinateur qui exécute des logiciels. Le modèle est le calcul appris qu’utilise ce logiciel ; ce n’est pas le serveur lui-même.
L’application prépare l’entrée. Ouvrez l’enveloppe de cet exemple pour voir exactement ce qu’elle contenait.
- ApplicationPrépare l’entrée.
- ServeurLa machine qui héberge.
- ModèleLe calcul appris, exécuté ici.
Entrée enregistrée — la cible rédigée reste hors de la demande initiale.
Montrez-moi
L’entrée pourrait-elle contenir autre chose que le message visible ?
- Message utilisateur
- Écris un message pour prévenir que je serai en retard.
- Système implicite du template officiel
- You are a helpful AI assistant named SmolLM, trained by Hugging Face
- Historique / outils
- Absents dans cet exemple.
Inspecter l’entrée complète
<|im_start|>system You are a helpful AI assistant named SmolLM, trained by Hugging Face<|im_end|> <|im_start|>user Écris un message pour prévenir que je serai en retard.<|im_end|> <|im_start|>assistant
Rôles et template exact
[
{
"role": "user",
"content": "Écris un message pour prévenir que je serai en retard."
}
]{% for message in messages %}{% if loop.first and messages[0]['role'] != 'system' %}{{ '<|im_start|>system
You are a helpful AI assistant named SmolLM, trained by Hugging Face<|im_end|>
' }}{% endif %}{{'<|im_start|>' + message['role'] + '
' + message['content'] + '<|im_end|>' + '
'}}{% endfor %}{% if add_generation_prompt %}{{ '<|im_start|>assistant
' }}{% endif %}Les marqueurs im_start / im_end délimitent les rôles ; le préfixe assistant ouvre la continuation. Aucune normalisation du message ; rien omis dans la sérialisation ci-dessus.
Ce que l’application envoie et ce que sa bulle de message affiche ne sont pas forcément identiques.
Approfondir
Montrer l’entrée sérialisée complète en plus de ses sections lisibles. Si les consignes ou l’historique sont absents, indiquer absents dans cet exemple. Nommer les marqueurs spéciaux et le formatage omis.
D’autres systèmes exécutent le modèle localement. Ce dessin ne décrit ni tous les réseaux ni la politique de confidentialité de chaque fournisseur.
S03 · Le modèle a été entraîné avant ce message
Qu’est-ce qui avait déjà été appris avant l’envoi ?
Un grand modèle de langage, ou LLM, est un modèle informatique entraîné à traiter et produire du texte.
Pendant l’entraînement, exemples, prédictions et écarts mesurés servent à ajuster des nombres appelés paramètres. Pendant cette réponse, ces nombres appris restent fixes.
- Avant votre messageL’entraînement ajuste les paramètres.
- Modèle entraînéDes paramètres appris, pas des fiches.
- MaintenantParamètres fixes pendant cette réponse.
L’entraînement reste un schéma pédagogique ; les calculs d’inférence ultérieurs utilisent des paramètres fixes.
Montrez-moi
Ce nouveau message réentraîne-t-il le modèle ?
Avant cette conversation : entraînement
◇ Schéma pédagogique — simplifié, non mesuré · □ □ ◇ → □ ◇ ◇
Exemple → prédiction → écart mesuré → ajustement des paramètres. Ces marques représentent un changement passé, sans chiffre de training inventé.
◇ Schéma pédagogique — simplifié, non mesuré
□ ◇ ◇ → 🔒 · Marques symboliques, pas des valeurs capturées.
Pendant l’entraînement, exemples, prédictions et écarts mesurés servent à ajuster des nombres appelés paramètres. Pendant cette réponse, ces nombres appris restent fixes.
L’entraînement change les réglages appris. Utiliser ces réglages pour traiter une entrée s’appelle l’inférence.
Approfondir
Le schéma d’entraînement montre un principe, pas une capture de l’entraînement de ce modèle. Une prédiction est comparée à la cible d’un exemple ; une procédure d’optimisation ajuste les paramètres à partir d’un écart mesuré.
Les paramètres ne sont pas des tiroirs contenant chacun un mot ou un souvenir. Un modèle peut néanmoins mémoriser certains éléments d’entraînement. Des entraînements supplémentaires peuvent améliorer le suivi des consignes ; ils ne sont pas montrés ici.
S04 · Le texte devient des tokens
Le modèle reçoit-il une liste de mots entiers ?
Un tokenizer transforme le texte en unités appelées tokens et en identifiants numériques. Un token n’est pas forcément un mot entier.
Un identifiant désigne une entrée du vocabulaire de ce tokenizer. Un nombre plus grand ne désigne pas un mot plus important.
- Texte d’entréeL’enveloppe complète, pas seulement la bulle.
- TokenizerDécoupe selon ses règles.
- Tokens ordonnésUn fragment, une position et un ID.
Résultat du tokenizer vérifié — fragments et IDs exacts, non inventés pour le récit.
Montrez-moi
Chaque tuile correspondra-t-elle à un mot entier ?
○ Trace capturée — pièces BPE brutes (Ġ espace, Ċ saut de ligne). Les offsets sont des points de code Unicode, parfois partagés ; un décodage unitaire peut être incomplet.
<|im_start|> · ID 1system · ID 9690Ċ · ID 198You · ID 2683Ġare · ID 359Ġa · ID 253Ġhelpful · ID 5356ĠAI · ID 5646Ġassistant · ID 11173Ġnamed · ID 3365ĠSm · ID 3511ol · ID 308LM · ID 34519, · ID 28Ġtrained · ID 7018Ġby · ID 411ĠH · ID 407ugging · ID 19712ĠFace · ID 8182<|im_end|> · ID 2Ċ · ID 198<|im_start|> · ID 1user · ID 4093Ċ · ID 198Ãī · ID 39614c · ID 83ris · ID 4593Ġun · ID 551Ġmessage · ID 3714Ġpour · ID 18244Ġpr · ID 694é · ID 2756ven · ID 1241ir · ID 337Ġque · ID 10168Ġje · ID 16718Ġser · ID 1236ai · ID 2554Ġen · ID 430Ġretard · ID 26278. · ID 30<|im_end|> · ID 2Ċ · ID 198<|im_start|> · ID 1ass · ID 520istant · ID 9531Ċ · ID 198Position inspectée 46 · ID 198 · [201, 202) · Décodage unitaire:
"\n"
<|im_start|>system You are a helpful AI assistant named SmolLM, trained by Hugging Face<|im_end|> <|im_start|>user Écris un message pour prévenir que je serai en retard.<|im_end|> <|im_start|>assistant
La tokenisation seule ne comprend pas la phrase. D’autres tokenizers peuvent la découper autrement.
Le fragment, son identifiant et sa place dans la séquence sont des choses différentes.
Approfondir
Un caractère affiché peut couvrir plusieurs tokens, et un token ne se décode pas forcément en un caractère Unicode complet à lui seul. Les fragments regroupés pour l’affichage doivent lister leurs tokens sous-jacents, sans se faire passer pour un seul token.
Le décodage de la séquence complète suit les règles du tokenizer. Si une normalisation change l’entrée, montrer séparément les formes originale et normalisée ; ne pas promettre une égalité octet par octet.
S05 · Un identifiant désigne une liste de nombres
Que peut calculer le modèle à partir d’un identifiant ?
Un identifiant sélectionne une ligne d’une table apprise : une liste de nombres appelée embedding. Cette représentation de départ sert aux calculs.
Le modèle tient aussi compte des positions dans la séquence. Les quelques valeurs montrées ici ne sont pas une carte complète du sens.
- Fragment → IDL’identité du token reste la même.
- Table appriseL’ID désigne une ligne.
- ReprésentationUne liste de nombres pour calculer.
Consultation de table enregistrée — dimensions sélectionnées ; l’espacement n’est pas une distance sémantique.
Montrez-moi
L’identifiant du token est-il déjà toute sa représentation ?
Précision d’affichage : les derniers chiffres des nombres peuvent varier à l’export, sans renormalisation. Données canoniques et SHA256 : manifeste des traces.
Position 46 · Ċ → ID 198 → ligne de table apprise. Les paramètres restent fixes.
□ Vue réduite documentée du prompt initial : dimensions 0, 1, 2, 3, 4, 5, 6, 7 / 576. Valeurs signées de la capture ; pas d’axe humain ni d’échelle couleur quantitative.
Position 46 · Ċ → ID 198 → ligne de table apprise
| Dimension | Embedding |
|---|---|
| 0 | -0.2119140625 |
| 1 | -0.1201171875 |
| 2 | 0.1728515625 |
| 3 | 0.056396484375 |
| 4 | 0.216796875 |
| 5 | -0.0308837890625 |
| 6 | 0.169921875 |
| 7 | -0.16796875 |
RoPE traite les positions par rotation dans l’attention, pas par un axe psychologique ni une addition systématique à cette table.
L’identifiant permet de trouver une ligne apprise ; cette liste de valeurs participe ensuite aux calculs.
Approfondir
Un vecteur est une liste ordonnée de nombres ; une dimension est une place numérotée de cette liste. Chaque case affichée doit nommer sa dimension et son point d’extraction. Préférer des dimensions sélectionnées, sauf besoin d’une projection explicitement documentée ; aucune de ces vues ne rend l’espace complet tridimensionnel.
La façon d’introduire la position dépend de l’architecture retenue. L02 doit la documenter ; le dessin ne doit pas supposer qu’on additionne toujours une position à l’embedding.
S06 · Le contexte transforme la représentation
Comment l’entrée environnante agit-elle sur la représentation d’un token ?
Le modèle comporte des étapes successives de calcul appelées couches. Dans une couche, l’attention combine les informations des positions autorisées, jamais celles des positions suivantes ici.
D’autres transformations apprises modifient aussi la représentation. Les tokens originaux et les paramètres appris restent fixes pendant cette réponse.
- Sources autoriséesLa position inspectée et celles qui précèdent. Jamais le futur.
- Une couche ouverteAttention, puis autres calculs dont le MLP.
- Même position, aprèsUne représentation transformée, pas un nouveau token.
États et attention enregistrés — mêmes préfixe et position ; vue réduite, pas explication complète.
Montrez-moi
Une position antérieure peut-elle lire un token suivant dans ce modèle ?
Précision d’affichage : les derniers chiffres des nombres peuvent varier à l’export, sans renormalisation. Données canoniques et SHA256 : manifeste des traces.
Même position inspectée 46 · Ċ · ID 198. Avant et après la même couche ; le texte et les paramètres restent fixes.
Couche 0 · tête 0 · indices base zéro. Entrée du bloc → RMSNorm, attention, résiduel, RMSNorm, MLP SiLU, résiduel → sortie du même bloc. Aucun nouveau token.
□ Vue réduite documentée du prompt initial : dimensions 0, 1, 2, 3, 4, 5, 6, 7 / 576. Valeurs signées de la capture ; pas d’axe humain ni d’échelle couleur quantitative.
Position 46 · Ċ → ID 198 → ligne de table apprise
| Dimension | Avant | Après |
|---|---|---|
| 0 | -0.2119140625 | 0.2611467242240906 |
| 1 | -0.1201171875 | 0.38337385654449463 |
| 2 | 0.1728515625 | 0.6567775011062622 |
| 3 | 0.056396484375 | 1.648341417312622 |
| 4 | 0.216796875 | 0.10010802000761032 |
| 5 | -0.0308837890625 | 0.18014803528785703 |
| 6 | 0.169921875 | 0.23515748977661133 |
| 7 | -0.16796875 | -0.022570863366127018 |
RoPE traite les positions par rotation dans l’attention, pas par un axe psychologique ni une addition systématique à cette table.
Sources d’attention autorisées — prompt initial
- 0 ·
<|im_start|>· 0.026725977659225464 - 1 ·
system· 0.04963835328817368 - 2 ·
Ċ· 0.011997961439192297 - 3 ·
You· 0.00980914942920208 - 4 ·
Ġare· 0.03442519158124924 - 5 ·
Ġa· 0.03587106615304947 - 6 ·
Ġhelpful· 0.011090868152678013 - 7 ·
ĠAI· 0.02505892515182495 - 8 ·
Ġassistant· 0.014532403089106085 - 9 ·
Ġnamed· 0.007473553065210581 - 10 ·
ĠSm· 0.0072178589180111885 - 11 ·
ol· 0.018568789586424828 - 12 ·
LM· 0.007869393564760685 - 13 ·
,· 0.003013758221641183 - 14 ·
Ġtrained· 0.03314068168401718 - 15 ·
Ġby· 0.0020901267416775227 - 16 ·
ĠH· 0.004633747972548008 - 17 ·
ugging· 0.016797970980405807 - 18 ·
ĠFace· 0.01832457259297371 - 19 ·
<|im_end|>· 0.03805198520421982 - 20 ·
Ċ· 0.01134332362562418 - 21 ·
<|im_start|>· 0.032385051250457764 - 22 ·
user· 0.017451483756303787 - 23 ·
Ċ· 0.015037097036838531 - 24 ·
Ãī· 0.02421461045742035 - 25 ·
c· 0.03470586612820625 - 26 ·
ris· 0.01725437119603157 - 27 ·
Ġun· 0.010100603103637695 - 28 ·
Ġmessage· 0.03214215487241745 - 29 ·
Ġpour· 0.01045569870620966 - 30 ·
Ġpr· 0.014588957652449608 - 31 ·
é· 0.05043886974453926 - 32 ·
ven· 0.02845172956585884 - 33 ·
ir· 0.029869219288229942 - 34 ·
Ġque· 0.00638422230258584 - 35 ·
Ġje· 0.01012976747006178 - 36 ·
Ġser· 0.014183315448462965 - 37 ·
ai· 0.0193825364112854 - 38 ·
Ġen· 0.0053899469785392284 - 39 ·
Ġretard· 0.03540363535284996 - 40 ·
.· 0.003282587742432952 - 41 ·
<|im_end|>· 0.05170406401157379 - 42 ·
Ċ· 0.008082968182861805 - 43 ·
<|im_start|>· 0.05317793786525726 - 44 ·
ass· 0.04472203552722931 - 45 ·
istant· 0.039488811045885086 - 46 ·
Ċ· 0.0038967933505773544
× Positions futures interdites: aucune position future dans cette entrée.
Toute la ligne autorisée est affichée, sans renormaliser. Paramètres et IDs inchangés, représentations calculées différentes.
Le contexte contribue à de nouvelles valeurs calculées, pas à une réécriture du texte initial ni à un nouvel entraînement.
Approfondir
Une tête est un calcul d’attention au sein d’une couche. Afficher son identité, la ligne sélectionnée, les liens omis et leurs poids, sans renormaliser un sous-ensemble caché comme s’il était complet.
La transformation appliquée à chaque position, souvent appelée MLP, change également les valeurs. La normalisation remet des valeurs intermédiaires à l’échelle ; les connexions résiduelles transportent des valeurs antérieures à côté d’une transformation. Leur ordre relève de l’architecture retenue. Une seule carte d’attention n’explique pas entièrement la cause d’une réponse.
S07 · Les scores du modèle ne sont pas notre choix imposé
Qui décide du prochain token dans cet exemple pédagogique ?
À la dernière position de l’entrée complète, la représentation finale du modèle donne des scores pour les tokens suivants possibles. Ces scores peuvent être convertis en probabilités.
Scores conditionnels enregistrés. Choix imposé — non sélectionné par le modèle. La probabilité n’est pas la vérité.
- Représentation finaleÀ la dernière position du préfixe.
- ○ Maximum calculéLe meilleur score du modèle, pas l’auteur de la réponse.
- ◇ Cible du scriptLe token imposé, même si son score est plus faible.
Scores conditionnels enregistrés. Choix imposé — non sélectionné par le modèle. La probabilité n’est pas la vérité.
Montrez-moi
Le token imposé doit-il forcément avoir le score maximal du modèle ?
Précision d’affichage : les derniers chiffres des nombres peuvent varier à l’export, sans renormalisation. Données canoniques et SHA256 : manifeste des traces.
Contexte exact de ce choix
<|im_start|>system You are a helpful AI assistant named SmolLM, trained by Hugging Face<|im_end|> <|im_start|>user Écris un message pour prévenir que je serai en retard.<|im_end|> <|im_start|>assistant
Calculs du modèle enregistrés — pour le préfixe affiché · Préfixe du pas 0 · Vue réduite documentée
Représentation finale à la dernière position → logits → softmax du vocabulaire complet.
Probabilité ≠ vérité. Ces scores concernent la continuation du préfixe, pas la fiabilité d’une affirmation.
Maximum du modèle (argmax)
Je · ID 46719 · rank / rang 1Logit 29.521896362304688 · P 0.12436846336982604 · log(P) -2.08450664070498
Le plus probable pour ce préfixe. Il ne décide pas du token ajouté dans notre exemple.
Choix imposé — non sélectionné par le modèle
Bon · ID 30904 · rank / rang 29Logit 26.679283142089844 · P 0.0072473466173351 · log(P) -4.927119860919824
Cible hors top 8 — non remontée dans le classement.
Choix imposé — non sélectionné par le modèle ·Bon · ID 30904De la représentation aux probabilités
d0: -1.4330589771270752 d1: -1.9094539880752563 d2: 0.4182783365249634 d3: 0.11701548844575882 d4: 0.7645692825317383 d5: -0.747779369354248 d6: -0.947211742401123 d7: -0.19573858380317688
8 meilleurs candidats et cible imposée. Valeurs de la fixture affichées par le navigateur, notation scientifique si nécessaire ; aucune renormalisation. Logsumexp du vocabulaire complet: 31.606403003009667
Je· ID 46719 · rank / rang 1Logit 29.521896362304688 · P 0.12436846336982604 · log(P) -2.08450664070498
I· ID 57 · rank / rang 2Logit 29.077938079833984 · P 0.07978139690651247 · log(P) -2.528464923175683
P· ID 64 · rank / rang 3Logit 28.49665069580078 · P 0.044612004043674706 · log(P) -3.109752307208886
"· ID 18 · rank / rang 4Logit 28.16761016845703 · P 0.03210341608057901 · log(P) -3.438792834552636
Ãī· ID 39614 · rank / rang 5Logit 28.03687286376953 · P 0.028169086119563484 · log(P) -3.569530139240136
Il· ID 39393 · rank / rang 6Logit 27.938257217407227 · P 0.025523752606602605 · log(P) -3.668145785602441
A· ID 49 · rank / rang 7Logit 27.872241973876953 · P 0.02389320836796328 · log(P) -3.7341610291327143
O· ID 63 · rank / rang 8Logit 27.860122680664062 · P 0.023605387187452087 · log(P) -3.746280322345605
Autres tokens : 0.6106959387004912 · 49143 candidats omis.
Ce sont les tokens qui ne sont ni dans le top 8 ni la cible imposée. La probabilité de la cible compte une seule fois, même lorsqu’elle figure dans les deux panneaux. other_probability = masse hors UNION(top8, cible).
Le maximum départage les égalités par ID croissant. Le script impose la cible, même si elle coïncide avec lui. Température 1, aucun filtre ni tirage.
La boucle ordinaire, différente de notre exemple
Dans une génération autorégressive ordinaire, une règle de décodage choisit le token suivant à partir des scores du contexte courant, étend ce contexte et recommence. Elle n’exige pas une réponse complète écrite à l’avance.
Inspecter ≠ sélectionner ≠ ajouter. Aucun token encore ajouté.
L’inspection ne change ni le choix imposé par le script ni les valeurs enregistrées.
Approfondir
Dans une génération autorégressive ordinaire, une règle de décodage choisit le token suivant à partir des scores du contexte courant, étend ce contexte et recommence. Elle n’exige pas une réponse complète écrite à l’avance.
La masse Autres exclut l’union des huit meilleurs candidats et de la cible imposée. Une cible hors top 8 est retirée une seule fois ; aucun softmax sur la seule liste visible.
S08 · Ajouter un token, puis recommencer
Qu’est-ce qui change après le choix du premier token ?
Dans une génération ordinaire, chaque token choisi rejoint le contexte utilisé au pas suivant.
Calculs enregistrés pour les préfixes successifs ; tokens imposés par le script. Fin du chemin préparé — pas arrêt choisi par le modèle.
- Préfixe actuelL’entrée et les tokens déjà ajoutés.
- ◇ Choix imposéLe script fixe le token ; ses scores sont capturés.
- Préfixe étenduL’ajout change le contexte du calcul suivant.
Calculs enregistrés pour les préfixes successifs ; tokens imposés par le script. Fin du chemin préparé — pas arrêt choisi par le modèle.
Montrez-moi
Le pas suivant peut-il continuer avec l’ancien contexte ?
Précision d’affichage : les derniers chiffres des nombres peuvent varier à l’export, sans renormalisation. Données canoniques et SHA256 : manifeste des traces.
Tokens imposés ajoutés : 22 / 22.
Préfixe qui a produit le dernier token ajouté · ID 5728
<|im_start|>system You are a helpful AI assistant named SmolLM, trained by Hugging Face<|im_end|> <|im_start|>user Écris un message pour prévenir que je serai en retard.<|im_end|> <|im_start|>assistant Bonjour, je serai un peu en retard. Désolé pour l’attente
Préfixe final — aucun prochain choix capturé · 47 + 22 tokens
<|im_start|>system You are a helpful AI assistant named SmolLM, trained by Hugging Face<|im_end|> <|im_start|>user Écris un message pour prévenir que je serai en retard.<|im_end|> <|im_start|>assistant Bonjour, je serai un peu en retard. Désolé pour l’attente !
1, 9690, 198, 2683, 359, 253, 5356, 5646, 11173, 3365, 3511, 308, 34519, 28, 7018, 411, 407, 19712, 8182, 2, 198, 1, 4093, 198, 39614, 83, 4593, 551, 3714, 18244, 694, 2756, 1241, 337, 10168, 16718, 1236, 2554, 430, 26278, 30, 2, 198, 1, 520, 9531, 198, 30904, 24583, 28, 16718, 1236, 2554, 551, 610, 101, 430, 26278, 30, 422, 2756, 4806, 2756, 18244, 303, 417, 2192, 25583, 5728
Fin du chemin préparé — pas arrêt choisi par le modèle: prepared_sequence_end · 22 tokens. Aucun EOS ajouté, aucune distribution terminale inventée.
Journal exact de tous les pas
g=0 → 1 · ID 30904
<|im_start|>system You are a helpful AI assistant named SmolLM, trained by Hugging Face<|im_end|> <|im_start|>user Écris un message pour prévenir que je serai en retard.<|im_end|> <|im_start|>assistant
1, 9690, 198, 2683, 359, 253, 5356, 5646, 11173, 3365, 3511, 308, 34519, 28, 7018, 411, 407, 19712, 8182, 2, 198, 1, 4093, 198, 39614, 83, 4593, 551, 3714, 18244, 694, 2756, 1241, 337, 10168, 16718, 1236, 2554, 430, 26278, 30, 2, 198, 1, 520, 9531, 198
Calculs du modèle enregistrés — pour le préfixe affiché · Préfixe du pas 0 · Vue réduite documentée
Représentation finale à la dernière position → logits → softmax du vocabulaire complet.
Probabilité ≠ vérité. Ces scores concernent la continuation du préfixe, pas la fiabilité d’une affirmation.
Maximum du modèle (argmax)
Je · ID 46719 · rank / rang 1Logit 29.521896362304688 · P 0.12436846336982604 · log(P) -2.08450664070498
Le plus probable pour ce préfixe. Il ne décide pas du token ajouté dans notre exemple.
Choix imposé — non sélectionné par le modèle
Bon · ID 30904 · rank / rang 29Logit 26.679283142089844 · P 0.0072473466173351 · log(P) -4.927119860919824
Cible hors top 8 — non remontée dans le classement.
Choix imposé — non sélectionné par le modèle ·Bon · ID 30904De la représentation aux probabilités
d0: -1.4330589771270752 d1: -1.9094539880752563 d2: 0.4182783365249634 d3: 0.11701548844575882 d4: 0.7645692825317383 d5: -0.747779369354248 d6: -0.947211742401123 d7: -0.19573858380317688
8 meilleurs candidats et cible imposée. Valeurs de la fixture affichées par le navigateur, notation scientifique si nécessaire ; aucune renormalisation. Logsumexp du vocabulaire complet: 31.606403003009667
Je· ID 46719 · rank / rang 1Logit 29.521896362304688 · P 0.12436846336982604 · log(P) -2.08450664070498
I· ID 57 · rank / rang 2Logit 29.077938079833984 · P 0.07978139690651247 · log(P) -2.528464923175683
P· ID 64 · rank / rang 3Logit 28.49665069580078 · P 0.044612004043674706 · log(P) -3.109752307208886
"· ID 18 · rank / rang 4Logit 28.16761016845703 · P 0.03210341608057901 · log(P) -3.438792834552636
Ãī· ID 39614 · rank / rang 5Logit 28.03687286376953 · P 0.028169086119563484 · log(P) -3.569530139240136
Il· ID 39393 · rank / rang 6Logit 27.938257217407227 · P 0.025523752606602605 · log(P) -3.668145785602441
A· ID 49 · rank / rang 7Logit 27.872241973876953 · P 0.02389320836796328 · log(P) -3.7341610291327143
O· ID 63 · rank / rang 8Logit 27.860122680664062 · P 0.023605387187452087 · log(P) -3.746280322345605
Autres tokens : 0.6106959387004912 · 49143 candidats omis.
Ce sont les tokens qui ne sont ni dans le top 8 ni la cible imposée. La probabilité de la cible compte une seule fois, même lorsqu’elle figure dans les deux panneaux. other_probability = masse hors UNION(top8, cible).
Le maximum départage les égalités par ID croissant. Le script impose la cible, même si elle coïncide avec lui. Température 1, aucun filtre ni tirage.
La boucle ordinaire, différente de notre exemple
Dans une génération autorégressive ordinaire, une règle de décodage choisit le token suivant à partir des scores du contexte courant, étend ce contexte et recommence. Elle n’exige pas une réponse complète écrite à l’avance.
Bon
g=1 → 2 · ID 24583
<|im_start|>system You are a helpful AI assistant named SmolLM, trained by Hugging Face<|im_end|> <|im_start|>user Écris un message pour prévenir que je serai en retard.<|im_end|> <|im_start|>assistant Bon
1, 9690, 198, 2683, 359, 253, 5356, 5646, 11173, 3365, 3511, 308, 34519, 28, 7018, 411, 407, 19712, 8182, 2, 198, 1, 4093, 198, 39614, 83, 4593, 551, 3714, 18244, 694, 2756, 1241, 337, 10168, 16718, 1236, 2554, 430, 26278, 30, 2, 198, 1, 520, 9531, 198, 30904
Calculs du modèle enregistrés — pour le préfixe affiché · Préfixe du pas 1 · Vue réduite documentée
Représentation finale à la dernière position → logits → softmax du vocabulaire complet.
Probabilité ≠ vérité. Ces scores concernent la continuation du préfixe, pas la fiabilité d’une affirmation.
Maximum du modèle (argmax)
jour · ID 24583 · rank / rang 1Logit 22.073823928833008 · P 0.973072909789434 · log(P) -0.027296266623576315
Le plus probable pour ce préfixe. Il ne décide pas du token ajouté dans notre exemple.
Choix imposé — non sélectionné par le modèle
jour · ID 24583 · rank / rang 1Logit 22.073823928833008 · P 0.973072909789434 · log(P) -0.027296266623576315
Cible déjà comprise dans le top 8 ; sa probabilité n’est comptée qu’une fois.
Choix imposé — non sélectionné par le modèle ·jour · ID 24583De la représentation aux probabilités
d0: -2.9087820053100586 d1: -3.610962867736816 d2: 0.3395976126194 d3: -1.3137314319610596 d4: 0.6003316640853882 d5: -1.84756863117218 d6: -0.7222286462783813 d7: -3.3083014488220215
8 meilleurs candidats et cible imposée. Valeurs de la fixture affichées par le navigateur, notation scientifique si nécessaire ; aucune renormalisation. Logsumexp du vocabulaire complet: 22.101120195456584
jour· ID 24583 · rank / rang 1Logit 22.073823928833008 · P 0.973072909789434 · log(P) -0.027296266623576315
ne· ID 662 · rank / rang 2Logit 17.506574630737305 · P 0.010106812629785364 · log(P) -4.594545564719279
so· ID 559 · rank / rang 3Logit 17.02890968322754 · P 0.0062685481120451315 · log(P) -5.072210512229045
ci· ID 605 · rank / rang 4Logit 15.676040649414062 · P 0.0016204043760471578 · log(P) -6.425079546042522
,· ID 28 · rank / rang 5Logit 15.345574378967283 · P 0.0011644041098775766 · log(P) -6.755545816489299
Ġcourage· ID 9664 · rank / rang 6Logit 14.765352249145508 · P 0.0006518031581414293 · log(P) -7.335767946311076
Ġvoyage· ID 19102 · rank / rang 7Logit 14.70380687713623 · P 0.0006128972107917511 · log(P) -7.397313318320354
Ġj· ID 544 · rank / rang 8Logit 14.18800926208496 · P 0.0003659144725706563 · log(P) -7.913110933371623
Autres tokens : 0.006136306141304985 · 49144 candidats omis.
Ce sont les tokens qui ne sont ni dans le top 8 ni la cible imposée. La probabilité de la cible compte une seule fois, même lorsqu’elle figure dans les deux panneaux. other_probability = masse hors UNION(top8, cible).
Le maximum départage les égalités par ID croissant. Le script impose la cible, même si elle coïncide avec lui. Température 1, aucun filtre ni tirage.
La boucle ordinaire, différente de notre exemple
Dans une génération autorégressive ordinaire, une règle de décodage choisit le token suivant à partir des scores du contexte courant, étend ce contexte et recommence. Elle n’exige pas une réponse complète écrite à l’avance.
Bonjour
g=2 → 3 · ID 28
<|im_start|>system You are a helpful AI assistant named SmolLM, trained by Hugging Face<|im_end|> <|im_start|>user Écris un message pour prévenir que je serai en retard.<|im_end|> <|im_start|>assistant Bonjour
1, 9690, 198, 2683, 359, 253, 5356, 5646, 11173, 3365, 3511, 308, 34519, 28, 7018, 411, 407, 19712, 8182, 2, 198, 1, 4093, 198, 39614, 83, 4593, 551, 3714, 18244, 694, 2756, 1241, 337, 10168, 16718, 1236, 2554, 430, 26278, 30, 2, 198, 1, 520, 9531, 198, 30904, 24583
Calculs du modèle enregistrés — pour le préfixe affiché · Préfixe du pas 2 · Vue réduite documentée
Représentation finale à la dernière position → logits → softmax du vocabulaire complet.
Probabilité ≠ vérité. Ces scores concernent la continuation du préfixe, pas la fiabilité d’une affirmation.
Maximum du modèle (argmax)
. · ID 30 · rank / rang 1Logit 13.586103439331056 · P 0.4137145018573275 · log(P) -0.8825791520867821
Le plus probable pour ce préfixe. Il ne décide pas du token ajouté dans notre exemple.
Choix imposé — non sélectionné par le modèle
, · ID 28 · rank / rang 2Logit 13.579950332641602 · P 0.4111766881147335 · log(P) -0.8887322587762352
Cible déjà comprise dans le top 8 ; sa probabilité n’est comptée qu’une fois.
Choix imposé — non sélectionné par le modèle ·, · ID 28De la représentation aux probabilités
d0: -0.228873074054718 d1: -2.201641082763672 d2: 0.7894116044044495 d3: 0.24131017923355105 d4: 2.032252311706543 d5: -2.2423629760742188 d6: -2.132188081741333 d7: -0.17613479495048523
8 meilleurs candidats et cible imposée. Valeurs de la fixture affichées par le navigateur, notation scientifique si nécessaire ; aucune renormalisation. Logsumexp du vocabulaire complet: 14.468682591417837
.· ID 30 · rank / rang 1Logit 13.586103439331056 · P 0.4137145018573275 · log(P) -0.8825791520867821
,· ID 28 · rank / rang 2Logit 13.579950332641602 · P 0.4111766881147335 · log(P) -0.8887322587762352
!· ID 17 · rank / rang 3Logit 12.090697288513184 · P 0.09273722684783088 · log(P) -2.377985302904653
Ġet· ID 1482 · rank / rang 4Logit 9.719011306762695 · P 0.008654539615568337 · log(P) -4.749671284655141
ĠÃł· ID 25782 · rank / rang 5Logit 9.417637825012209 · P 0.006402640686783166 · log(P) -5.05104476640563
Ġm· ID 283 · rank / rang 6Logit 9.19094467163086 · P 0.0051039633184630446 · log(P) -5.277737919786977
...· ID 2026 · rank / rang 7Logit 9.06790542602539 · P 0.0045130721758345465 · log(P) -5.400777165392446
Ġ!· ID 5728 · rank / rang 8Logit 8.841423988342285 · P 0.0035984265335611476 · log(P) -5.627258603075552
Autres tokens : 0.054098940849897456 · 49144 candidats omis.
Ce sont les tokens qui ne sont ni dans le top 8 ni la cible imposée. La probabilité de la cible compte une seule fois, même lorsqu’elle figure dans les deux panneaux. other_probability = masse hors UNION(top8, cible).
Le maximum départage les égalités par ID croissant. Le script impose la cible, même si elle coïncide avec lui. Température 1, aucun filtre ni tirage.
La boucle ordinaire, différente de notre exemple
Dans une génération autorégressive ordinaire, une règle de décodage choisit le token suivant à partir des scores du contexte courant, étend ce contexte et recommence. Elle n’exige pas une réponse complète écrite à l’avance.
Bonjour,
g=3 → 4 · ID 16718
<|im_start|>system You are a helpful AI assistant named SmolLM, trained by Hugging Face<|im_end|> <|im_start|>user Écris un message pour prévenir que je serai en retard.<|im_end|> <|im_start|>assistant Bonjour,
1, 9690, 198, 2683, 359, 253, 5356, 5646, 11173, 3365, 3511, 308, 34519, 28, 7018, 411, 407, 19712, 8182, 2, 198, 1, 4093, 198, 39614, 83, 4593, 551, 3714, 18244, 694, 2756, 1241, 337, 10168, 16718, 1236, 2554, 430, 26278, 30, 2, 198, 1, 520, 9531, 198, 30904, 24583, 28
Calculs du modèle enregistrés — pour le préfixe affiché · Préfixe du pas 3 · Vue réduite documentée
Représentation finale à la dernière position → logits → softmax du vocabulaire complet.
Probabilité ≠ vérité. Ces scores concernent la continuation du préfixe, pas la fiabilité d’une affirmation.
Maximum du modèle (argmax)
Ġje · ID 16718 · rank / rang 1Logit 15.923510551452637 · P 0.271015143215405 · log(P) -1.305580580639976
Le plus probable pour ce préfixe. Il ne décide pas du token ajouté dans notre exemple.
Choix imposé — non sélectionné par le modèle
Ġje · ID 16718 · rank / rang 1Logit 15.923510551452637 · P 0.271015143215405 · log(P) -1.305580580639976
Cible déjà comprise dans le top 8 ; sa probabilité n’est comptée qu’une fois.
Choix imposé — non sélectionné par le modèle ·Ġje · ID 16718De la représentation aux probabilités
d0: -1.1670832633972168 d1: -1.5306396484375 d2: 1.0043869018554688 d3: 0.31430262327194214 d4: 3.0947186946868896 d5: -1.0508641004562378 d6: -0.5993603467941284 d7: -0.9445556998252868
8 meilleurs candidats et cible imposée. Valeurs de la fixture affichées par le navigateur, notation scientifique si nécessaire ; aucune renormalisation. Logsumexp du vocabulaire complet: 17.229091132092613
Ġje· ID 16718 · rank / rang 1Logit 15.923510551452637 · P 0.271015143215405 · log(P) -1.305580580639976
Ġm· ID 283 · rank / rang 2Logit 14.233381271362305 · P 0.050001120653742605 · log(P) -2.995709860730308
Ġmes· ID 11450 · rank / rang 3Logit 14.04343605041504 · P 0.041351148546722435 · log(P) -3.1856550816775737
Ġj· ID 544 · rank / rang 4Logit 13.919782638549805 · P 0.036541433656369374 · log(P) -3.309308493542808
Ġc· ID 265 · rank / rang 5Logit 13.90509033203125 · P 0.036008480455433915 · log(P) -3.324000800061363
Ġvot· ID 11279 · rank / rang 6Logit 13.81171417236328 · P 0.03279835360801841 · log(P) -3.4173769597293315
Ġv· ID 386 · rank / rang 7Logit 13.787216186523438 · P 0.03200462211340283 · log(P) -3.4418749455691753
Ġon· ID 335 · rank / rang 8Logit 13.680167198181152 · P 0.02875556590123552 · log(P) -3.5489239339114604
Autres tokens : 0.47152413184966857 · 49144 candidats omis.
Ce sont les tokens qui ne sont ni dans le top 8 ni la cible imposée. La probabilité de la cible compte une seule fois, même lorsqu’elle figure dans les deux panneaux. other_probability = masse hors UNION(top8, cible).
Le maximum départage les égalités par ID croissant. Le script impose la cible, même si elle coïncide avec lui. Température 1, aucun filtre ni tirage.
La boucle ordinaire, différente de notre exemple
Dans une génération autorégressive ordinaire, une règle de décodage choisit le token suivant à partir des scores du contexte courant, étend ce contexte et recommence. Elle n’exige pas une réponse complète écrite à l’avance.
Bonjour, je
g=4 → 5 · ID 1236
<|im_start|>system You are a helpful AI assistant named SmolLM, trained by Hugging Face<|im_end|> <|im_start|>user Écris un message pour prévenir que je serai en retard.<|im_end|> <|im_start|>assistant Bonjour, je
1, 9690, 198, 2683, 359, 253, 5356, 5646, 11173, 3365, 3511, 308, 34519, 28, 7018, 411, 407, 19712, 8182, 2, 198, 1, 4093, 198, 39614, 83, 4593, 551, 3714, 18244, 694, 2756, 1241, 337, 10168, 16718, 1236, 2554, 430, 26278, 30, 2, 198, 1, 520, 9531, 198, 30904, 24583, 28, 16718
Calculs du modèle enregistrés — pour le préfixe affiché · Préfixe du pas 4 · Vue réduite documentée
Représentation finale à la dernière position → logits → softmax du vocabulaire complet.
Probabilité ≠ vérité. Ces scores concernent la continuation du préfixe, pas la fiabilité d’une affirmation.
Maximum du modèle (argmax)
Ġv · ID 386 · rank / rang 1Logit 16.843231201171875 · P 0.20722109270515315 · log(P) -1.573968975007908
Le plus probable pour ce préfixe. Il ne décide pas du token ajouté dans notre exemple.
Choix imposé — non sélectionné par le modèle
Ġser · ID 1236 · rank / rang 7Logit 14.995488166809082 · P 0.032656478856201994 · log(P) -3.421712009370701
Cible déjà comprise dans le top 8 ; sa probabilité n’est comptée qu’une fois.
Choix imposé — non sélectionné par le modèle ·Ġser · ID 1236De la représentation aux probabilités
d0: 0.24815835058689115 d1: -0.4923732280731201 d2: -0.9667584896087646 d3: -0.1231997087597847 d4: 0.8510195016860962 d5: -2.6437599658966064 d6: 1.4744571447372437 d7: 0.8924923539161682
8 meilleurs candidats et cible imposée. Valeurs de la fixture affichées par le navigateur, notation scientifique si nécessaire ; aucune renormalisation. Logsumexp du vocabulaire complet: 18.417200176179783
Ġv· ID 386 · rank / rang 1Logit 16.843231201171875 · P 0.20722109270515315 · log(P) -1.573968975007908
Ġsu· ID 393 · rank / rang 2Logit 16.455942153930664 · P 0.1406813293095 · log(P) -1.961258022249119
Ġpe· ID 610 · rank / rang 3Logit 15.698829650878906 · P 0.06598218317449493 · log(P) -2.7183705253008767
Ġne· ID 420 · rank / rang 4Logit 15.423049926757812 · P 0.05007916380961869 · log(P) -2.9941502494219705
Ġp· ID 273 · rank / rang 5Logit 15.245500564575195 · P 0.04193226873412697 · log(P) -3.1716996116045877
Ġn· ID 304 · rank / rang 6Logit 15.236151695251465 · P 0.041542076204710635 · log(P) -3.181048480928318
Ġser· ID 1236 · rank / rang 7Logit 14.995488166809082 · P 0.032656478856201994 · log(P) -3.421712009370701
Ġtrou· ID 4872 · rank / rang 8Logit 14.87564182281494 · P 0.028968149276948404 · log(P) -3.5415583533648416
Autres tokens : 0.3909372579292436 · 49144 candidats omis.
Ce sont les tokens qui ne sont ni dans le top 8 ni la cible imposée. La probabilité de la cible compte une seule fois, même lorsqu’elle figure dans les deux panneaux. other_probability = masse hors UNION(top8, cible).
Le maximum départage les égalités par ID croissant. Le script impose la cible, même si elle coïncide avec lui. Température 1, aucun filtre ni tirage.
La boucle ordinaire, différente de notre exemple
Dans une génération autorégressive ordinaire, une règle de décodage choisit le token suivant à partir des scores du contexte courant, étend ce contexte et recommence. Elle n’exige pas une réponse complète écrite à l’avance.
Bonjour, je ser
g=5 → 6 · ID 2554
<|im_start|>system You are a helpful AI assistant named SmolLM, trained by Hugging Face<|im_end|> <|im_start|>user Écris un message pour prévenir que je serai en retard.<|im_end|> <|im_start|>assistant Bonjour, je ser
1, 9690, 198, 2683, 359, 253, 5356, 5646, 11173, 3365, 3511, 308, 34519, 28, 7018, 411, 407, 19712, 8182, 2, 198, 1, 4093, 198, 39614, 83, 4593, 551, 3714, 18244, 694, 2756, 1241, 337, 10168, 16718, 1236, 2554, 430, 26278, 30, 2, 198, 1, 520, 9531, 198, 30904, 24583, 28, 16718, 1236
Calculs du modèle enregistrés — pour le préfixe affiché · Préfixe du pas 5 · Vue réduite documentée
Représentation finale à la dernière position → logits → softmax du vocabulaire complet.
Probabilité ≠ vérité. Ces scores concernent la continuation du préfixe, pas la fiabilité d’une affirmation.
Maximum du modèle (argmax)
ai · ID 2554 · rank / rang 1Logit 31.34700584411621 · P 0.8413105765076481 · log(P) -0.17279439287994336
Le plus probable pour ce préfixe. Il ne décide pas du token ajouté dans notre exemple.
Choix imposé — non sélectionné par le modèle
ai · ID 2554 · rank / rang 1Logit 31.34700584411621 · P 0.8413105765076481 · log(P) -0.17279439287994336
Cible déjà comprise dans le top 8 ; sa probabilité n’est comptée qu’une fois.
Choix imposé — non sélectionné par le modèle ·ai · ID 2554De la représentation aux probabilités
d0: 0.04796348139643669 d1: -1.136173129081726 d2: 1.0586717128753662 d3: 1.0563223361968994 d4: 2.424827337265014 d5: -3.112288236618042 d6: 2.120153427124023 d7: 0.2560725808143616
8 meilleurs candidats et cible imposée. Valeurs de la fixture affichées par le navigateur, notation scientifique si nécessaire ; aucune renormalisation. Logsumexp du vocabulaire complet: 31.51980023699615
ai· ID 2554 · rank / rang 1Logit 31.34700584411621 · P 0.8413105765076481 · log(P) -0.17279439287994336
a· ID 81 · rank / rang 2Logit 28.919668197631836 · P 0.07426377182570972 · log(P) -2.6001320393643184
ais· ID 10117 · rank / rang 3Logit 28.868629455566406 · P 0.0705685443351365 · log(P) -2.651170781429748
as· ID 292 · rank / rang 4Logit 26.361080169677734 · P 0.005749053379842532 · log(P) -5.15872006731842
ie· ID 519 · rank / rang 5Logit 25.32353782653809 · P 0.002037030007837164 · log(P) -6.196262410458068
ait· ID 2889 · rank / rang 6Logit 24.91974449157715 · P 0.001360292205375306 · log(P) -6.600055745419006
oit· ID 39874 · rank / rang 7Logit 24.235183715820312 · P 0.000686011256709263 · log(P) -7.284616521175842
ons· ID 707 · rank / rang 8Logit 24.207691192626953 · P 0.000667407973660835 · log(P) -7.312109044369201
Autres tokens : 0.00335731250807944 · 49144 candidats omis.
Ce sont les tokens qui ne sont ni dans le top 8 ni la cible imposée. La probabilité de la cible compte une seule fois, même lorsqu’elle figure dans les deux panneaux. other_probability = masse hors UNION(top8, cible).
Le maximum départage les égalités par ID croissant. Le script impose la cible, même si elle coïncide avec lui. Température 1, aucun filtre ni tirage.
La boucle ordinaire, différente de notre exemple
Dans une génération autorégressive ordinaire, une règle de décodage choisit le token suivant à partir des scores du contexte courant, étend ce contexte et recommence. Elle n’exige pas une réponse complète écrite à l’avance.
Bonjour, je serai
g=6 → 7 · ID 551
<|im_start|>system You are a helpful AI assistant named SmolLM, trained by Hugging Face<|im_end|> <|im_start|>user Écris un message pour prévenir que je serai en retard.<|im_end|> <|im_start|>assistant Bonjour, je serai
1, 9690, 198, 2683, 359, 253, 5356, 5646, 11173, 3365, 3511, 308, 34519, 28, 7018, 411, 407, 19712, 8182, 2, 198, 1, 4093, 198, 39614, 83, 4593, 551, 3714, 18244, 694, 2756, 1241, 337, 10168, 16718, 1236, 2554, 430, 26278, 30, 2, 198, 1, 520, 9531, 198, 30904, 24583, 28, 16718, 1236, 2554
Calculs du modèle enregistrés — pour le préfixe affiché · Préfixe du pas 6 · Vue réduite documentée
Représentation finale à la dernière position → logits → softmax du vocabulaire complet.
Probabilité ≠ vérité. Ces scores concernent la continuation du préfixe, pas la fiabilité d’une affirmation.
Maximum du modèle (argmax)
Ġen · ID 430 · rank / rang 1Logit 21.85861587524414 · P 0.4396672976430814 · log(P) -0.8217369798094403
Le plus probable pour ce préfixe. Il ne décide pas du token ajouté dans notre exemple.
Choix imposé — non sélectionné par le modèle
Ġun · ID 551 · rank / rang 41Logit 16.834623336791992 · P 0.0028922240126537926 · log(P) -5.845729518261589
Cible hors top 8 — non remontée dans le classement.
Choix imposé — non sélectionné par le modèle ·Ġun · ID 551De la représentation aux probabilités
d0: -0.5852891802787781 d1: -1.926147222518921 d2: 0.49363112449646 d3: 0.6814907193183899 d4: 1.1125035285949707 d5: -2.7482149600982666 d6: -0.6264455318450928 d7: 0.12376491725444794
8 meilleurs candidats et cible imposée. Valeurs de la fixture affichées par le navigateur, notation scientifique si nécessaire ; aucune renormalisation. Logsumexp du vocabulaire complet: 22.68035285505358
Ġen· ID 430 · rank / rang 1Logit 21.85861587524414 · P 0.4396672976430814 · log(P) -0.8217369798094403
ĠÃł· ID 25782 · rank / rang 2Logit 19.3731689453125 · P 0.036619151524235234 · log(P) -3.307183909741081
Ġin· ID 281 · rank / rang 3Logit 18.90243148803711 · P 0.022870180763615786 · log(P) -3.777921367016471
Ġa· ID 253 · rank / rang 4Logit 18.891342163085938 · P 0.022617966922677465 · log(P) -3.7890106919676434
Ġpr· ID 694 · rank / rang 5Logit 18.86572265625 · P 0.022045865533862914 · log(P) -3.814630198803581
Ġenc· ID 1570 · rank / rang 6Logit 18.595014572143555 · P 0.016817449297912016 · log(P) -4.085338282910026
Ġinv· ID 797 · rank / rang 7Logit 18.496395111083984 · P 0.01523807964865089 · log(P) -4.1839577439695965
Ġn· ID 304 · rank / rang 8Logit 18.33666229248047 · P 0.012988504751651316 · log(P) -4.343690562573112
Autres tokens : 0.40824327990166065 · 49143 candidats omis.
Ce sont les tokens qui ne sont ni dans le top 8 ni la cible imposée. La probabilité de la cible compte une seule fois, même lorsqu’elle figure dans les deux panneaux. other_probability = masse hors UNION(top8, cible).
Le maximum départage les égalités par ID croissant. Le script impose la cible, même si elle coïncide avec lui. Température 1, aucun filtre ni tirage.
La boucle ordinaire, différente de notre exemple
Dans une génération autorégressive ordinaire, une règle de décodage choisit le token suivant à partir des scores du contexte courant, étend ce contexte et recommence. Elle n’exige pas une réponse complète écrite à l’avance.
Bonjour, je serai un
g=7 → 8 · ID 610
<|im_start|>system You are a helpful AI assistant named SmolLM, trained by Hugging Face<|im_end|> <|im_start|>user Écris un message pour prévenir que je serai en retard.<|im_end|> <|im_start|>assistant Bonjour, je serai un
1, 9690, 198, 2683, 359, 253, 5356, 5646, 11173, 3365, 3511, 308, 34519, 28, 7018, 411, 407, 19712, 8182, 2, 198, 1, 4093, 198, 39614, 83, 4593, 551, 3714, 18244, 694, 2756, 1241, 337, 10168, 16718, 1236, 2554, 430, 26278, 30, 2, 198, 1, 520, 9531, 198, 30904, 24583, 28, 16718, 1236, 2554, 551
Calculs du modèle enregistrés — pour le préfixe affiché · Préfixe du pas 7 · Vue réduite documentée
Représentation finale à la dernière position → logits → softmax du vocabulaire complet.
Probabilité ≠ vérité. Ces scores concernent la continuation du préfixe, pas la fiabilité d’une affirmation.
Maximum du modèle (argmax)
Ġmessage · ID 3714 · rank / rang 1Logit 20.616283416748047 · P 0.6625438297054671 · log(P) -0.4116685652641188
Le plus probable pour ce préfixe. Il ne décide pas du token ajouté dans notre exemple.
Choix imposé — non sélectionné par le modèle
Ġpe · ID 610 · rank / rang 14Logit 15.46423053741455 · P 0.003834480007589331 · log(P) -5.563721444597615
Cible hors top 8 — non remontée dans le classement.
Choix imposé — non sélectionné par le modèle ·Ġpe · ID 610De la représentation aux probabilités
d0: -1.3401639461517334 d1: -2.4986860752105713 d2: -1.5055934190750122 d3: 0.4252994358539582 d4: 0.7995864748954773 d5: -1.8998100757598877 d6: -2.2451865673065186 d7: 0.4825330376625061
8 meilleurs candidats et cible imposée. Valeurs de la fixture affichées par le navigateur, notation scientifique si nécessaire ; aucune renormalisation. Logsumexp du vocabulaire complet: 21.02795198201217
Ġmessage· ID 3714 · rank / rang 1Logit 20.616283416748047 · P 0.6625438297054671 · log(P) -0.4116685652641188
Ġm· ID 283 · rank / rang 2Logit 17.60266876220703 · P 0.03254006369340639 · log(P) -3.4252832198051344
Ġdé· ID 32564 · rank / rang 3Logit 16.703170776367188 · P 0.013236445839373494 · log(P) -4.324781205644978
Ġperson· ID 1055 · rank / rang 4Logit 16.681598663330078 · P 0.012953965536438253 · log(P) -4.3463533186820875
Ġj· ID 544 · rank / rang 5Logit 16.48642349243164 · P 0.010657104824502418 · log(P) -4.541528489580525
Ġbon· ID 14047 · rank / rang 6Logit 16.18437957763672 · P 0.007878857252274725 · log(P) -4.843572404375447
Ġn· ID 304 · rank / rang 7Logit 16.132854461669922 · P 0.00748317942609542 · log(P) -4.895097520342244
Ġprob· ID 2245 · rank / rang 8Logit 16.108356475830078 · P 0.007302083897297316 · log(P) -4.9195955061820875
Autres tokens : 0.2415699898175541 · 49143 candidats omis.
Ce sont les tokens qui ne sont ni dans le top 8 ni la cible imposée. La probabilité de la cible compte une seule fois, même lorsqu’elle figure dans les deux panneaux. other_probability = masse hors UNION(top8, cible).
Le maximum départage les égalités par ID croissant. Le script impose la cible, même si elle coïncide avec lui. Température 1, aucun filtre ni tirage.
La boucle ordinaire, différente de notre exemple
Dans une génération autorégressive ordinaire, une règle de décodage choisit le token suivant à partir des scores du contexte courant, étend ce contexte et recommence. Elle n’exige pas une réponse complète écrite à l’avance.
Bonjour, je serai un pe
g=8 → 9 · ID 101
<|im_start|>system You are a helpful AI assistant named SmolLM, trained by Hugging Face<|im_end|> <|im_start|>user Écris un message pour prévenir que je serai en retard.<|im_end|> <|im_start|>assistant Bonjour, je serai un pe
1, 9690, 198, 2683, 359, 253, 5356, 5646, 11173, 3365, 3511, 308, 34519, 28, 7018, 411, 407, 19712, 8182, 2, 198, 1, 4093, 198, 39614, 83, 4593, 551, 3714, 18244, 694, 2756, 1241, 337, 10168, 16718, 1236, 2554, 430, 26278, 30, 2, 198, 1, 520, 9531, 198, 30904, 24583, 28, 16718, 1236, 2554, 551, 610
Calculs du modèle enregistrés — pour le préfixe affiché · Préfixe du pas 8 · Vue réduite documentée
Représentation finale à la dernière position → logits → softmax du vocabulaire complet.
Probabilité ≠ vérité. Ces scores concernent la continuation du préfixe, pas la fiabilité d’une affirmation.
Maximum du modèle (argmax)
u · ID 101 · rank / rang 1Logit 30.223201751708984 · P 0.9683290499021606 · log(P) -0.032183321882975235
Le plus probable pour ce préfixe. Il ne décide pas du token ajouté dans notre exemple.
Choix imposé — non sélectionné par le modèle
u · ID 101 · rank / rang 1Logit 30.223201751708984 · P 0.9683290499021606 · log(P) -0.032183321882975235
Cible déjà comprise dans le top 8 ; sa probabilité n’est comptée qu’une fois.
Choix imposé — non sélectionné par le modèle ·u · ID 101De la représentation aux probabilités
d0: -1.5508224964141846 d1: 0.18414363265037537 d2: 0.309644490480423 d3: -1.1496139764785769 d4: 0.7827787399291992 d5: 0.2243398278951645 d6: -0.9707961082458496 d7: 0.8376893401145935
8 meilleurs candidats et cible imposée. Valeurs de la fixture affichées par le navigateur, notation scientifique si nécessaire ; aucune renormalisation. Logsumexp du vocabulaire complet: 30.25538507359196
u· ID 101 · rank / rang 1Logit 30.223201751708984 · P 0.9683290499021606 · log(P) -0.032183321882975235
ut· ID 316 · rank / rang 2Logit 25.99802017211914 · P 0.014159565142368855 · log(P) -4.257364901472819
ur· ID 315 · rank / rang 3Logit 24.934144973754883 · P 0.004886689982742085 · log(P) -5.321240099837077
uple· ID 11447 · rank / rang 4Logit 24.545934677124023 · P 0.003314493701842442 · log(P) -5.709450396467936
ine· ID 462 · rank / rang 5Logit 24.206768035888672 · P 0.002361125096591271 · log(P) -6.048617037703288
int· ID 591 · rank / rang 6Logit 24.1330509185791 · P 0.002193330410280305 · log(P) -6.122334155012858
au· ID 603 · rank / rang 7Logit 23.788991928100582 · P 0.0015548236541216955 · log(P) -6.466393145491374
cl· ID 497 · rank / rang 8Logit 23.24001121520996 · P 0.0008979700353894512 · log(P) -7.015373858381999
Autres tokens : 0.002302952074501911 · 49144 candidats omis.
Ce sont les tokens qui ne sont ni dans le top 8 ni la cible imposée. La probabilité de la cible compte une seule fois, même lorsqu’elle figure dans les deux panneaux. other_probability = masse hors UNION(top8, cible).
Le maximum départage les égalités par ID croissant. Le script impose la cible, même si elle coïncide avec lui. Température 1, aucun filtre ni tirage.
La boucle ordinaire, différente de notre exemple
Dans une génération autorégressive ordinaire, une règle de décodage choisit le token suivant à partir des scores du contexte courant, étend ce contexte et recommence. Elle n’exige pas une réponse complète écrite à l’avance.
Bonjour, je serai un peu
g=9 → 10 · ID 430
<|im_start|>system You are a helpful AI assistant named SmolLM, trained by Hugging Face<|im_end|> <|im_start|>user Écris un message pour prévenir que je serai en retard.<|im_end|> <|im_start|>assistant Bonjour, je serai un peu
1, 9690, 198, 2683, 359, 253, 5356, 5646, 11173, 3365, 3511, 308, 34519, 28, 7018, 411, 407, 19712, 8182, 2, 198, 1, 4093, 198, 39614, 83, 4593, 551, 3714, 18244, 694, 2756, 1241, 337, 10168, 16718, 1236, 2554, 430, 26278, 30, 2, 198, 1, 520, 9531, 198, 30904, 24583, 28, 16718, 1236, 2554, 551, 610, 101
Calculs du modèle enregistrés — pour le préfixe affiché · Préfixe du pas 9 · Vue réduite documentée
Représentation finale à la dernière position → logits → softmax du vocabulaire complet.
Probabilité ≠ vérité. Ces scores concernent la continuation du préfixe, pas la fiabilité d’une affirmation.
Maximum du modèle (argmax)
ĠÃł · ID 25782 · rank / rang 1Logit 21.922157287597656 · P 0.11263367191710656 · log(P) -2.1836145678637315
Le plus probable pour ce préfixe. Il ne décide pas du token ajouté dans notre exemple.
Choix imposé — non sélectionné par le modèle
Ġen · ID 430 · rank / rang 3Logit 21.296825408935547 · P 0.06026845499602337 · log(P) -2.808946446525841
Cible déjà comprise dans le top 8 ; sa probabilité n’est comptée qu’une fois.
Choix imposé — non sélectionné par le modèle ·Ġen · ID 430De la représentation aux probabilités
d0: -0.92387193441391 d1: -1.8891764879226685 d2: -0.05699828267097473 d3: 1.1937453746795654 d4: 1.915796995162964 d5: -1.885244607925415 d6: -2.0967979431152344 d7: 0.463190883398056
8 meilleurs candidats et cible imposée. Valeurs de la fixture affichées par le navigateur, notation scientifique si nécessaire ; aucune renormalisation. Logsumexp du vocabulaire complet: 24.105771855461388
ĠÃł· ID 25782 · rank / rang 1Logit 21.922157287597656 · P 0.11263367191710656 · log(P) -2.1836145678637315
Ġplus· ID 8055 · rank / rang 2Logit 21.305438995361328 · P 0.06078982475006533 · log(P) -2.8003328601000597
Ġen· ID 430 · rank / rang 3Logit 21.296825408935547 · P 0.06026845499602337 · log(P) -2.808946446525841
Ġpr· ID 694 · rank / rang 4Logit 20.854461669921875 · P 0.03872343969041945 · log(P) -3.251310185539513
Ġde· ID 367 · rank / rang 5Logit 20.723941802978516 · P 0.03398520308479383 · log(P) -3.381830052482872
Ġm· ID 283 · rank / rang 6Logit 20.488082885742188 · P 0.026844643645416943 · log(P) -3.6176889697192
Ġdé· ID 32564 · rank / rang 7Logit 20.382795333862305 · P 0.02416194216314387 · log(P) -3.722976521599083
Ġd· ID 287 · rank / rang 8Logit 20.33281517028809 · P 0.022984006254679216 · log(P) -3.772956685173302
Autres tokens : 0.6196088134983518 · 49144 candidats omis.
Ce sont les tokens qui ne sont ni dans le top 8 ni la cible imposée. La probabilité de la cible compte une seule fois, même lorsqu’elle figure dans les deux panneaux. other_probability = masse hors UNION(top8, cible).
Le maximum départage les égalités par ID croissant. Le script impose la cible, même si elle coïncide avec lui. Température 1, aucun filtre ni tirage.
La boucle ordinaire, différente de notre exemple
Dans une génération autorégressive ordinaire, une règle de décodage choisit le token suivant à partir des scores du contexte courant, étend ce contexte et recommence. Elle n’exige pas une réponse complète écrite à l’avance.
Bonjour, je serai un peu en
g=10 → 11 · ID 26278
<|im_start|>system You are a helpful AI assistant named SmolLM, trained by Hugging Face<|im_end|> <|im_start|>user Écris un message pour prévenir que je serai en retard.<|im_end|> <|im_start|>assistant Bonjour, je serai un peu en
1, 9690, 198, 2683, 359, 253, 5356, 5646, 11173, 3365, 3511, 308, 34519, 28, 7018, 411, 407, 19712, 8182, 2, 198, 1, 4093, 198, 39614, 83, 4593, 551, 3714, 18244, 694, 2756, 1241, 337, 10168, 16718, 1236, 2554, 430, 26278, 30, 2, 198, 1, 520, 9531, 198, 30904, 24583, 28, 16718, 1236, 2554, 551, 610, 101, 430
Calculs du modèle enregistrés — pour le préfixe affiché · Préfixe du pas 10 · Vue réduite documentée
Représentation finale à la dernière position → logits → softmax du vocabulaire complet.
Probabilité ≠ vérité. Ces scores concernent la continuation du préfixe, pas la fiabilité d’une affirmation.
Maximum du modèle (argmax)
Ġretard · ID 26278 · rank / rang 1Logit 30.131881713867188 · P 0.9976111806758564 · log(P) -0.002391677105080703
Le plus probable pour ce préfixe. Il ne décide pas du token ajouté dans notre exemple.
Choix imposé — non sélectionné par le modèle
Ġretard · ID 26278 · rank / rang 1Logit 30.131881713867188 · P 0.9976111806758564 · log(P) -0.002391677105080703
Cible déjà comprise dans le top 8 ; sa probabilité n’est comptée qu’une fois.
Choix imposé — non sélectionné par le modèle ·Ġretard · ID 26278De la représentation aux probabilités
d0: -1.138788104057312 d1: -1.195247769355774 d2: -1.459794998168945 d3: 0.13725727796554563 d4: 0.3723635971546173 d5: -1.2121572494506836 d6: -2.3445231914520264 d7: -0.549301028251648
8 meilleurs candidats et cible imposée. Valeurs de la fixture affichées par le navigateur, notation scientifique si nécessaire ; aucune renormalisation. Logsumexp du vocabulaire complet: 30.134273390972268
Ġretard· ID 26278 · rank / rang 1Logit 30.131881713867188 · P 0.9976111806758564 · log(P) -0.002391677105080703
Ġret· ID 829 · rank / rang 2Logit 22.270763397216797 · P 0.00038452183070837977 · log(P) -7.863509993755471
ret· ID 3274 · rank / rang 3Logit 21.86779022216797 · P 0.00025698748550074586 · log(P) -8.2664831688043
Ġr· ID 412 · rank / rang 4Logit 21.71356964111328 · P 0.0002202595906182039 · log(P) -8.420703749858987
Ġt· ID 252 · rank / rang 5Logit 20.580989837646484 · P 0.00007096785333911661 · log(P) -9.553283553325784
Ġde· ID 367 · rank / rang 6Logit 20.128887176513672 · P 0.00004515605337922712 · log(P) -10.005386214458596
Ġfa· ID 3561 · rank / rang 7Logit 20.042749404907227 · P 0.000041429225921236606 · log(P) -10.091523986065042
Ġrapp· ID 26510 · rank / rang 8Logit 19.607234954833984 · P 0.000026801882345587853 · log(P) -10.527038436138284
Autres tokens : 0.0013426954023329472 · 49144 candidats omis.
Ce sont les tokens qui ne sont ni dans le top 8 ni la cible imposée. La probabilité de la cible compte une seule fois, même lorsqu’elle figure dans les deux panneaux. other_probability = masse hors UNION(top8, cible).
Le maximum départage les égalités par ID croissant. Le script impose la cible, même si elle coïncide avec lui. Température 1, aucun filtre ni tirage.
La boucle ordinaire, différente de notre exemple
Dans une génération autorégressive ordinaire, une règle de décodage choisit le token suivant à partir des scores du contexte courant, étend ce contexte et recommence. Elle n’exige pas une réponse complète écrite à l’avance.
Bonjour, je serai un peu en retard
g=11 → 12 · ID 30
<|im_start|>system You are a helpful AI assistant named SmolLM, trained by Hugging Face<|im_end|> <|im_start|>user Écris un message pour prévenir que je serai en retard.<|im_end|> <|im_start|>assistant Bonjour, je serai un peu en retard
1, 9690, 198, 2683, 359, 253, 5356, 5646, 11173, 3365, 3511, 308, 34519, 28, 7018, 411, 407, 19712, 8182, 2, 198, 1, 4093, 198, 39614, 83, 4593, 551, 3714, 18244, 694, 2756, 1241, 337, 10168, 16718, 1236, 2554, 430, 26278, 30, 2, 198, 1, 520, 9531, 198, 30904, 24583, 28, 16718, 1236, 2554, 551, 610, 101, 430, 26278
Calculs du modèle enregistrés — pour le préfixe affiché · Préfixe du pas 11 · Vue réduite documentée
Représentation finale à la dernière position → logits → softmax du vocabulaire complet.
Probabilité ≠ vérité. Ces scores concernent la continuation du préfixe, pas la fiabilité d’une affirmation.
Maximum du modèle (argmax)
. · ID 30 · rank / rang 1Logit 27.974336624145508 · P 0.7305039770296866 · log(P) -0.31402060354927386
Le plus probable pour ce préfixe. Il ne décide pas du token ajouté dans notre exemple.
Choix imposé — non sélectionné par le modèle
. · ID 30 · rank / rang 1Logit 27.974336624145508 · P 0.7305039770296866 · log(P) -0.31402060354927386
Cible déjà comprise dans le top 8 ; sa probabilité n’est comptée qu’une fois.
Choix imposé — non sélectionné par le modèle ·. · ID 30De la représentation aux probabilités
d0: -0.06603647768497467 d1: -1.3273259401321411 d2: -0.5162432789802551 d3: 1.526349425315857 d4: 1.752465844154358 d5: -1.5746952295303345 d6: -1.8733279705047607 d7: 0.07422294467687607
8 meilleurs candidats et cible imposée. Valeurs de la fixture affichées par le navigateur, notation scientifique si nécessaire ; aucune renormalisation. Logsumexp du vocabulaire complet: 28.28835722769478
.· ID 30 · rank / rang 1Logit 27.974336624145508 · P 0.7305039770296866 · log(P) -0.31402060354927386
,· ID 28 · rank / rang 2Logit 25.764177322387695 · P 0.08012399511334305 · log(P) -2.5241799053070864
Ġpour· ID 18244 · rank / rang 3Logit 25.3084716796875 · P 0.050798647538637075 · log(P) -2.9798855480072817
ĠÃł· ID 25782 · rank / rang 4Logit 23.964195251464844 · P 0.013244644774236654 · log(P) -4.324161976229938
Ġet· ID 1482 · rank / rang 5Logit 23.802162170410156 · P 0.01126341904356481 · log(P) -4.486195057284625
!· ID 17 · rank / rang 6Logit 23.71979331970215 · P 0.010372845386813772 · log(P) -4.568563907992633
Ġdans· ID 44612 · rank / rang 7Logit 23.583797454833984 · P 0.009053899112814054 · log(P) -4.704559772860797
Ġque· ID 10168 · rank / rang 8Logit 23.421276092529297 · P 0.007695795523484625 · log(P) -4.867081135165485
Autres tokens : 0.08694277647741898 · 49144 candidats omis.
Ce sont les tokens qui ne sont ni dans le top 8 ni la cible imposée. La probabilité de la cible compte une seule fois, même lorsqu’elle figure dans les deux panneaux. other_probability = masse hors UNION(top8, cible).
Le maximum départage les égalités par ID croissant. Le script impose la cible, même si elle coïncide avec lui. Température 1, aucun filtre ni tirage.
La boucle ordinaire, différente de notre exemple
Dans une génération autorégressive ordinaire, une règle de décodage choisit le token suivant à partir des scores du contexte courant, étend ce contexte et recommence. Elle n’exige pas une réponse complète écrite à l’avance.
Bonjour, je serai un peu en retard.
g=12 → 13 · ID 422
<|im_start|>system You are a helpful AI assistant named SmolLM, trained by Hugging Face<|im_end|> <|im_start|>user Écris un message pour prévenir que je serai en retard.<|im_end|> <|im_start|>assistant Bonjour, je serai un peu en retard.
1, 9690, 198, 2683, 359, 253, 5356, 5646, 11173, 3365, 3511, 308, 34519, 28, 7018, 411, 407, 19712, 8182, 2, 198, 1, 4093, 198, 39614, 83, 4593, 551, 3714, 18244, 694, 2756, 1241, 337, 10168, 16718, 1236, 2554, 430, 26278, 30, 2, 198, 1, 520, 9531, 198, 30904, 24583, 28, 16718, 1236, 2554, 551, 610, 101, 430, 26278, 30
Calculs du modèle enregistrés — pour le préfixe affiché · Préfixe du pas 12 · Vue réduite documentée
Représentation finale à la dernière position → logits → softmax du vocabulaire complet.
Probabilité ≠ vérité. Ces scores concernent la continuation du préfixe, pas la fiabilité d’une affirmation.
Maximum du modèle (argmax)
<|im_end|> · ID 2 · rank / rang 1Logit 14.987017631530762 · P 0.5087251127780099 · log(P) -0.6758474617943371
Le plus probable pour ce préfixe. Il ne décide pas du token ajouté dans notre exemple.
Choix imposé — non sélectionné par le modèle
ĠD · ID 422 · rank / rang 12Logit 10.63726043701172 · P 0.006567614144740871 · log(P) -5.02560465631338
Cible hors top 8 — non remontée dans le classement.
Choix imposé — non sélectionné par le modèle ·ĠD · ID 422De la représentation aux probabilités
d0: -1.5081180334091189 d1: -1.9106686115264893 d2: 0.5811565518379211 d3: 0.6886863112449646 d4: 1.591434359550476 d5: -0.9471566677093506 d6: -0.4676462709903717 d7: -0.7724117636680603
8 meilleurs candidats et cible imposée. Valeurs de la fixture affichées par le navigateur, notation scientifique si nécessaire ; aucune renormalisation. Logsumexp du vocabulaire complet: 15.6628650933251
<|im_end|>· ID 2 · rank / rang 1Logit 14.987017631530762 · P 0.5087251127780099 · log(P) -0.6758474617943371
Ċ· ID 198 · rank / rang 2Logit 13.445426940917969 · P 0.10888770551772772 · log(P) -2.21743815240713
ĠĊ· ID 3717 · rank / rang 3Logit 12.367053985595703 · P 0.03703799105950669 · log(P) -3.2958111077293957
ĠPour· ID 32846 · rank / rang 4Logit 11.957664489746094 · P 0.024595282970935425 · log(P) -3.705200603579005
ĊĊ· ID 1116 · rank / rang 5Logit 11.592865943908691 · P 0.017077403033237445 · log(P) -4.069999149416407
ĠJe· ID 5816 · rank / rang 6Logit 11.559093475341797 · P 0.016510287327133024 · log(P) -4.103771617983302
ĠI· ID 339 · rank / rang 7Logit 11.434996604919434 · P 0.014583442219337134 · log(P) -4.227868488405665
ĠV· ID 717 · rank / rang 8Logit 11.321467399597168 · P 0.01301831985754346 · log(P) -4.341397693727931
Autres tokens : 0.25299684109182885 · 49143 candidats omis.
Ce sont les tokens qui ne sont ni dans le top 8 ni la cible imposée. La probabilité de la cible compte une seule fois, même lorsqu’elle figure dans les deux panneaux. other_probability = masse hors UNION(top8, cible).
Le maximum départage les égalités par ID croissant. Le script impose la cible, même si elle coïncide avec lui. Température 1, aucun filtre ni tirage.
La boucle ordinaire, différente de notre exemple
Dans une génération autorégressive ordinaire, une règle de décodage choisit le token suivant à partir des scores du contexte courant, étend ce contexte et recommence. Elle n’exige pas une réponse complète écrite à l’avance.
Bonjour, je serai un peu en retard. D
g=13 → 14 · ID 2756
<|im_start|>system You are a helpful AI assistant named SmolLM, trained by Hugging Face<|im_end|> <|im_start|>user Écris un message pour prévenir que je serai en retard.<|im_end|> <|im_start|>assistant Bonjour, je serai un peu en retard. D
1, 9690, 198, 2683, 359, 253, 5356, 5646, 11173, 3365, 3511, 308, 34519, 28, 7018, 411, 407, 19712, 8182, 2, 198, 1, 4093, 198, 39614, 83, 4593, 551, 3714, 18244, 694, 2756, 1241, 337, 10168, 16718, 1236, 2554, 430, 26278, 30, 2, 198, 1, 520, 9531, 198, 30904, 24583, 28, 16718, 1236, 2554, 551, 610, 101, 430, 26278, 30, 422
Calculs du modèle enregistrés — pour le préfixe affiché · Préfixe du pas 13 · Vue réduite documentée
Représentation finale à la dernière position → logits → softmax du vocabulaire complet.
Probabilité ≠ vérité. Ces scores concernent la continuation du préfixe, pas la fiabilité d’une affirmation.
Maximum du modèle (argmax)
' · ID 23 · rank / rang 1Logit 27.338125228881836 · P 0.6712172561695814 · log(P) -0.398662414729376
Le plus probable pour ce préfixe. Il ne décide pas du token ajouté dans notre exemple.
Choix imposé — non sélectionné par le modèle
é · ID 2756 · rank / rang 4Logit 24.296804428100582 · P 0.03206522352174758 · log(P) -3.439983215510626
Cible déjà comprise dans le top 8 ; sa probabilité n’est comptée qu’une fois.
Choix imposé — non sélectionné par le modèle ·Ã© · ID 2756De la représentation aux probabilités
d0: -1.195767164230347 d1: -2.6633524894714355 d2: -0.8023663759231567 d3: -0.9104528427124025 d4: 0.350973516702652 d5: -2.1821889877319336 d6: -1.276976227760315 d7: -1.6820309162139893
8 meilleurs candidats et cible imposée. Valeurs de la fixture affichées par le navigateur, notation scientifique si nécessaire ; aucune renormalisation. Logsumexp du vocabulaire complet: 27.736787643611212
'· ID 23 · rank / rang 1Logit 27.338125228881836 · P 0.6712172561695814 · log(P) -0.398662414729376
ans· ID 487 · rank / rang 2Logit 25.628631591796875 · P 0.12146172920169317 · log(P) -2.108156051814337
ès· ID 42623 · rank / rang 3Logit 24.408802032470703 · P 0.03586527896849571 · log(P) -3.327985611140509
é· ID 2756 · rank / rang 4Logit 24.296804428100582 · P 0.03206522352174758 · log(P) -3.439983215510626
âĢĻ· ID 417 · rank / rang 5Logit 23.726099014282227 · P 0.018120912347542047 · log(P) -4.010688629328985
ont· ID 1866 · rank / rang 6Logit 23.690601348876953 · P 0.01748894530115377 · log(P) -4.046186294734259
és· ID 17842 · rank / rang 7Logit 23.539133071899418 · P 0.015030789148403351 · log(P) -4.197654571711798
ure· ID 424 · rank / rang 8Logit 23.38759422302246 · P 0.012917227149295909 · log(P) -4.349193420588751
Autres tokens : 0.07583263819208819 · 49144 candidats omis.
Ce sont les tokens qui ne sont ni dans le top 8 ni la cible imposée. La probabilité de la cible compte une seule fois, même lorsqu’elle figure dans les deux panneaux. other_probability = masse hors UNION(top8, cible).
Le maximum départage les égalités par ID croissant. Le script impose la cible, même si elle coïncide avec lui. Température 1, aucun filtre ni tirage.
La boucle ordinaire, différente de notre exemple
Dans une génération autorégressive ordinaire, une règle de décodage choisit le token suivant à partir des scores du contexte courant, étend ce contexte et recommence. Elle n’exige pas une réponse complète écrite à l’avance.
Bonjour, je serai un peu en retard. Dé
g=14 → 15 · ID 4806
<|im_start|>system You are a helpful AI assistant named SmolLM, trained by Hugging Face<|im_end|> <|im_start|>user Écris un message pour prévenir que je serai en retard.<|im_end|> <|im_start|>assistant Bonjour, je serai un peu en retard. Dé
1, 9690, 198, 2683, 359, 253, 5356, 5646, 11173, 3365, 3511, 308, 34519, 28, 7018, 411, 407, 19712, 8182, 2, 198, 1, 4093, 198, 39614, 83, 4593, 551, 3714, 18244, 694, 2756, 1241, 337, 10168, 16718, 1236, 2554, 430, 26278, 30, 2, 198, 1, 520, 9531, 198, 30904, 24583, 28, 16718, 1236, 2554, 551, 610, 101, 430, 26278, 30, 422, 2756
Calculs du modèle enregistrés — pour le préfixe affiché · Préfixe du pas 14 · Vue réduite documentée
Représentation finale à la dernière position → logits → softmax du vocabulaire complet.
Probabilité ≠ vérité. Ces scores concernent la continuation du préfixe, pas la fiabilité d’une affirmation.
Maximum du modèle (argmax)
j · ID 90 · rank / rang 1Logit 28.399314880371097 · P 0.3359542555528255 · log(P) -1.0907802724754134
Le plus probable pour ce préfixe. Il ne décide pas du token ajouté dans notre exemple.
Choix imposé — non sélectionné par le modèle
sol · ID 4806 · rank / rang 2Logit 28.202484130859375 · P 0.2759291850789397 · log(P) -1.2876110219871322
Cible déjà comprise dans le top 8 ; sa probabilité n’est comptée qu’une fois.
Choix imposé — non sélectionné par le modèle ·sol · ID 4806De la représentation aux probabilités
d0: -1.5557963848114014 d1: -1.0562338829040527 d2: 1.2607582807540894 d3: -1.620851993560791 d4: 1.0365076065063477 d5: 1.12365460395813 d6: -1.4210118055343628 d7: 0.3036811947822571
8 meilleurs candidats et cible imposée. Valeurs de la fixture affichées par le navigateur, notation scientifique si nécessaire ; aucune renormalisation. Logsumexp du vocabulaire complet: 29.490095152846507
j· ID 90 · rank / rang 1Logit 28.399314880371097 · P 0.3359542555528255 · log(P) -1.0907802724754134
sol· ID 4806 · rank / rang 2Logit 28.202484130859375 · P 0.2759291850789397 · log(P) -1.2876110219871322
cou· ID 36122 · rank / rang 3Logit 26.466882705688477 · P 0.048644698567167154 · log(P) -3.0232124471580306
f· ID 86 · rank / rang 4Logit 26.371353149414062 · P 0.04421275294123599 · log(P) -3.1187420034324447
c· ID 83 · rank / rang 5Logit 26.197275161743164 · P 0.03714894186103291 · log(P) -3.292819991103343
p· ID 96 · rank / rang 6Logit 25.54354476928711 · P 0.019321237807103903 · log(P) -3.946550383559398
lic· ID 709 · rank / rang 7Logit 25.38472366333008 · P 0.016483894106945066 · log(P) -4.105371489516429
con· ID 607 · rank / rang 8Logit 25.245101928710938 · P 0.014335830816328502 · log(P) -4.24499322413557
Autres tokens : 0.2079692032684217 · 49144 candidats omis.
Ce sont les tokens qui ne sont ni dans le top 8 ni la cible imposée. La probabilité de la cible compte une seule fois, même lorsqu’elle figure dans les deux panneaux. other_probability = masse hors UNION(top8, cible).
Le maximum départage les égalités par ID croissant. Le script impose la cible, même si elle coïncide avec lui. Température 1, aucun filtre ni tirage.
La boucle ordinaire, différente de notre exemple
Dans une génération autorégressive ordinaire, une règle de décodage choisit le token suivant à partir des scores du contexte courant, étend ce contexte et recommence. Elle n’exige pas une réponse complète écrite à l’avance.
Bonjour, je serai un peu en retard. Désol
g=15 → 16 · ID 2756
<|im_start|>system You are a helpful AI assistant named SmolLM, trained by Hugging Face<|im_end|> <|im_start|>user Écris un message pour prévenir que je serai en retard.<|im_end|> <|im_start|>assistant Bonjour, je serai un peu en retard. Désol
1, 9690, 198, 2683, 359, 253, 5356, 5646, 11173, 3365, 3511, 308, 34519, 28, 7018, 411, 407, 19712, 8182, 2, 198, 1, 4093, 198, 39614, 83, 4593, 551, 3714, 18244, 694, 2756, 1241, 337, 10168, 16718, 1236, 2554, 430, 26278, 30, 2, 198, 1, 520, 9531, 198, 30904, 24583, 28, 16718, 1236, 2554, 551, 610, 101, 430, 26278, 30, 422, 2756, 4806
Calculs du modèle enregistrés — pour le préfixe affiché · Préfixe du pas 15 · Vue réduite documentée
Représentation finale à la dernière position → logits → softmax du vocabulaire complet.
Probabilité ≠ vérité. Ces scores concernent la continuation du préfixe, pas la fiabilité d’une affirmation.
Maximum du modèle (argmax)
é · ID 2756 · rank / rang 1Logit 33.35481262207031 · P 0.49284186631440463 · log(P) -0.707566914376244
Le plus probable pour ce préfixe. Il ne décide pas du token ajouté dans notre exemple.
Choix imposé — non sélectionné par le modèle
é · ID 2756 · rank / rang 1Logit 33.35481262207031 · P 0.49284186631440463 · log(P) -0.707566914376244
Cible déjà comprise dans le top 8 ; sa probabilité n’est comptée qu’une fois.
Choix imposé — non sélectionné par le modèle ·Ã© · ID 2756De la représentation aux probabilités
d0: -0.06437170505523682 d1: -2.404874324798584 d2: -1.0103013515472412 d3: -1.0836488008499146 d4: 1.6632883548736572 d5: -1.3793132305145264 d6: -0.2849445641040802 d7: -0.868305504322052
8 meilleurs candidats et cible imposée. Valeurs de la fixture affichées par le navigateur, notation scientifique si nécessaire ; aucune renormalisation. Logsumexp du vocabulaire complet: 34.06237953644656
é· ID 2756 · rank / rang 1Logit 33.35481262207031 · P 0.49284186631440463 · log(P) -0.707566914376244
er· ID 259 · rank / rang 2Logit 33.025875091552734 · P 0.3546923642101004 · log(P) -1.036504444893822
ent· ID 293 · rank / rang 3Logit 30.61857032775879 · P 0.03194277658526872 · log(P) -3.4438092086877674
és· ID 17842 · rank / rang 4Logit 30.384836196899418 · P 0.025285015294978203 · log(P) -3.6775433395471424
ons· ID 707 · rank / rang 5Logit 29.74675750732422 · P 0.013358237688440447 · log(P) -4.315622029122338
ere· ID 518 · rank / rang 6Logit 29.464643478393555 · P 0.01007461829667694 · log(P) -4.597736058053002
ez· ID 12421 · rank / rang 7Logit 29.335134506225582 · P 0.008850821227310901 · log(P) -4.7272450302209705
ant· ID 403 · rank / rang 8Logit 29.121137619018555 · P 0.007145718467101506 · log(P) -4.941241917428002
Autres tokens : 0.05580858191571894 · 49144 candidats omis.
Ce sont les tokens qui ne sont ni dans le top 8 ni la cible imposée. La probabilité de la cible compte une seule fois, même lorsqu’elle figure dans les deux panneaux. other_probability = masse hors UNION(top8, cible).
Le maximum départage les égalités par ID croissant. Le script impose la cible, même si elle coïncide avec lui. Température 1, aucun filtre ni tirage.
La boucle ordinaire, différente de notre exemple
Dans une génération autorégressive ordinaire, une règle de décodage choisit le token suivant à partir des scores du contexte courant, étend ce contexte et recommence. Elle n’exige pas une réponse complète écrite à l’avance.
Bonjour, je serai un peu en retard. Désolé
g=16 → 17 · ID 18244
<|im_start|>system You are a helpful AI assistant named SmolLM, trained by Hugging Face<|im_end|> <|im_start|>user Écris un message pour prévenir que je serai en retard.<|im_end|> <|im_start|>assistant Bonjour, je serai un peu en retard. Désolé
1, 9690, 198, 2683, 359, 253, 5356, 5646, 11173, 3365, 3511, 308, 34519, 28, 7018, 411, 407, 19712, 8182, 2, 198, 1, 4093, 198, 39614, 83, 4593, 551, 3714, 18244, 694, 2756, 1241, 337, 10168, 16718, 1236, 2554, 430, 26278, 30, 2, 198, 1, 520, 9531, 198, 30904, 24583, 28, 16718, 1236, 2554, 551, 610, 101, 430, 26278, 30, 422, 2756, 4806, 2756
Calculs du modèle enregistrés — pour le préfixe affiché · Préfixe du pas 16 · Vue réduite documentée
Représentation finale à la dernière position → logits → softmax du vocabulaire complet.
Probabilité ≠ vérité. Ces scores concernent la continuation du préfixe, pas la fiabilité d’une affirmation.
Maximum du modèle (argmax)
, · ID 28 · rank / rang 1Logit 23.07224464416504 · P 0.3908964379869968 · log(P) -0.9393126185629476
Le plus probable pour ce préfixe. Il ne décide pas du token ajouté dans notre exemple.
Choix imposé — non sélectionné par le modèle
Ġpour · ID 18244 · rank / rang 2Logit 21.982139587402344 · P 0.1314120233354711 · log(P) -2.029417675325643
Cible déjà comprise dans le top 8 ; sa probabilité n’est comptée qu’une fois.
Choix imposé — non sélectionné par le modèle ·Ġpour · ID 18244De la représentation aux probabilités
d0: -0.35173583030700684 d1: -2.460622787475586 d2: -0.8888871073722839 d3: 1.3130075931549072 d4: 2.203940153121948 d5: -2.009690761566162 d6: -1.2561668157577517 d7: 0.5549207925796509
8 meilleurs candidats et cible imposée. Valeurs de la fixture affichées par le navigateur, notation scientifique si nécessaire ; aucune renormalisation. Logsumexp du vocabulaire complet: 24.011557262727987
,· ID 28 · rank / rang 1Logit 23.07224464416504 · P 0.3908964379869968 · log(P) -0.9393126185629476
Ġpour· ID 18244 · rank / rang 2Logit 21.982139587402344 · P 0.1314120233354711 · log(P) -2.029417675325643
Ġde· ID 367 · rank / rang 3Logit 21.618186950683594 · P 0.09132138307709146 · log(P) -2.393370312044393
ĠÃł· ID 25782 · rank / rang 4Logit 20.834583282470703 · P 0.04171168472244552 · log(P) -3.1769739802572836
ment· ID 358 · rank / rang 5Logit 20.458236694335938 · P 0.028629415710036504 · log(P) -3.5533205683920492
Ġet· ID 1482 · rank / rang 6Logit 20.45423698425293 · P 0.028515135044467725 · log(P) -3.557320278475057
.· ID 30 · rank / rang 7Logit 20.37336540222168 · P 0.02629985480578331 · log(P) -3.638191860506307
Ġdes· ID 708 · rank / rang 8Logit 20.202564239501953 · P 0.02217049289175417 · log(P) -3.8089930232260336
Autres tokens : 0.239043572425954 · 49144 candidats omis.
Ce sont les tokens qui ne sont ni dans le top 8 ni la cible imposée. La probabilité de la cible compte une seule fois, même lorsqu’elle figure dans les deux panneaux. other_probability = masse hors UNION(top8, cible).
Le maximum départage les égalités par ID croissant. Le script impose la cible, même si elle coïncide avec lui. Température 1, aucun filtre ni tirage.
La boucle ordinaire, différente de notre exemple
Dans une génération autorégressive ordinaire, une règle de décodage choisit le token suivant à partir des scores du contexte courant, étend ce contexte et recommence. Elle n’exige pas une réponse complète écrite à l’avance.
Bonjour, je serai un peu en retard. Désolé pour
g=17 → 18 · ID 303
<|im_start|>system You are a helpful AI assistant named SmolLM, trained by Hugging Face<|im_end|> <|im_start|>user Écris un message pour prévenir que je serai en retard.<|im_end|> <|im_start|>assistant Bonjour, je serai un peu en retard. Désolé pour
1, 9690, 198, 2683, 359, 253, 5356, 5646, 11173, 3365, 3511, 308, 34519, 28, 7018, 411, 407, 19712, 8182, 2, 198, 1, 4093, 198, 39614, 83, 4593, 551, 3714, 18244, 694, 2756, 1241, 337, 10168, 16718, 1236, 2554, 430, 26278, 30, 2, 198, 1, 520, 9531, 198, 30904, 24583, 28, 16718, 1236, 2554, 551, 610, 101, 430, 26278, 30, 422, 2756, 4806, 2756, 18244
Calculs du modèle enregistrés — pour le préfixe affiché · Préfixe du pas 17 · Vue réduite documentée
Représentation finale à la dernière position → logits → softmax du vocabulaire complet.
Probabilité ≠ vérité. Ces scores concernent la continuation du préfixe, pas la fiabilité d’une affirmation.
Maximum du modèle (argmax)
Ġque · ID 10168 · rank / rang 1Logit 22.000659942626953 · P 0.17737335397837742 · log(P) -1.729498423441381
Le plus probable pour ce préfixe. Il ne décide pas du token ajouté dans notre exemple.
Choix imposé — non sélectionné par le modèle
Ġl · ID 303 · rank / rang 13Logit 19.26510238647461 · P 0.011504051749821833 · log(P) -4.465055979593725
Cible hors top 8 — non remontée dans le classement.
Choix imposé — non sélectionné par le modèle ·Ġl · ID 303De la représentation aux probabilités
d0: -0.4146004915237427 d1: -2.4115827083587646 d2: -1.0639809370040894 d3: -0.3564538359642029 d4: 1.4848241806030271 d5: -1.501789689064026 d6: -1.1314128637313845 d7: -0.3448684513568878
8 meilleurs candidats et cible imposée. Valeurs de la fixture affichées par le navigateur, notation scientifique si nécessaire ; aucune renormalisation. Logsumexp du vocabulaire complet: 23.730158366068338
Ġque· ID 10168 · rank / rang 1Logit 22.000659942626953 · P 0.17737335397837742 · log(P) -1.729498423441381
Ġpr· ID 694 · rank / rang 2Logit 21.787015914916992 · P 0.14325307593082273 · log(P) -1.943142451151342
Ġles· ID 8897 · rank / rang 3Logit 20.521217346191406 · P 0.040399372760048666 · log(P) -3.208941019876928
Ġv· ID 386 · rank / rang 4Logit 20.306640625 · P 0.03259756322611731 · log(P) -3.423517741068334
Ġpre· ID 622 · rank / rang 5Logit 20.188682556152344 · P 0.02897054050658537 · log(P) -3.5414758099159904
Ġfaire· ID 33315 · rank / rang 6Logit 20.16339874267578 · P 0.028247237228523535 · log(P) -3.566759623392553
Ġob· ID 794 · rank / rang 7Logit 19.57173538208008 · P 0.015632190706771354 · log(P) -4.158422983988256
Ġne· ID 420 · rank / rang 8Logit 19.458335876464844 · P 0.01395632470482857 · log(P) -4.27182248960349
Autres tokens : 0.5080662892081035 · 49143 candidats omis.
Ce sont les tokens qui ne sont ni dans le top 8 ni la cible imposée. La probabilité de la cible compte une seule fois, même lorsqu’elle figure dans les deux panneaux. other_probability = masse hors UNION(top8, cible).
Le maximum départage les égalités par ID croissant. Le script impose la cible, même si elle coïncide avec lui. Température 1, aucun filtre ni tirage.
La boucle ordinaire, différente de notre exemple
Dans une génération autorégressive ordinaire, une règle de décodage choisit le token suivant à partir des scores du contexte courant, étend ce contexte et recommence. Elle n’exige pas une réponse complète écrite à l’avance.
Bonjour, je serai un peu en retard. Désolé pour l
g=18 → 19 · ID 417
<|im_start|>system You are a helpful AI assistant named SmolLM, trained by Hugging Face<|im_end|> <|im_start|>user Écris un message pour prévenir que je serai en retard.<|im_end|> <|im_start|>assistant Bonjour, je serai un peu en retard. Désolé pour l
1, 9690, 198, 2683, 359, 253, 5356, 5646, 11173, 3365, 3511, 308, 34519, 28, 7018, 411, 407, 19712, 8182, 2, 198, 1, 4093, 198, 39614, 83, 4593, 551, 3714, 18244, 694, 2756, 1241, 337, 10168, 16718, 1236, 2554, 430, 26278, 30, 2, 198, 1, 520, 9531, 198, 30904, 24583, 28, 16718, 1236, 2554, 551, 610, 101, 430, 26278, 30, 422, 2756, 4806, 2756, 18244, 303
Calculs du modèle enregistrés — pour le préfixe affiché · Préfixe du pas 18 · Vue réduite documentée
Représentation finale à la dernière position → logits → softmax du vocabulaire complet.
Probabilité ≠ vérité. Ces scores concernent la continuation du préfixe, pas la fiabilité d’une affirmation.
Maximum du modèle (argmax)
' · ID 23 · rank / rang 1Logit 26.58047103881836 · P 0.7939485998027865 · log(P) -0.2307365555952039
Le plus probable pour ce préfixe. Il ne décide pas du token ajouté dans notre exemple.
Choix imposé — non sélectionné par le modèle
âĢĻ · ID 417 · rank / rang 3Logit 23.28300666809082 · P 0.029357685023358417 · log(P) -3.528200926322743
Cible déjà comprise dans le top 8 ; sa probabilité n’est comptée qu’une fois.
Choix imposé — non sélectionné par le modèle ·âĢĻ · ID 417De la représentation aux probabilités
d0: 0.4742283821105957 d1: -2.9220564365386963 d2: 0.6760870814323425 d3: -2.3815877437591553 d4: -0.24279721081256864 d5: -2.092230319976806 d6: 0.22786517441272736 d7: -0.0019353069365024569
8 meilleurs candidats et cible imposée. Valeurs de la fixture affichées par le navigateur, notation scientifique si nécessaire ; aucune renormalisation. Logsumexp du vocabulaire complet: 26.811207594413563
'· ID 23 · rank / rang 1Logit 26.58047103881836 · P 0.7939485998027865 · log(P) -0.2307365555952039
ui· ID 9010 · rank / rang 2Logit 24.43160820007324 · P 0.09258766122297712 · log(P) -2.379599394340321
âĢĻ· ID 417 · rank / rang 3Logit 23.28300666809082 · P 0.029357685023358417 · log(P) -3.528200926322743
ancer· ID 5844 · rank / rang 4Logit 22.817401885986328 · P 0.018429443401637515 · log(P) -3.993805708427235
Ãł· ID 16739 · rank / rang 5Logit 22.7864990234375 · P 0.017868630832231037 · log(P) -4.024708570976063
ors· ID 579 · rank / rang 6Logit 22.267602920532227 · P 0.01063500166383099 · log(P) -4.543604673881337
u· ID 101 · rank / rang 7Logit 21.71937561035156 · P 0.006146748820241902 · log(P) -5.091831984062001
ider· ID 1310 · rank / rang 8Logit 21.69364547729492 · P 0.005990609511927778 · log(P) -5.117562117118641
Autres tokens : 0.02503561972100917 · 49144 candidats omis.
Ce sont les tokens qui ne sont ni dans le top 8 ni la cible imposée. La probabilité de la cible compte une seule fois, même lorsqu’elle figure dans les deux panneaux. other_probability = masse hors UNION(top8, cible).
Le maximum départage les égalités par ID croissant. Le script impose la cible, même si elle coïncide avec lui. Température 1, aucun filtre ni tirage.
La boucle ordinaire, différente de notre exemple
Dans une génération autorégressive ordinaire, une règle de décodage choisit le token suivant à partir des scores du contexte courant, étend ce contexte et recommence. Elle n’exige pas une réponse complète écrite à l’avance.
Bonjour, je serai un peu en retard. Désolé pour l’
g=19 → 20 · ID 2192
<|im_start|>system You are a helpful AI assistant named SmolLM, trained by Hugging Face<|im_end|> <|im_start|>user Écris un message pour prévenir que je serai en retard.<|im_end|> <|im_start|>assistant Bonjour, je serai un peu en retard. Désolé pour l’
1, 9690, 198, 2683, 359, 253, 5356, 5646, 11173, 3365, 3511, 308, 34519, 28, 7018, 411, 407, 19712, 8182, 2, 198, 1, 4093, 198, 39614, 83, 4593, 551, 3714, 18244, 694, 2756, 1241, 337, 10168, 16718, 1236, 2554, 430, 26278, 30, 2, 198, 1, 520, 9531, 198, 30904, 24583, 28, 16718, 1236, 2554, 551, 610, 101, 430, 26278, 30, 422, 2756, 4806, 2756, 18244, 303, 417
Calculs du modèle enregistrés — pour le préfixe affiché · Préfixe du pas 19 · Vue réduite documentée
Représentation finale à la dernière position → logits → softmax du vocabulaire complet.
Probabilité ≠ vérité. Ces scores concernent la continuation du préfixe, pas la fiabilité d’une affirmation.
Maximum du modèle (argmax)
é · ID 2756 · rank / rang 1Logit 28.10407257080078 · P 0.10216014153827954 · log(P) -2.281213681801887
Le plus probable pour ce préfixe. Il ne décide pas du token ajouté dans notre exemple.
Choix imposé — non sélectionné par le modèle
att · ID 2192 · rank / rang 44Logit 25.036632537841797 · P 0.004754547669920524 · log(P) -5.3486537147608715
Cible hors top 8 — non remontée dans le classement.
Choix imposé — non sélectionné par le modèle ·att · ID 2192De la représentation aux probabilités
d0: -1.3192960023880005 d1: -2.4273276329040527 d2: 0.876036524772644 d3: 0.2819659113883972 d4: 2.6876282691955566 d5: -1.2806217670440674 d6: -2.075014352798462 d7: -1.0896666049957275
8 meilleurs candidats et cible imposée. Valeurs de la fixture affichées par le navigateur, notation scientifique si nécessaire ; aucune renormalisation. Logsumexp du vocabulaire complet: 30.38528625260267
é· ID 2756 · rank / rang 1Logit 28.10407257080078 · P 0.10216014153827954 · log(P) -2.281213681801887
util· ID 13695 · rank / rang 2Logit 27.54944610595703 · P 0.058669214378683554 · log(P) -2.835840146645637
a· ID 81 · rank / rang 3Logit 27.354000091552734 · P 0.04825353637919209 · log(P) -3.031286161049934
ad· ID 344 · rank / rang 4Logit 27.0710391998291 · P 0.036361416500449315 · log(P) -3.314247052773567
on· ID 258 · rank / rang 5Logit 26.953777313232425 · P 0.03233810769523536 · log(P) -3.4315089393702465
en· ID 264 · rank / rang 6Logit 26.777305603027344 · P 0.027106529217641017 · log(P) -3.6079806495753246
ent· ID 293 · rank / rang 7Logit 26.704811096191406 · P 0.02521099282391334 · log(P) -3.680475156411262
expl· ID 13403 · rank / rang 8Logit 26.600879669189453 · P 0.022722342591747404 · log(P) -3.7844065834132152
Autres tokens : 0.642423171204938 · 49143 candidats omis.
Ce sont les tokens qui ne sont ni dans le top 8 ni la cible imposée. La probabilité de la cible compte une seule fois, même lorsqu’elle figure dans les deux panneaux. other_probability = masse hors UNION(top8, cible).
Le maximum départage les égalités par ID croissant. Le script impose la cible, même si elle coïncide avec lui. Température 1, aucun filtre ni tirage.
La boucle ordinaire, différente de notre exemple
Dans une génération autorégressive ordinaire, une règle de décodage choisit le token suivant à partir des scores du contexte courant, étend ce contexte et recommence. Elle n’exige pas une réponse complète écrite à l’avance.
Bonjour, je serai un peu en retard. Désolé pour l’att
g=20 → 21 · ID 25583
<|im_start|>system You are a helpful AI assistant named SmolLM, trained by Hugging Face<|im_end|> <|im_start|>user Écris un message pour prévenir que je serai en retard.<|im_end|> <|im_start|>assistant Bonjour, je serai un peu en retard. Désolé pour l’att
1, 9690, 198, 2683, 359, 253, 5356, 5646, 11173, 3365, 3511, 308, 34519, 28, 7018, 411, 407, 19712, 8182, 2, 198, 1, 4093, 198, 39614, 83, 4593, 551, 3714, 18244, 694, 2756, 1241, 337, 10168, 16718, 1236, 2554, 430, 26278, 30, 2, 198, 1, 520, 9531, 198, 30904, 24583, 28, 16718, 1236, 2554, 551, 610, 101, 430, 26278, 30, 422, 2756, 4806, 2756, 18244, 303, 417, 2192
Calculs du modèle enregistrés — pour le préfixe affiché · Préfixe du pas 20 · Vue réduite documentée
Représentation finale à la dernière position → logits → softmax du vocabulaire complet.
Probabilité ≠ vérité. Ces scores concernent la continuation du préfixe, pas la fiabilité d’une affirmation.
Maximum du modèle (argmax)
ente · ID 25583 · rank / rang 1Logit 28.93265724182129 · P 0.4297667642182811 · log(P) -0.8445126262460896
Le plus probable pour ce préfixe. Il ne décide pas du token ajouté dans notre exemple.
Choix imposé — non sélectionné par le modèle
ente · ID 25583 · rank / rang 1Logit 28.93265724182129 · P 0.4297667642182811 · log(P) -0.8445126262460896
Cible déjà comprise dans le top 8 ; sa probabilité n’est comptée qu’une fois.
Choix imposé — non sélectionné par le modèle ·ente · ID 25583De la représentation aux probabilités
d0: -0.0564066581428051 d1: -2.1269919872283936 d2: -3.0177788734436035 d3: -0.22479365766048431 d4: 1.206722617149353 d5: 0.46896734833717346 d6: 0.14685629308223724 d7: -0.3378193974494934
8 meilleurs candidats et cible imposée. Valeurs de la fixture affichées par le navigateur, notation scientifique si nécessaire ; aucune renormalisation. Logsumexp du vocabulaire complet: 29.77716986806738
ente· ID 25583 · rank / rang 1Logit 28.93265724182129 · P 0.4297667642182811 · log(P) -0.8445126262460896
end· ID 486 · rank / rang 2Logit 28.476776123046875 · P 0.27242450612080654 · log(P) -1.3003937450205036
a· ID 81 · rank / rang 3Logit 26.398128509521484 · P 0.034080109685808865 · log(P) -3.3790413585458943
én· ID 25288 · rank / rang 4Logit 26.361780166625977 · P 0.03286359721453363 · log(P) -3.415389701441402
aque· ID 21825 · rank / rang 5Logit 26.327831268310547 · P 0.03176663989478779 · log(P) -3.449338599756832
ache· ID 4390 · rank / rang 6Logit 25.780506134033203 · P 0.018376846777525376 · log(P) -3.996663734034175
ribution· ID 2865 · rank / rang 7Logit 25.647262573242188 · P 0.01608436985779338 · log(P) -4.129907294825191
raction· ID 4550 · rank / rang 8Logit 25.586322784423828 · P 0.015133460135450062 · log(P) -4.1908470836435505
Autres tokens : 0.14950370609501165 · 49144 candidats omis.
Ce sont les tokens qui ne sont ni dans le top 8 ni la cible imposée. La probabilité de la cible compte une seule fois, même lorsqu’elle figure dans les deux panneaux. other_probability = masse hors UNION(top8, cible).
Le maximum départage les égalités par ID croissant. Le script impose la cible, même si elle coïncide avec lui. Température 1, aucun filtre ni tirage.
La boucle ordinaire, différente de notre exemple
Dans une génération autorégressive ordinaire, une règle de décodage choisit le token suivant à partir des scores du contexte courant, étend ce contexte et recommence. Elle n’exige pas une réponse complète écrite à l’avance.
Bonjour, je serai un peu en retard. Désolé pour l’attente
g=21 → 22 · ID 5728
<|im_start|>system You are a helpful AI assistant named SmolLM, trained by Hugging Face<|im_end|> <|im_start|>user Écris un message pour prévenir que je serai en retard.<|im_end|> <|im_start|>assistant Bonjour, je serai un peu en retard. Désolé pour l’attente
1, 9690, 198, 2683, 359, 253, 5356, 5646, 11173, 3365, 3511, 308, 34519, 28, 7018, 411, 407, 19712, 8182, 2, 198, 1, 4093, 198, 39614, 83, 4593, 551, 3714, 18244, 694, 2756, 1241, 337, 10168, 16718, 1236, 2554, 430, 26278, 30, 2, 198, 1, 520, 9531, 198, 30904, 24583, 28, 16718, 1236, 2554, 551, 610, 101, 430, 26278, 30, 422, 2756, 4806, 2756, 18244, 303, 417, 2192, 25583
Calculs du modèle enregistrés — pour le préfixe affiché · Préfixe du pas 21 · Vue réduite documentée
Représentation finale à la dernière position → logits → softmax du vocabulaire complet.
Probabilité ≠ vérité. Ces scores concernent la continuation du préfixe, pas la fiabilité d’une affirmation.
Maximum du modèle (argmax)
Ġde · ID 367 · rank / rang 1Logit 19.76018524169922 · P 0.26358916583249925 · log(P) -1.333363577985626
Le plus probable pour ce préfixe. Il ne décide pas du token ajouté dans notre exemple.
Choix imposé — non sélectionné par le modèle
Ġ! · ID 5728 · rank / rang 34Logit 14.895868301391602 · P 0.002034143326918745 · log(P) -6.197680518293243
Cible hors top 8 — non remontée dans le classement.
Choix imposé — non sélectionné par le modèle ·Ġ! · ID 5728De la représentation aux probabilités
d0: -0.44645583629608154 d1: -1.9366849660873413 d2: 0.14388827979564667 d3: 1.7878212928771973 d4: 1.154832124710083 d5: -2.3193790912628174 d6: -1.7544182538986206 d7: 0.11435741931200027
8 meilleurs candidats et cible imposée. Valeurs de la fixture affichées par le navigateur, notation scientifique si nécessaire ; aucune renormalisation. Logsumexp du vocabulaire complet: 21.093548819684845
Ġde· ID 367 · rank / rang 1Logit 19.76018524169922 · P 0.26358916583249925 · log(P) -1.333363577985626
,· ID 28 · rank / rang 2Logit 19.417009353637695 · P 0.18702004674148187 · log(P) -1.676539466047149
.· ID 30 · rank / rang 3Logit 19.38578224182129 · P 0.18127019371315675 · log(P) -1.7077665778635556
Ġd· ID 287 · rank / rang 4Logit 17.877456665039062 · P 0.04011150192919608 · log(P) -3.216092154645782
ĠÃł· ID 25782 · rank / rang 5Logit 17.41886329650879 · P 0.02535737857686727 · log(P) -3.674685523176056
Ġpour· ID 18244 · rank / rang 6Logit 16.93649673461914 · P 0.015653635556170307 · log(P) -4.157052085065704
Ġet· ID 1482 · rank / rang 7Logit 16.91623878479004 · P 0.015339715417233493 · log(P) -4.177310034894806
Ġdes· ID 708 · rank / rang 8Logit 16.851329803466797 · P 0.014375656608655248 · log(P) -4.242219016218048
Autres tokens : 0.2552485622978202 · 49143 candidats omis.
Ce sont les tokens qui ne sont ni dans le top 8 ni la cible imposée. La probabilité de la cible compte une seule fois, même lorsqu’elle figure dans les deux panneaux. other_probability = masse hors UNION(top8, cible).
Le maximum départage les égalités par ID croissant. Le script impose la cible, même si elle coïncide avec lui. Température 1, aucun filtre ni tirage.
La boucle ordinaire, différente de notre exemple
Dans une génération autorégressive ordinaire, une règle de décodage choisit le token suivant à partir des scores du contexte courant, étend ce contexte et recommence. Elle n’exige pas une réponse complète écrite à l’avance.
Bonjour, je serai un peu en retard. Désolé pour l’attente !
Aucun cache KV dans cette capture ; la visite rejoue les préfixes, elle ne recalcule pas le modèle.
Calculs enregistrés pour les préfixes successifs ; tokens imposés par le script. Fin du chemin préparé — pas arrêt choisi par le modèle.
Approfondir
Dans une génération autorégressive ordinaire, une règle de décodage choisit le token suivant à partir des scores du contexte courant, étend ce contexte et recommence. Elle n’exige pas une réponse complète écrite à l’avance.
Le préfixe évalué contient l’entrée initiale et seulement les tokens déjà imposés. Aucun cache KV dans cette capture. La fin préparée n’est ni un EOS choisi ni une limite de longueur atteinte.
S09 · La réponse préparée revient à l’écran
Chaque morceau qui apparaît est-il un nouveau token du modèle ?
Réponse préparée — décodée depuis le chemin imposé. Le modèle n’a pas librement choisi ce texte ; le retour est mis en scène.
Générer des tokens, transporter des données et afficher du texte sont des étapes différentes. Leur rythme est simplifié dans cette démonstration.
- Vous, au même posteLe trajet revient au point de départ.
- ApplicationAffiche le texte décodé.
- Réponse préparéeÉcrite par notre équipe, pas choisie librement par le modèle.
Réponse préparée — décodée depuis le chemin imposé. Le modèle n’a pas librement choisi ce texte ; le retour est mis en scène.
Montrez-moi
Un morceau réseau, un token et un caractère visible sont-ils forcément la même chose ?
Réponse préparée — décodée depuis le chemin imposé. Le modèle n’a pas librement choisi ce texte ; le retour est mis en scène.
Fin du chemin préparé — pas arrêt choisi par le modèle: prepared_sequence_end · 22 tokens. Aucun EOS ajouté, aucune distribution terminale inventée.
IDs et décodage de sortie
30904, 24583, 28, 16718, 1236, 2554, 551, 610, 101, 430, 26278, 30, 422, 2756, 4806, 2756, 18244, 303, 417, 2192, 25583, 5728
Bonjour, je serai un peu en retard. Désolé pour l’attente !
Décodage : skip_special_tokens=false ; clean_up_tokenization_spaces=false. Aucun token spécial ajouté ni découpage réseau mesuré. Caractère ≠ token ≠ paquet.
Formatage et transport n’acheminent pas forcément un token à la fois. Un caractère visible peut nécessiter plusieurs tokens.
Approfondir
Les options exactes du décodeur, le traitement des tokens spéciaux et les normalisations relèvent du manifeste de capture. La vue lisible doit conserver l’accès aux IDs bruts et au texte décodé, y compris espaces et sauts de ligne.
Le retour vers l’écran n’est ni une capture réseau ni une mesure de latence. Il peut rejouer une sortie déjà complète ; il ne doit pas prétendre que le modèle calcule encore.
S10 · Expliquer le mécanisme et notre exception
Que ferait une génération ordinaire différemment de notre exemple rédigé ?
L’application prépare une entrée. Un modèle entraîné calcule des tokens suivants possibles ; une règle de décodage en choisit un, l’ajoute au contexte et recommence. L’application affiche le texte obtenu.
La démonstration de chemin imposé n’établit ni génération autonome ni vérité factuelle.
- L’application prépareMessage, enveloppe et tokens.
- Le modèle calculeReprésentations, puis scores conditionnels.
- L’application afficheIci, les tokens de la réponse écrite par notre équipe.
La démonstration de chemin imposé n’établit ni génération autonome ni vérité factuelle.
Montrez-moi
Que doit-il se passer avant de choisir le token suivant ?
Cinq distinctions à garder
- Serveur ≠ modèle
La machine héberge le logiciel qui exécute le calcul appris.
Revoir S02 - Tokenisation ≠ compréhension
Découper le texte et lui attribuer des IDs prépare le calcul ; cela ne prouve pas une compréhension.
Revoir S04 - Entraînement ≠ génération
L’apprentissage ajuste les paramètres avant la conversation. Ils restent fixes pendant cette réponse.
Revoir S03 - Probabilité ≠ vérité
Un score élevé pour une continuation ne vérifie pas les faits. Le maximum n’est pas une garantie.
Revoir S07 - Guidé ≠ autonome
Notre équipe a écrit la réponse et imposé ses tokens. Les calculs conditionnels capturés ne prouvent pas que le modèle aurait choisi ce texte.
Revoir S08
Le voyage ne valide aucune leçon à votre place. Continuez avec les six leçons existantes. Ouvrir les leçons
Expliquez à voix haute ou pour vous-même. Votre explication n’est ni collectée ni enregistrée.
Avant que le modèle traite la demande…
L’entrée est préparée maintenant ; les paramètres appris existent déjà. Revoir S02–S03.
Avant de sélectionner le token suivant…
Les scores concernent les suites sous ce contexte, pas la vérification des faits. Revoir S06–S07.
Dans une génération ordinaire, après le choix d’un token…
Le token rejoint le préfixe pour le calcul suivant. Dans notre exemple seulement, le script impose ce token. Revoir S08.
Quand la réponse apparaît…
L’affichage n’est pas un test de vérité et son rythme n’est pas le temps de génération. Revoir S09–S10.
Voir une explication de référence
Dans une génération autorégressive ordinaire, une règle de décodage choisit le token suivant à partir des scores du contexte courant, étend ce contexte et recommence. Elle n’exige pas une réponse complète écrite à l’avance. Calculs enregistrés pour les préfixes successifs ; tokens imposés par le script. Fin du chemin préparé — pas arrêt choisi par le modèle. La démonstration de chemin imposé n’établit ni génération autonome ni vérité factuelle.
La démonstration de chemin imposé n’établit ni génération autonome ni vérité factuelle.
Approfondir
Le modèle n’est pas l’assistant entier. Une application peut ajouter recherche, outils ou mémoire externe, avec leurs comportements et autorisations. Ne montrer ces capacités comme utilisées que si la trace les contient vraiment.
Les six leçons existantes et leurs laboratoires restent disponibles maintenant. Elles approfondissent génération, tokens, variation, hallucinations, contexte et systèmes ; leurs simulations préparées ne sont pas la trace capturée de ce modèle.
Voici la version de lecture complète. Les commandes interactives nécessitent JavaScript ; les explications et les sources, non.
Site existant · Explorer les six leçons
Explorer les six leçons
Provenance, sources et limites de cette capture
Introduction de la proposition éditoriale d’origine, désormais liée aux données vérifiées :
Notre équipe a rédigé la réponse de l’exemple pour garder un récit facile à suivre. Ce voyage proposé montrerait les calculs du modèle le long de ce chemin imposé, pas une réponse générée librement. Aucun modèle n’est appelé pendant une visite.
Dans une génération autorégressive ordinaire, une règle de décodage choisit le token suivant à partir des scores du contexte courant, étend ce contexte et recommence. Elle n’exige pas une réponse complète écrite à l’avance.
HuggingFaceTB/SmolLM2-135M-Instruct · 12fd25f77366fa6b3b4b768ec3050bf629380bac · Apache-2.0 · float32 · CPU · PyTorch 2.8.0+cpu · Transformers 4.57.6. Seed 0 de reproductibilité, pas de tirage. La capture n’est pas en direct.
SHA256 5af571cbf074e6d21a03528d2330792e532ca608f24ac70a143f6b369968ab8c
journey-guided-trace-v1 · late-authored-v1 · fr
Manifeste des traces · Modèle / tokenizer
Une tête et une couche du prompt initial, huit dimensions choisies ; aucun poids distribué. Les diagrammes et la caméra ne représentent pas des mesures de transport ou de latence.