Les mots, sans le brouillard

Glossaire

Une définition courte pour avancer, une précision pour aller plus loin. Le jargon doit simplement payer son loyer en explications.

Intelligence artificielle

Ensemble de techniques permettant à un système informatique d’effectuer des tâches de prédiction, de classification, de génération ou de décision.

Définition plus précise

Le terme recouvre des approches très différentes. Cette leçon se concentre sur des modèles dont les paramètres sont ajustés à partir de données.

Leçon associée: Comment un LLM génère-t-il une réponse ?

Tokenizer

Système qui transforme un texte en une séquence de tokens et d’identifiants, puis permet généralement l’opération inverse.

Définition plus précise

Le résultat dépend de l’algorithme, du vocabulaire, de la normalisation, des règles de prétraitement et de leur version. Deux tokenizers peuvent segmenter différemment le même texte.

Leçon associée: Qu’est-ce qu’un token ?

Vocabulaire

Liste finie des unités qu’un tokenizer sait associer directement à des identifiants.

Définition plus précise

Le vocabulaire peut mêler mots, sous-mots, signes, séquences d’octets et tokens spéciaux. Sa taille et sa construction influencent la segmentation.

Leçon associée: Qu’est-ce qu’un token ?

Identifiant de token

Nombre entier qui désigne une entrée précise du vocabulaire d’un tokenizer.

Définition plus précise

Un identifiant n’a de sens qu’avec le vocabulaire et la version concernés. Le même fragment peut recevoir un autre identifiant dans un autre système.

Leçon associée: Qu’est-ce qu’un token ?

Sous-mot

Fragment de texte réutilisable qui peut être combiné avec d’autres pour représenter des mots.

Définition plus précise

Les méthodes de sous-mots cherchent un compromis entre un vocabulaire fini et des séquences raisonnablement courtes. Leurs frontières ne correspondent pas nécessairement à des morphèmes linguistiques.

Leçon associée: Qu’est-ce qu’un token ?

Octet

Groupe de huit bits utilisé pour encoder des données numériques, notamment du texte en UTF-8.

Définition plus précise

Un caractère Unicode peut occuper plusieurs octets en UTF-8. Certains tokenizers disposent d’un repli sur les octets et certains modèles traitent directement des séquences d’octets.

Leçon associée: Qu’est-ce qu’un token ?

Normalisation

Transformation appliquée au texte pour rendre certaines représentations plus cohérentes avant ou pendant la tokenisation.

Définition plus précise

Elle peut concerner des variantes Unicode, la casse ou les espaces. Les règles varient et peuvent modifier les distinctions conservées par le système.

Leçon associée: Qu’est-ce qu’un token ?

Probabilité

Valeur comprise entre 0 et 1 utilisée ici pour pondérer un token candidat.

Définition plus précise

Cette valeur dépend du modèle, du contexte et des réglages de génération. Elle ne mesure pas directement la probabilité qu’une affirmation soit vraie.

Leçon associée: Comment un LLM génère-t-il une réponse ?

Distribution

Ensemble des probabilités attribuées aux différentes possibilités considérées.

Définition plus précise

Après normalisation, la somme des probabilités vaut 1. L’affichage en pourcentages peut présenter un petit écart à cause des arrondis.

Leçon associée: Comment un LLM génère-t-il une réponse ?

Déterminisme

Propriété d’un système qui produit le même résultat lorsque toutes les conditions pertinentes sont identiques.

Définition plus précise

Dans une chaîne d’inférence, cela peut nécessiter de contrôler le modèle, les entrées, le décodage, les générateurs pseudo-aléatoires, les bibliothèques, la précision, le matériel et le parallélisme.

Leçon associée: Pourquoi deux réponses peuvent-elles être différentes ?

Contexte

Ensemble des tokens dont le modèle peut tenir compte pour produire la suite.

Définition plus précise

Le contexte peut inclure des instructions, la demande de l’utilisateur, les tokens déjà générés et du contenu fourni par des outils. Sa taille est limitée par la fenêtre de contexte.

Leçon associée: Comment un LLM génère-t-il une réponse ?Leçon associée: Qu’est-ce qu’un token ?Leçon associée: Pourquoi deux réponses peuvent-elles être différentes ?Leçon associée: À quoi sert la fenêtre de contexte ?

Paramètre

Valeur numérique apprise pendant l’entraînement et utilisée dans les calculs du modèle.

Définition plus précise

Les paramètres du modèle sont à distinguer des paramètres de génération, ou réglages, tels que la température et top-p.

Leçon associée: Comment un LLM génère-t-il une réponse ?

Ancrage

Fait de relier une réponse à des données ou documents explicitement fournis.

Définition plus précise

L’ancrage rend les affirmations plus contrôlables, mais sa qualité dépend de la pertinence des sources et de leur interprétation.

Leçon associée: Pourquoi un LLM peut-il halluciner ?

Vérification factuelle

Examen d’une affirmation à partir de preuves indépendantes et consultables.

Définition plus précise

La vérification décompose la réponse en affirmations, recherche des sources adaptées et classe le soutien, la contradiction ou l’insuffisance des preuves.

Leçon associée: Pourquoi un LLM peut-il halluciner ?

Source primaire

Document ou donnée produit directement par l’acteur, l’expérience ou l’institution concernée.

Définition plus précise

Une source primaire peut être un texte officiel, un jeu de données, un article de recherche original ou un témoignage direct. Elle doit encore être authentifiée et contextualisée.

Leçon associée: Pourquoi un LLM peut-il halluciner ?

Incertitude

Part de ce qui n’est pas connu ou ne peut pas être conclu avec les preuves disponibles.

Définition plus précise

Exprimer l’incertitude consiste notamment à distinguer les faits établis, les hypothèses et les informations manquantes.

Leçon associée: Pourquoi un LLM peut-il halluciner ?

Citation

Référence permettant de retrouver la source associée à une affirmation.

Définition plus précise

Une citation utile doit être exacte, accessible et réellement soutenir le passage auquel elle est attachée.

Leçon associée: Pourquoi un LLM peut-il halluciner ?

Fenêtre de contexte

Limite de la séquence de tokens disponible pour une génération.

Définition plus précise

Elle peut couvrir les instructions, la demande, l’historique, les données d’outils et les tokens de sortie, selon les règles de l’application et du modèle.

Leçon associée: À quoi sert la fenêtre de contexte ?

Troncature

Suppression d’une partie d’une séquence pour respecter une limite de taille.

Définition plus précise

La politique peut retirer le début, la fin ou des blocs choisis. Elle risque d’éliminer une instruction ou une preuve importante.

Leçon associée: À quoi sert la fenêtre de contexte ?

Attention

Mécanisme qui calcule des relations pondérées entre des positions d’une séquence.

Définition plus précise

Dans un transformeur, plusieurs têtes d’attention produisent des représentations contextualisées ; l’attention n’équivaut pas à une conscience humaine.

Leçon associée: À quoi sert la fenêtre de contexte ?

Cache KV

Mémoire de calcul qui réutilise des clés et valeurs d’attention déjà produites pendant la génération.

Définition plus précise

Le cache KV accélère le décodage autorégressif, mais ne constitue ni un apprentissage durable ni une mémoire sémantique complète de l’utilisateur.

Leçon associée: À quoi sert la fenêtre de contexte ?

Agent

Système qui choisit des étapes et peut agir avec des outils pour poursuivre un objectif.

Définition plus précise

Les définitions varient. Cette leçon réserve le terme à une architecture comprenant une boucle d’action et d’observation, sans supposer une autonomie totale.

Leçon associée: Modèle, chatbot et agent : quelles différences ?

Boucle agentique

Cycle où le système choisit une action, observe son résultat puis décide de la suite.

Définition plus précise

La boucle doit posséder des limites de durée, de coût et d’actions, ainsi que des confirmations lorsque les conséquences sont importantes.

Leçon associée: Modèle, chatbot et agent : quelles différences ?