Le vocabulaire de l'IA circule surtout en anglais, et les traductions françaises sont soit inexistantes, soit trop formelles pour être utilisées à l'oral. Ce glossaire donne les deux : le terme anglais, le terme français, et la définition telle qu'elle sert quand on construit quelque chose.
Les définitions privilégient l'usage courant du métier plutôt que la terminologie officielle — on dit « prompt », pas « invite ». Chaque entrée pointe vers une source qui va plus loin : article fondateur, documentation de référence ou page encyclopédique.
Fondations 10
Le vocabulaire de l'apprentissage automatique, sous les modèles de langage.
Intelligence artificielle (IA)
Artificial intelligence (AI)
Terme parapluie pour les systèmes qui accomplissent des tâches qu'on associait au raisonnement humain. En pratique, quand quelqu'un dit « IA » aujourd'hui, il parle presque toujours d'apprentissage automatique appliqué à de grands modèles. Le mot est trop large pour être utile en conception : demande toujours de quel modèle et de quelle tâche on parle.
Apprentissage automatique
Machine learning
Aussi appelé machine learning
Approche où le comportement du programme est dérivé de données plutôt qu'écrit à la main. Tu ne codes pas les règles, tu fournis des exemples et un objectif à optimiser. Conséquence directe pour un développeur : le comportement n'est plus lisible dans le code source, il est encodé dans des paramètres numériques.
Apprentissage profond
Deep learning
Sous-ensemble de l'apprentissage automatique fondé sur des réseaux de neurones à plusieurs couches. La profondeur permet au modèle de construire ses propres représentations intermédiaires au lieu de dépendre de caractéristiques choisies par un humain. C'est ce qui a rendu possible le traitement du langage et de l'image à l'échelle actuelle.
Réseau de neurones
Neural network
Fonction mathématique composée de couches d'unités simples, chacune combinant ses entrées avec des poids puis appliquant une non-linéarité. Rien de biologique là-dedans malgré le nom : c'est de l'algèbre linéaire empilée. Sa force est de pouvoir approximer des fonctions très complexes si on lui donne assez de paramètres et de données.
Pour aller plus loin 3Blue1Brown — But what is a neural network?
Transformeur
Transformer
Aussi appelé transformer
Architecture de réseau de neurones publiée par Google en 2017, qui traite une séquence entière en parallèle grâce au mécanisme d'attention plutôt que mot par mot. C'est l'architecture derrière pratiquement tous les modèles de langage actuels. Le « T » de GPT.
Pour aller plus loin Vaswani et al. — Attention Is All You Need (arXiv)
Attention
Mécanisme par lequel le modèle pondère l'importance de chaque jeton du contexte quand il traite un jeton donné. C'est ce qui lui permet de relier un pronom à son antécédent trente lignes plus haut. Son coût croît avec le carré de la longueur du contexte — d'où le prix d'une fenêtre de contexte très grande.
Pour aller plus loin Jay Alammar — The Illustrated Transformer
Paramètre
Parameter
Valeur numérique apprise pendant l'entraînement. Le compte de paramètres (7 milliards, 70 milliards…) donne un ordre de grandeur de la capacité du modèle et de la mémoire nécessaire pour l'exécuter. Ce n'est pas une mesure de qualité : un petit modèle bien entraîné bat souvent un gros modèle mal entraîné.
Pour aller plus loin Google — Machine Learning Glossary: parameter
Poids
Weights
Les paramètres d'un réseau de neurones, vus comme le fichier qu'on télécharge et qu'on charge en mémoire. « Les poids d'un modèle » désigne concrètement ses connaissances : deux modèles de même architecture aux poids différents sont deux modèles différents. C'est aussi l'objet des débats sur l'ouverture — publier les poids, c'est publier le modèle.
Pour aller plus loin Google — Machine Learning Glossary: weight
Plongement vectoriel
Embedding
Aussi appelé embedding
Représentation d'un texte, d'une image ou d'un jeton sous forme de vecteur de nombres, construite de façon que la proximité géométrique traduise la proximité de sens. C'est la brique de base de la recherche sémantique et du RAG : on compare des vecteurs, pas des mots.
Pour aller plus loin Google — Embeddings (Machine Learning Crash Course)
Surapprentissage
Overfitting
Quand un modèle mémorise ses données d'entraînement au point de mal généraliser sur des données nouvelles. Excellents résultats à l'entraînement, mauvais en production. La version agentique du problème : un prompt réglé au millimètre sur tes vingt cas de test qui s'effondre sur le vingt et unième.
Pour aller plus loin Google — Machine Learning Glossary: overfitting
Modèles 9
Ce qu'on appelle « un modèle », et les familles qu'on distingue.
Modèle
Model
Un fichier de poids plus le code qui sait l'exécuter. Vu du développeur, c'est une fonction : tu donnes du texte, elle rend du texte, sans état entre deux appels. Tout ce qui ressemble à de la mémoire — historique de conversation, fichiers ouverts, résultats d'outils — est renvoyé au modèle à chaque appel par le code qui l'entoure.
Pour aller plus loin Wikipedia — Foundation model Sur ce site Que se passe-t-il, vraiment, quand vous parlez à une IA ?
LLM
Large language model (LLM)
Aussi appelé grand modèle de langage
Modèle entraîné sur d'immenses corpus de texte à prédire le prochain jeton. Tout le reste — répondre à une question, écrire du code, résumer — est une conséquence de cette seule tâche. Retenir ça évite beaucoup de mauvaises intuitions : le modèle ne cherche pas la vérité, il cherche la continuation plausible.
Pour aller plus loin Wikipedia — Large language model Sur ce site Que se passe-t-il, vraiment, quand vous parlez à une IA ?
Modèle de fondation
Foundation model
Modèle généraliste entraîné à grande échelle, destiné à être adapté à de nombreuses tâches en aval plutôt qu'à une seule. Le terme vient de Stanford en 2021 et insiste sur une propriété économique : l'entraînement coûte des dizaines de millions, l'adaptation coûte peu.
Pour aller plus loin Stanford CRFM — On the Opportunities and Risks of Foundation Models
Modèle frontière
Frontier model
Le modèle le plus capable disponible à un moment donné, généralement le plus gros et le plus cher de sa famille. Le terme sert autant en marketing qu'en politique publique, où il désigne les modèles assez puissants pour justifier une surveillance particulière. Techniquement, « frontière » est une position dans un classement, pas une propriété du modèle — et la position change tous les quelques mois.
Pour aller plus loin Anderljung et al. — Frontier AI Regulation (arXiv)
Modèle de raisonnement
Reasoning model
Modèle entraîné à produire une longue chaîne de réflexion interne avant sa réponse finale, et à dépenser plus de calcul à l'inférence quand le problème est dur. Meilleur sur les maths, le code et la planification ; plus lent et plus cher. À réserver aux tâches où le raisonnement est le goulot, pas à la reformulation d'un courriel.
Modèle multimodal
Multimodal model
Modèle qui accepte ou produit plusieurs types de données — texte, image, audio, vidéo — dans un même espace de représentation. En pratique agentique, c'est ce qui permet à un agent de lire une capture d'écran, un diagramme ou un PDF scanné au lieu d'exiger du texte propre.
Modèle à poids ouverts
Open-weights model
Modèle dont les poids sont publiés et exécutables sur ton infrastructure. Ce n'est pas la même chose qu'« open source » : les données d'entraînement et le code d'entraînement restent souvent fermés, et la licence peut restreindre les usages. L'intérêt pratique : contrôle des données, coût prévisible, pas de dépendance à une API.
Distillation
Entraîner un petit modèle à imiter les sorties d'un gros. On échange un peu de capacité contre beaucoup de vitesse et de coût. C'est l'origine de la plupart des petits modèles rapides que tu utilises pour du classement ou du routage.
Pour aller plus loin Hinton et al. — Distilling the Knowledge in a Neural Network (arXiv)
Quantification
Quantization
Aussi appelé quantization
Réduire la précision numérique des poids — de 16 bits à 8 ou 4 — pour faire tenir un modèle sur du matériel plus modeste. La qualité baisse un peu, la mémoire baisse beaucoup. C'est ce qui rend possible d'exécuter un modèle sérieux sur un portable.
Entraînement 7
Comment un modèle acquiert — et perd — ses capacités.
Préentraînement
Pre-training
La phase longue et coûteuse où le modèle apprend le langage en prédisant le prochain jeton sur des téraoctets de texte. Elle produit un modèle qui sait continuer un texte mais pas encore suivre une consigne — c'est le travail des phases suivantes.
Pour aller plus loin Brown et al. — Language Models are Few-Shot Learners (arXiv)
Fine-tuning
Aussi appelé réglage fin, ajustement
Poursuivre l'entraînement d'un modèle existant sur un jeu de données spécifique pour lui donner un comportement, un format ou un ton particulier. Utile pour la forme, rarement pour les faits : si l'information change, la mettre dans le contexte via du RAG est presque toujours le bon réflexe.
Pour aller plus loin Wikipedia — Fine-tuning (deep learning) Sur ce site Fine-tuning vs RAG : quand enseigner au modèle et quand lui montrer la réponse
LoRA
LoRA (low-rank adaptation)
Technique de fine-tuning qui gèle les poids d'origine et n'entraîne qu'un petit ensemble de matrices additionnelles. On passe de milliards de paramètres à ajuster à quelques millions : entraînement possible sur un seul GPU, et plusieurs adaptations échangeables sur un même modèle de base.
RLHF
RLHF (reinforcement learning from human feedback)
Aussi appelé apprentissage par renforcement à partir de rétroaction humaine
Phase où des humains classent des réponses du modèle, un modèle de récompense apprend leurs préférences, puis le modèle est optimisé contre cette récompense. C'est ce qui transforme un moteur de complétion en assistant utile — et aussi ce qui explique sa tendance à te donner raison.
Pour aller plus loin Ouyang et al. — Training language models to follow instructions (arXiv)
Alignement
Alignment
L'ensemble des techniques visant à faire correspondre le comportement du modèle aux intentions et aux valeurs de ceux qui le déploient. Concrètement, c'est ce qui produit les refus, les mises en garde et les limites de comportement. Un modèle aligné n'est pas un modèle sûr : c'est un modèle dont les défaillances sont plus prévisibles.
Données d'entraînement
Training data
Le corpus dont le modèle tire tout ce qu'il sait. Sa composition explique les biais, les lacunes et les forces observées à l'usage — un modèle nourri surtout de code Python sera meilleur en Python. C'est aussi le point de contact avec le droit d'auteur et la vie privée.
Pour aller plus loin Gebru et al. — Datasheets for Datasets (arXiv)
Date de coupure des connaissances
Knowledge cutoff
La date après laquelle le modèle n'a rien vu. Tout ce qui est plus récent — une version de bibliothèque, une API, une actualité — doit lui être fourni dans le contexte. Un modèle interrogé sur l'après-coupure ne dit pas « je ne sais pas » : il invente quelque chose de plausible.
Pour aller plus loin Cheng et al. — Dated Data: Tracing Knowledge Cutoffs (arXiv)
Jetons et contexte 9
L'unité de facturation, l'unité de mémoire, et la contrainte qui gouverne tout le reste.
Jeton
Token
Aussi appelé token
L'unité que le modèle lit et écrit : un fragment de mot, pas un caractère ni un mot entier. En anglais, environ quatre caractères par jeton ; en français, un peu moins à cause des accents et des mots plus longs. C'est l'unité de facturation, l'unité de la fenêtre de contexte et l'unité de la latence — donc l'unité qui compte.
Pour aller plus loin Hugging Face — Summary of the tokenizers
Tokenisation
Tokenization
Aussi appelé segmentation en jetons
L'étape qui découpe ton texte en jetons avant que le modèle le voie. C'est pour ça qu'un modèle compte mal les lettres d'un mot : il ne voit pas les lettres. La plupart des comportements étranges sur les chiffres, les URL ou les caractères rares viennent de là.
Pour aller plus loin Sennrich et al. — Subword Units / BPE (arXiv)
Fenêtre de contexte
Context window
Le nombre maximal de jetons que le modèle peut prendre en compte en un seul appel : consigne système, historique, documents, résultats d'outils et réponse en cours, tout compris. C'est un budget, pas un espace de rangement. Et l'attention n'y est pas uniforme : ce qui se trouve au milieu d'un très long contexte est moins bien exploité que ce qui se trouve au début ou à la fin.
Pour aller plus loin Liu et al. — Lost in the Middle (arXiv) Sur ce site Le contexte est fini. Programmons en conséquence.
Compaction
Remplacer un historique de conversation devenu trop long par un résumé, pour continuer à travailler sans dépasser la fenêtre. Opération à perte : ce qui n'est pas dans le résumé disparaît. Sur une longue session agentique, c'est souvent le moment où l'agent « oublie » une contrainte donnée au début.
Pour aller plus loin Anthropic — Effective context engineering for AI agents Sur ce site Le contexte est fini. Programmons en conséquence.
Mise en cache de prompt
Prompt caching
Réutiliser le calcul déjà fait sur un préfixe de contexte identique d'un appel à l'autre, au lieu de le refaire. Coût et latence baissent fortement sur les préfixes stables. La conséquence pratique : mets ce qui ne change pas — consignes, documentation, schémas — au début du prompt, et ce qui varie à la fin.
Inférence
Inference
L'exécution du modèle sur une entrée pour produire une sortie — par opposition à l'entraînement, qui modifie les poids. Chaque appel d'API est une inférence. C'est là que se paient la latence, le coût et l'empreinte énergétique de ton application au quotidien.
Pour aller plus loin Google — Machine Learning Glossary: inference
Température
Temperature
Paramètre qui règle le degré d'aléatoire du tirage du prochain jeton. Proche de zéro, le modèle prend systématiquement le jeton le plus probable — sorties stables, plus répétitives. Plus haut, il explore — plus varié, moins fiable. Pour de l'extraction ou du code, garde-la basse.
Échantillonnage
Sampling (top-p, top-k)
La stratégie de sélection du prochain jeton parmi les candidats probables. Top-k limite le tirage aux k meilleurs, top-p (nucleus) aux candidats couvrant p % de la masse de probabilité. Avec la température, ce sont les trois molettes qui décident si ton système est ennuyeux ou imprévisible.
Pour aller plus loin Holtzman et al. — The Curious Case of Neural Text Degeneration (arXiv)
Streaming
Aussi appelé diffusion en continu
Renvoyer la réponse jeton par jeton au fur et à mesure de sa génération plutôt qu'en un bloc final. Le temps total ne change pas ; le temps avant le premier caractère visible, oui. C'est une décision d'expérience utilisateur avant d'être une décision d'infrastructure.
Prompting 6
Ce qu'on écrit au modèle, et comment on l'écrit.
Prompt
Aussi appelé invite
Le texte envoyé au modèle pour obtenir un comportement. Dans un système agentique, ce n'est pas une question posée à la volée : c'est un artefact versionné, testé et révisé comme du code, parce que c'est lui qui détermine le comportement du système.
Prompt système
System prompt
Les consignes placées en tête du contexte, qui définissent le rôle, les contraintes et le format attendus pour toute la conversation. Le modèle leur accorde plus de poids qu'aux messages ordinaires, mais ce n'est pas une frontière de sécurité : du contenu hostile dans le contexte peut les contredire.
Prompt engineering
Aussi appelé ingénierie de prompt
La pratique consistant à structurer l'entrée pour obtenir un comportement fiable : rôle, exemples, format de sortie, contraintes explicites, et surtout ce qu'il ne faut pas faire. Moins de la magie que de la spécification — la plupart des mauvais résultats viennent d'une consigne ambiguë, pas d'un modèle faible.
Pour aller plus loin DAIR.AI — Prompt Engineering Guide Sur ce site Ingénierie de prompts avancée : au-delà des bases
Zero-shot / few-shot
Aussi appelé sans exemple / à quelques exemples
Demander une tâche sans aucun exemple (zero-shot) ou avec quelques exemples placés dans le prompt (few-shot). Les exemples valent souvent mieux qu'un long paragraphe d'explication, surtout pour imposer un format de sortie. Attention : ce n'est pas du fine-tuning, rien n'est appris — les exemples repartent avec chaque appel.
Pour aller plus loin Brown et al. — Language Models are Few-Shot Learners (arXiv)
Chaîne de pensée
Chain of thought
Amener le modèle à écrire son raisonnement étape par étape avant sa conclusion. Ça améliore les tâches à plusieurs étapes, et ça donne surtout une trace lisible : quand la réponse est fausse, tu vois où le raisonnement a dévié. Le raisonnement affiché reste une production du modèle, pas une explication fidèle de son calcul.
Pour aller plus loin Wei et al. — Chain-of-Thought Prompting (arXiv)
Raisonnement étendu
Extended thinking
Mode où le modèle dispose d'un budget de jetons dédié à réfléchir avant de répondre. Différent du chain-of-thought demandé dans le prompt : ici, le budget est un paramètre d'appel, et les jetons de réflexion sont facturés. Utile quand la qualité de la décision prime sur la latence.
Agents et harnais 14
Ce qui transforme un modèle qui répond en système qui agit.
Agent
Système où un modèle décide lui-même des actions à enchaîner pour atteindre un but, en s'appuyant sur des outils et sur le résultat de ses actions précédentes. La distinction utile n'est pas « agent ou pas » mais « qui décide de la prochaine étape » : si c'est ton code, c'est un pipeline ; si c'est le modèle, c'est un agent.
Agentique
Agentic
Qualifie un système dont le déroulement n'est pas fixé à l'avance mais décidé par un modèle à l'exécution. Le mot désigne un curseur plutôt qu'une catégorie : plus le système choisit ses propres étapes, plus il est agentique — et plus il demande des garde-fous et de l'observabilité.
Harnais
Harness
Tout le code autour du modèle : la boucle d'appel, la gestion du contexte, les outils exposés, les permissions, les tentatives de reprise et les journaux. Le modèle est interchangeable, le harnais est ton produit. C'est là que se joue la différence entre deux assistants qui utilisent pourtant le même modèle.
Pour aller plus loin Anthropic — Building agents with the Claude Agent SDK
Boucle d'agent
Agent loop
Le cycle fondamental : le modèle observe le contexte, choisit une action, le harnais l'exécute, le résultat retourne dans le contexte, et on recommence jusqu'à une condition d'arrêt. Toute la fiabilité d'un agent tient à cette condition d'arrêt et à ce qu'on remet dans le contexte à chaque tour.
Outil
Tool
Fonction que le modèle peut demander d'exécuter — lire un fichier, interroger une base, appeler une API. Sa description est un prompt : un nom précis et une documentation claire améliorent le comportement de l'agent plus sûrement qu'un modèle plus gros.
Appel d'outil
Tool call (function calling)
La sortie structurée par laquelle le modèle demande l'exécution d'un outil avec ses arguments. Le modèle n'exécute rien lui-même : il produit une intention, ton code décide de l'honorer ou non. C'est précisément là que se place le contrôle des permissions.
Skill
Ensemble d'instructions, de scripts et de ressources qu'un agent charge à la demande quand une tâche le nécessite. L'idée est de garder le contexte léger par défaut : au lieu de tout mettre dans le prompt système, on décrit la compétence en une ligne et on ne charge le détail qu'au moment utile.
MCP
MCP (Model Context Protocol)
Protocole ouvert qui standardise la façon dont un agent se connecte à des sources de données et à des outils externes. L'intérêt est le même que pour LSP chez les éditeurs : un serveur MCP écrit une fois est utilisable par tous les clients compatibles, au lieu d'une intégration par produit.
Sous-agent
Subagent
Agent lancé par un autre agent avec une tâche délimitée et son propre contexte. L'avantage principal n'est pas le parallélisme mais l'isolation du contexte : le sous-agent explore, rapporte une conclusion, et le bruit de son exploration ne pollue pas le contexte principal.
Pour aller plus loin Anthropic — How we built our multi-agent research system Sur ce site Architectures multi-agent : quand un seul agent ne suffit pas
Orchestration
La coordination de plusieurs modèles, outils ou agents : qui fait quoi, dans quel ordre, avec quel budget, et que faire en cas d'échec. C'est de la tuyauterie ordinaire — file d'attente, reprise, idempotence — et elle mérite d'être traitée comme telle plutôt que confiée à un modèle.
Pour aller plus loin Anthropic — Building effective agents Sur ce site Architectures multi-agent : quand un seul agent ne suffit pas
Humain dans la boucle
Human in the loop
Point d'arrêt où une personne valide avant qu'une action se produise. À placer là où l'action est difficile à annuler — envoyer un courriel, supprimer des données, pousser en production — et nulle part ailleurs, sinon la validation devient un réflexe et ne protège plus de rien.
Garde-fous
Guardrails
Contrôles déterministes placés autour du modèle : validation de schéma, listes d'autorisation, plafonds de dépense, filtres de sortie. Un garde-fou implémenté par une consigne dans le prompt n'en est pas un — il doit vivre dans du code que le modèle ne peut pas contourner.
Bac à sable
Sandbox
Environnement isolé où l'agent exécute du code et des commandes sans pouvoir atteindre le reste du système. Système de fichiers restreint, réseau contrôlé, jetons limités. C'est la seule protection qui tienne quand l'agent exécute du code qu'il vient d'écrire.
Pour aller plus loin Wikipedia — Sandbox (computer security)
Mémoire
Memory
Tout mécanisme qui fait persister de l'information entre deux appels au modèle, qui lui n'en garde aucune. Fichiers, base de données, résumés de session, notes structurées : c'est toujours du stockage plus une décision de relecture. Un agent n'a de mémoire que celle que tu lui construis.
Récupération et mémoire 6
Donner au modèle accès à des connaissances qu'il n'a pas apprises.
RAG
RAG (retrieval-augmented generation)
Aussi appelé génération augmentée par récupération
Récupérer les documents pertinents à la question, puis les placer dans le contexte avant de demander la réponse. C'est la solution par défaut quand l'information change, est privée ou doit être citée. La qualité d'un système RAG se joue presque entièrement dans l'étape de récupération, pas dans le modèle.
Pour aller plus loin Lewis et al. — Retrieval-Augmented Generation (arXiv) Sur ce site RAG : ce que c'est et comment l'utiliser concrètement
Base de données vectorielle
Vector database
Base spécialisée dans le stockage d'embeddings et la recherche des plus proches voisins. Utile à grande échelle ; souvent superflue en dessous de quelques dizaines de milliers de documents, où un index classique — ou une simple recherche plein texte — suffit et coûte moins cher.
Découpage
Chunking
Aussi appelé chunking
Couper les documents en fragments avant de les indexer. La taille et les frontières des fragments décident de ce que la recherche pourra retrouver : un fragment qui coupe un tableau en deux rend ce tableau inutilisable. C'est le réglage le plus rentable d'un système RAG.
Pour aller plus loin Pinecone — Chunking strategies Sur ce site RAG : ce que c'est et comment l'utiliser concrètement
Recherche sémantique
Semantic search
Rechercher par proximité de sens dans l'espace des embeddings plutôt que par correspondance de mots-clés. Elle retrouve un document qui n'emploie aucun des mots de la question — et rate parfois une correspondance exacte évidente. En pratique, on la combine avec une recherche lexicale.
Reclassement
Reranking
Deuxième passe qui réordonne les candidats retournés par la recherche à l'aide d'un modèle plus précis mais plus coûteux. On récupère large, on reclasse serré, on ne garde que le haut du panier dans le contexte. Souvent le meilleur rapport qualité-effort pour améliorer un RAG existant.
Pour aller plus loin Nogueira & Cho — Passage Re-ranking with BERT (arXiv)
Ancrage
Grounding
Contraindre la réponse à s'appuyer sur des sources fournies, et rendre cet appui vérifiable par des citations. Un système bien ancré doit pouvoir répondre « ce n'est pas dans les documents » — sans cette porte de sortie, il comblera le vide en inventant.
Pour aller plus loin Rashkin et al. — Measuring Attribution in NLG (arXiv)
Évaluation et fiabilité 10
Comment savoir si ça marche, et comment ça casse.
Éval
Eval
Aussi appelé évaluation
Jeu de cas de test conçu pour un système dont les sorties n'ont pas de bonne réponse unique. C'est l'équivalent de la suite de tests en développement classique : sans elle, tu n'as aucun moyen de savoir si ton changement de prompt améliore les choses ou en casse trois autres.
Pour aller plus loin Stanford CRFM — HELM (Holistic Evaluation of Language Models) Sur ce site Évaluations : comment tester des systèmes qui n'ont pas de bonnes réponses
Banc d'essai
Benchmark
Aussi appelé benchmark
Jeu de tâches standardisé servant à comparer des modèles entre eux. Utile pour dégrossir un choix, insuffisant pour décider : un modèle qui domine un classement public peut être médiocre sur ton domaine, et la contamination des données de test est un problème réel.
Hallucination
Sortie fluide, confiante et fausse. Ce n'est pas un bogue qu'on corrige mais une propriété du procédé : le modèle produit la continuation la plus plausible, et le plausible n'est pas le vrai. On ne l'élimine pas, on la contient — ancrage, citations, vérification automatique.
Pour aller plus loin Ji et al. — Survey of Hallucination in NLG (arXiv)
LLM juge
LLM-as-judge
Utiliser un modèle pour noter les sorties d'un autre selon une grille. C'est ce qui rend l'évaluation possible à grande échelle sur des tâches subjectives. Le juge a ses propres biais — position, longueur, style — qu'il faut mesurer contre un échantillon noté par des humains.
Pour aller plus loin Zheng et al. — Judging LLM-as-a-Judge (arXiv) Sur ce site Évaluations : comment tester des systèmes qui n'ont pas de bonnes réponses
Jeu de référence
Golden dataset
Ensemble d'exemples dont la sortie attendue a été validée par des humains, et qui sert d'étalon à toutes les évaluations suivantes. Le construire est fastidieux et c'est le meilleur investissement d'un projet IA : c'est lui qui transforme « on dirait que c'est mieux » en mesure.
Déterminisme
Determinism
Propriété d'un système qui rend la même sortie pour la même entrée. Un appel de modèle ne l'est pas par défaut, et même à température nulle des variations subsistent. C'est une décision d'architecture : ce qui doit être reproductible — validation, calculs, effets de bord — appartient à ton code, pas au modèle.
Observabilité
Observability
La capacité de reconstituer après coup ce qu'un système a fait et pourquoi. Pour un agent, ça veut dire tracer chaque appel : prompt complet, outils appelés, arguments, résultats, jetons consommés. Sans cette trace, déboguer un comportement non reproductible est impossible.
Injection de prompt
Prompt injection
Attaque où du contenu traité par l'agent — page web, courriel, ticket, fichier — contient des instructions que le modèle suit comme si elles venaient de toi. Le modèle ne distingue pas les données des consignes. C'est la vulnérabilité structurelle des systèmes agentiques : tout contenu externe est une entrée non fiable.
Jailbreak
Aussi appelé contournement
Formulation conçue pour faire sortir un modèle des limites fixées par son alignement. Différent de l'injection de prompt : ici c'est l'utilisateur qui attaque le modèle, pas un tiers qui détourne l'agent. Les deux se traitent au même endroit — dans le code autour, pas dans le prompt.
Pour aller plus loin Zou et al. — Universal and Transferable Adversarial Attacks (arXiv)
Dérive
Drift
Dégradation progressive des performances quand les données réelles s'éloignent de celles sur lesquelles le système a été réglé — ou quand le fournisseur met le modèle à jour sous toi. Un prompt qui marchait il y a six mois peut ne plus marcher aujourd'hui sans qu'une seule ligne de ton code ait changé.
Exploitation 4
Les contraintes qui décident si un prototype devient un produit.
Latence / TTFT
Latency / TTFT
Le délai entre la requête et la réponse. Pour un modèle, deux mesures comptent : le temps avant le premier jeton (TTFT), qui gouverne la perception de rapidité, et le débit de génération ensuite. Un agent qui enchaîne dix appels multiplie ce délai par dix — la latence est une contrainte d'architecture, pas un détail d'infrastructure.
Débit
Throughput
Le volume traité par unité de temps — jetons par seconde, requêtes par minute. Il s'oppose souvent à la latence : traiter par lots améliore le débit et dégrade le temps de réponse individuel. Choisis lequel tu optimises avant de dimensionner quoi que ce soit.
Limite de débit
Rate limit
Plafond imposé par le fournisseur sur le nombre de requêtes ou de jetons par intervalle. Un agent qui boucle les atteint plus vite qu'une application classique. À traiter comme un mode de fonctionnement normal — attente exponentielle, file, dégradation gracieuse — et non comme une erreur exceptionnelle.
Coût par jeton
Cost per token
Le prix facturé, distinct en entrée et en sortie, généralement par million de jetons. Un agent qui relit tout son historique à chaque tour a un coût quadratique en nombre de tours. Le coût est un paramètre de conception au même titre que la latence : il se calcule avant d'écrire la boucle, pas après la première facture.
Aucun terme ne correspond.