Le vocabulaire de l'IA circule surtout en anglais, et les traductions françaises sont soit inexistantes, soit trop formelles pour être utilisées à l'oral. Ce glossaire donne les deux : le terme anglais, le terme français, et la définition telle qu'elle sert quand on construit quelque chose.

Les définitions privilégient l'usage courant du métier plutôt que la terminologie officielle — on dit « prompt », pas « invite ». Chaque entrée pointe vers une source qui va plus loin : article fondateur, documentation de référence ou page encyclopédique.

Fondations 10

Le vocabulaire de l'apprentissage automatique, sous les modèles de langage.

Intelligence artificielle (IA)

Artificial intelligence (AI)

Terme parapluie pour les systèmes qui accomplissent des tâches qu'on associait au raisonnement humain. En pratique, quand quelqu'un dit « IA » aujourd'hui, il parle presque toujours d'apprentissage automatique appliqué à de grands modèles. Le mot est trop large pour être utile en conception : demande toujours de quel modèle et de quelle tâche on parle.

Apprentissage automatique

Machine learning

Aussi appelé machine learning

Approche où le comportement du programme est dérivé de données plutôt qu'écrit à la main. Tu ne codes pas les règles, tu fournis des exemples et un objectif à optimiser. Conséquence directe pour un développeur : le comportement n'est plus lisible dans le code source, il est encodé dans des paramètres numériques.

Apprentissage profond

Deep learning

Sous-ensemble de l'apprentissage automatique fondé sur des réseaux de neurones à plusieurs couches. La profondeur permet au modèle de construire ses propres représentations intermédiaires au lieu de dépendre de caractéristiques choisies par un humain. C'est ce qui a rendu possible le traitement du langage et de l'image à l'échelle actuelle.

Réseau de neurones

Neural network

Fonction mathématique composée de couches d'unités simples, chacune combinant ses entrées avec des poids puis appliquant une non-linéarité. Rien de biologique là-dedans malgré le nom : c'est de l'algèbre linéaire empilée. Sa force est de pouvoir approximer des fonctions très complexes si on lui donne assez de paramètres et de données.

Attention

Mécanisme par lequel le modèle pondère l'importance de chaque jeton du contexte quand il traite un jeton donné. C'est ce qui lui permet de relier un pronom à son antécédent trente lignes plus haut. Son coût croît avec le carré de la longueur du contexte — d'où le prix d'une fenêtre de contexte très grande.

Paramètre

Parameter

Valeur numérique apprise pendant l'entraînement. Le compte de paramètres (7 milliards, 70 milliards…) donne un ordre de grandeur de la capacité du modèle et de la mémoire nécessaire pour l'exécuter. Ce n'est pas une mesure de qualité : un petit modèle bien entraîné bat souvent un gros modèle mal entraîné.

Poids

Weights

Les paramètres d'un réseau de neurones, vus comme le fichier qu'on télécharge et qu'on charge en mémoire. « Les poids d'un modèle » désigne concrètement ses connaissances : deux modèles de même architecture aux poids différents sont deux modèles différents. C'est aussi l'objet des débats sur l'ouverture — publier les poids, c'est publier le modèle.

Modèles 9

Ce qu'on appelle « un modèle », et les familles qu'on distingue.

LLM

Large language model (LLM)

Aussi appelé grand modèle de langage

Modèle entraîné sur d'immenses corpus de texte à prédire le prochain jeton. Tout le reste — répondre à une question, écrire du code, résumer — est une conséquence de cette seule tâche. Retenir ça évite beaucoup de mauvaises intuitions : le modèle ne cherche pas la vérité, il cherche la continuation plausible.

Modèle frontière

Frontier model

Le modèle le plus capable disponible à un moment donné, généralement le plus gros et le plus cher de sa famille. Le terme sert autant en marketing qu'en politique publique, où il désigne les modèles assez puissants pour justifier une surveillance particulière. Techniquement, « frontière » est une position dans un classement, pas une propriété du modèle — et la position change tous les quelques mois.

Modèle de raisonnement

Reasoning model

Modèle entraîné à produire une longue chaîne de réflexion interne avant sa réponse finale, et à dépenser plus de calcul à l'inférence quand le problème est dur. Meilleur sur les maths, le code et la planification ; plus lent et plus cher. À réserver aux tâches où le raisonnement est le goulot, pas à la reformulation d'un courriel.

Modèle multimodal

Multimodal model

Modèle qui accepte ou produit plusieurs types de données — texte, image, audio, vidéo — dans un même espace de représentation. En pratique agentique, c'est ce qui permet à un agent de lire une capture d'écran, un diagramme ou un PDF scanné au lieu d'exiger du texte propre.

Modèle à poids ouverts

Open-weights model

Modèle dont les poids sont publiés et exécutables sur ton infrastructure. Ce n'est pas la même chose qu'« open source » : les données d'entraînement et le code d'entraînement restent souvent fermés, et la licence peut restreindre les usages. L'intérêt pratique : contrôle des données, coût prévisible, pas de dépendance à une API.

Quantification

Quantization

Aussi appelé quantization

Réduire la précision numérique des poids — de 16 bits à 8 ou 4 — pour faire tenir un modèle sur du matériel plus modeste. La qualité baisse un peu, la mémoire baisse beaucoup. C'est ce qui rend possible d'exécuter un modèle sérieux sur un portable.

Entraînement 7

Comment un modèle acquiert — et perd — ses capacités.

Fine-tuning

Aussi appelé réglage fin, ajustement

Poursuivre l'entraînement d'un modèle existant sur un jeu de données spécifique pour lui donner un comportement, un format ou un ton particulier. Utile pour la forme, rarement pour les faits : si l'information change, la mettre dans le contexte via du RAG est presque toujours le bon réflexe.

LoRA

LoRA (low-rank adaptation)

Technique de fine-tuning qui gèle les poids d'origine et n'entraîne qu'un petit ensemble de matrices additionnelles. On passe de milliards de paramètres à ajuster à quelques millions : entraînement possible sur un seul GPU, et plusieurs adaptations échangeables sur un même modèle de base.

RLHF

RLHF (reinforcement learning from human feedback)

Aussi appelé apprentissage par renforcement à partir de rétroaction humaine

Phase où des humains classent des réponses du modèle, un modèle de récompense apprend leurs préférences, puis le modèle est optimisé contre cette récompense. C'est ce qui transforme un moteur de complétion en assistant utile — et aussi ce qui explique sa tendance à te donner raison.

Alignement

Alignment

L'ensemble des techniques visant à faire correspondre le comportement du modèle aux intentions et aux valeurs de ceux qui le déploient. Concrètement, c'est ce qui produit les refus, les mises en garde et les limites de comportement. Un modèle aligné n'est pas un modèle sûr : c'est un modèle dont les défaillances sont plus prévisibles.

Jetons et contexte 9

L'unité de facturation, l'unité de mémoire, et la contrainte qui gouverne tout le reste.

Jeton

Token

Aussi appelé token

L'unité que le modèle lit et écrit : un fragment de mot, pas un caractère ni un mot entier. En anglais, environ quatre caractères par jeton ; en français, un peu moins à cause des accents et des mots plus longs. C'est l'unité de facturation, l'unité de la fenêtre de contexte et l'unité de la latence — donc l'unité qui compte.

Fenêtre de contexte

Context window

Le nombre maximal de jetons que le modèle peut prendre en compte en un seul appel : consigne système, historique, documents, résultats d'outils et réponse en cours, tout compris. C'est un budget, pas un espace de rangement. Et l'attention n'y est pas uniforme : ce qui se trouve au milieu d'un très long contexte est moins bien exploité que ce qui se trouve au début ou à la fin.

Mise en cache de prompt

Prompt caching

Réutiliser le calcul déjà fait sur un préfixe de contexte identique d'un appel à l'autre, au lieu de le refaire. Coût et latence baissent fortement sur les préfixes stables. La conséquence pratique : mets ce qui ne change pas — consignes, documentation, schémas — au début du prompt, et ce qui varie à la fin.

Température

Temperature

Paramètre qui règle le degré d'aléatoire du tirage du prochain jeton. Proche de zéro, le modèle prend systématiquement le jeton le plus probable — sorties stables, plus répétitives. Plus haut, il explore — plus varié, moins fiable. Pour de l'extraction ou du code, garde-la basse.

Streaming

Aussi appelé diffusion en continu

Renvoyer la réponse jeton par jeton au fur et à mesure de sa génération plutôt qu'en un bloc final. Le temps total ne change pas ; le temps avant le premier caractère visible, oui. C'est une décision d'expérience utilisateur avant d'être une décision d'infrastructure.

Prompting 6

Ce qu'on écrit au modèle, et comment on l'écrit.

Prompt

Aussi appelé invite

Le texte envoyé au modèle pour obtenir un comportement. Dans un système agentique, ce n'est pas une question posée à la volée : c'est un artefact versionné, testé et révisé comme du code, parce que c'est lui qui détermine le comportement du système.

Prompt système

System prompt

Les consignes placées en tête du contexte, qui définissent le rôle, les contraintes et le format attendus pour toute la conversation. Le modèle leur accorde plus de poids qu'aux messages ordinaires, mais ce n'est pas une frontière de sécurité : du contenu hostile dans le contexte peut les contredire.

Prompt engineering

Aussi appelé ingénierie de prompt

La pratique consistant à structurer l'entrée pour obtenir un comportement fiable : rôle, exemples, format de sortie, contraintes explicites, et surtout ce qu'il ne faut pas faire. Moins de la magie que de la spécification — la plupart des mauvais résultats viennent d'une consigne ambiguë, pas d'un modèle faible.

Chaîne de pensée

Chain of thought

Amener le modèle à écrire son raisonnement étape par étape avant sa conclusion. Ça améliore les tâches à plusieurs étapes, et ça donne surtout une trace lisible : quand la réponse est fausse, tu vois où le raisonnement a dévié. Le raisonnement affiché reste une production du modèle, pas une explication fidèle de son calcul.

Raisonnement étendu

Extended thinking

Mode où le modèle dispose d'un budget de jetons dédié à réfléchir avant de répondre. Différent du chain-of-thought demandé dans le prompt : ici, le budget est un paramètre d'appel, et les jetons de réflexion sont facturés. Utile quand la qualité de la décision prime sur la latence.

Agents et harnais 14

Ce qui transforme un modèle qui répond en système qui agit.

Agent

Système où un modèle décide lui-même des actions à enchaîner pour atteindre un but, en s'appuyant sur des outils et sur le résultat de ses actions précédentes. La distinction utile n'est pas « agent ou pas » mais « qui décide de la prochaine étape » : si c'est ton code, c'est un pipeline ; si c'est le modèle, c'est un agent.

Agentique

Agentic

Qualifie un système dont le déroulement n'est pas fixé à l'avance mais décidé par un modèle à l'exécution. Le mot désigne un curseur plutôt qu'une catégorie : plus le système choisit ses propres étapes, plus il est agentique — et plus il demande des garde-fous et de l'observabilité.

Boucle d'agent

Agent loop

Le cycle fondamental : le modèle observe le contexte, choisit une action, le harnais l'exécute, le résultat retourne dans le contexte, et on recommence jusqu'à une condition d'arrêt. Toute la fiabilité d'un agent tient à cette condition d'arrêt et à ce qu'on remet dans le contexte à chaque tour.

Outil

Tool

Fonction que le modèle peut demander d'exécuter — lire un fichier, interroger une base, appeler une API. Sa description est un prompt : un nom précis et une documentation claire améliorent le comportement de l'agent plus sûrement qu'un modèle plus gros.

Appel d'outil

Tool call (function calling)

La sortie structurée par laquelle le modèle demande l'exécution d'un outil avec ses arguments. Le modèle n'exécute rien lui-même : il produit une intention, ton code décide de l'honorer ou non. C'est précisément là que se place le contrôle des permissions.

Skill

Ensemble d'instructions, de scripts et de ressources qu'un agent charge à la demande quand une tâche le nécessite. L'idée est de garder le contexte léger par défaut : au lieu de tout mettre dans le prompt système, on décrit la compétence en une ligne et on ne charge le détail qu'au moment utile.

MCP

MCP (Model Context Protocol)

Protocole ouvert qui standardise la façon dont un agent se connecte à des sources de données et à des outils externes. L'intérêt est le même que pour LSP chez les éditeurs : un serveur MCP écrit une fois est utilisable par tous les clients compatibles, au lieu d'une intégration par produit.

Humain dans la boucle

Human in the loop

Point d'arrêt où une personne valide avant qu'une action se produise. À placer là où l'action est difficile à annuler — envoyer un courriel, supprimer des données, pousser en production — et nulle part ailleurs, sinon la validation devient un réflexe et ne protège plus de rien.

Garde-fous

Guardrails

Contrôles déterministes placés autour du modèle : validation de schéma, listes d'autorisation, plafonds de dépense, filtres de sortie. Un garde-fou implémenté par une consigne dans le prompt n'en est pas un — il doit vivre dans du code que le modèle ne peut pas contourner.

Mémoire

Memory

Tout mécanisme qui fait persister de l'information entre deux appels au modèle, qui lui n'en garde aucune. Fichiers, base de données, résumés de session, notes structurées : c'est toujours du stockage plus une décision de relecture. Un agent n'a de mémoire que celle que tu lui construis.

Récupération et mémoire 6

Donner au modèle accès à des connaissances qu'il n'a pas apprises.

RAG

RAG (retrieval-augmented generation)

Aussi appelé génération augmentée par récupération

Récupérer les documents pertinents à la question, puis les placer dans le contexte avant de demander la réponse. C'est la solution par défaut quand l'information change, est privée ou doit être citée. La qualité d'un système RAG se joue presque entièrement dans l'étape de récupération, pas dans le modèle.

Recherche sémantique

Semantic search

Rechercher par proximité de sens dans l'espace des embeddings plutôt que par correspondance de mots-clés. Elle retrouve un document qui n'emploie aucun des mots de la question — et rate parfois une correspondance exacte évidente. En pratique, on la combine avec une recherche lexicale.

Évaluation et fiabilité 10

Comment savoir si ça marche, et comment ça casse.

Banc d'essai

Benchmark

Aussi appelé benchmark

Jeu de tâches standardisé servant à comparer des modèles entre eux. Utile pour dégrossir un choix, insuffisant pour décider : un modèle qui domine un classement public peut être médiocre sur ton domaine, et la contamination des données de test est un problème réel.

Déterminisme

Determinism

Propriété d'un système qui rend la même sortie pour la même entrée. Un appel de modèle ne l'est pas par défaut, et même à température nulle des variations subsistent. C'est une décision d'architecture : ce qui doit être reproductible — validation, calculs, effets de bord — appartient à ton code, pas au modèle.

Injection de prompt

Prompt injection

Attaque où du contenu traité par l'agent — page web, courriel, ticket, fichier — contient des instructions que le modèle suit comme si elles venaient de toi. Le modèle ne distingue pas les données des consignes. C'est la vulnérabilité structurelle des systèmes agentiques : tout contenu externe est une entrée non fiable.

Dérive

Drift

Dégradation progressive des performances quand les données réelles s'éloignent de celles sur lesquelles le système a été réglé — ou quand le fournisseur met le modèle à jour sous toi. Un prompt qui marchait il y a six mois peut ne plus marcher aujourd'hui sans qu'une seule ligne de ton code ait changé.

Exploitation 4

Les contraintes qui décident si un prototype devient un produit.

Latence / TTFT

Latency / TTFT

Le délai entre la requête et la réponse. Pour un modèle, deux mesures comptent : le temps avant le premier jeton (TTFT), qui gouverne la perception de rapidité, et le débit de génération ensuite. Un agent qui enchaîne dix appels multiplie ce délai par dix — la latence est une contrainte d'architecture, pas un détail d'infrastructure.

Débit

Throughput

Le volume traité par unité de temps — jetons par seconde, requêtes par minute. Il s'oppose souvent à la latence : traiter par lots améliore le débit et dégrade le temps de réponse individuel. Choisis lequel tu optimises avant de dimensionner quoi que ce soit.

Limite de débit

Rate limit

Plafond imposé par le fournisseur sur le nombre de requêtes ou de jetons par intervalle. Un agent qui boucle les atteint plus vite qu'une application classique. À traiter comme un mode de fonctionnement normal — attente exponentielle, file, dégradation gracieuse — et non comme une erreur exceptionnelle.

Coût par jeton

Cost per token

Le prix facturé, distinct en entrée et en sortie, généralement par million de jetons. Un agent qui relit tout son historique à chaque tour a un coût quadratique en nombre de tours. Le coût est un paramètre de conception au même titre que la latence : il se calcule avant d'écrire la boucle, pas après la première facture.