Glossaire de l'IA
Tous les termes de l'intelligence artificielle, définis simplement — de LLM à RAG, en passant par les agents, les tokens et le fine-tuning.
104 termes
- Agent IAUn agent IA combine un modèle, des outils et une boucle de décision pour accomplir une tâche en plusieurs étapes de façon autonome.
- Agent ReAct (raisonner et agir)ReAct est un schéma d'agent où le modèle alterne entre raisonner (réfléchir à l'étape suivante) et agir (appeler un outil), en exploitant chaque résultat avant de poursuivre.
- AGI (intelligence artificielle générale)L'AGI désigne une IA hypothétique aussi polyvalente que l'humain, capable d'accomplir n'importe quelle tâche intellectuelle.
- Alignement (alignment)L'alignement désigne l'effort pour qu'un système d'IA agisse conformément aux intentions et aux valeurs humaines, de façon utile, honnête et sûre.
- Ancrage (grounding)L'ancrage consiste à rattacher les réponses d'un modèle à des sources vérifiables (documents, données, recherche web) plutôt qu'à sa seule mémoire.
- API d'IAUne API d'IA est l'interface qui permet à un programme d'envoyer des requêtes à un modèle distant et d'en récupérer les réponses, sans héberger le modèle soi-même.
- API par lots (Batch API)Une API par lots traite un grand nombre de requêtes de façon groupée et asynchrone, avec un délai plus long mais un coût réduit par rapport aux appels en temps réel.
- Apprentissage automatique (machine learning)L'apprentissage automatique est une branche de l'IA où un programme apprend des régularités à partir de données, au lieu d'être codé par des règles explicites.
- Apprentissage profond (deep learning)L'apprentissage profond est une forme d'apprentissage automatique fondée sur des réseaux de neurones à de nombreuses couches, capables d'apprendre des représentations complexes.
- Artifacts (Claude)Les Artifacts sont une fonctionnalité de Claude qui affiche le contenu généré (code, document, page web, schéma) dans un panneau dédié, modifiable et réutilisable.
- Attention (mécanisme d')L'attention est le mécanisme qui permet à un modèle de pondérer l'importance de chaque mot d'une séquence par rapport aux autres, pour décider lesquels comptent le plus à un instant donné.
- Base de données vectorielleUne base de données vectorielle stocke des embeddings et permet de retrouver rapidement les éléments les plus proches d'une requête par similarité de sens.
- Benchmark (test de référence)Un benchmark est un jeu de tests standardisé qui mesure et compare les performances de modèles sur des tâches précises.
- Budget de tokens (token budget)Le budget de tokens est la quantité de tokens qu'on s'autorise à dépenser pour une tâche, en entrée comme en sortie, sous la contrainte de la fenêtre de contexte et du coût.
- Cache KV (KV cache)Le cache KV stocke les calculs d'attention déjà effectués pour les tokens précédents, afin de ne pas les recalculer à chaque nouveau token généré.
- Calcul au moment de l'inférence (test-time compute)Le calcul au moment de l'inférence désigne la puissance de calcul dépensée pendant la génération d'une réponse, et non pendant l'entraînement.
- Capacités émergentesLes capacités émergentes sont des aptitudes qui apparaissent dans les grands modèles à partir d'une certaine échelle, sans avoir été explicitement programmées.
- Chain-of-thought (raisonnement étape par étape)Le chain-of-thought consiste à faire raisonner un modèle étape par étape avant de répondre, ce qui améliore nettement les tâches complexes (maths, logique).
- Computer use (usage de l'ordinateur)Le computer use est la capacité d'un modèle à piloter une interface d'ordinateur comme un humain : voir l'écran, déplacer le curseur, cliquer et taper au clavier.
- Context engineering (ingénierie du contexte)Le context engineering est la discipline qui consiste à composer l'ensemble de ce qu'un modèle voit — instructions, exemples, documents, historique, outils — pour obtenir la meilleure réponse.
- Date de coupure des connaissances (knowledge cutoff)La date de coupure est le moment au-delà duquel un modèle n'a plus vu de données d'entraînement : il ignore les événements postérieurs.
- Débit (throughput)Le débit mesure la quantité de travail qu'un système d'IA traite par unité de temps, par exemple en tokens par seconde ou en requêtes par seconde.
- Découpage (chunking)Le chunking consiste à fractionner de longs documents en morceaux plus petits avant de les indexer, pour que la recherche sémantique et le RAG retrouvent des passages précis.
- Deepfake (hypertrucage)Un deepfake est un média (image, vidéo, voix) synthétique généré par IA pour faire dire ou faire à une personne ce qu'elle n'a jamais dit ou fait.
- Dégradation du contexte (context rot)La dégradation du contexte désigne la baisse de fiabilité d'un modèle à mesure que sa fenêtre se remplit : l'information importante se noie et certains éléments sont moins bien exploités.
- Descente de gradient (gradient descent)La descente de gradient est l'algorithme qui entraîne un modèle en ajustant pas à pas ses paramètres dans la direction qui réduit le plus l'erreur.
- DistillationLa distillation entraîne un petit modèle (« élève ») à imiter un grand modèle (« professeur »), pour obtenir un modèle plus léger et rapide proche de l'original.
- Données synthétiquesLes données synthétiques sont des données générées artificiellement, souvent par un modèle, plutôt que collectées dans le monde réel.
- Embeddings (plongements vectoriels)Un embedding est une représentation numérique (un vecteur) d'un texte, qui capture son sens : deux textes proches par le sens ont des vecteurs proches.
- Encodeur-décodeurL'architecture encodeur-décodeur sépare la compréhension de l'entrée (l'encodeur) de la génération de la sortie (le décodeur), un schéma classique pour la traduction et le résumé.
- Époque (epoch)Une époque correspond à un passage complet du modèle sur l'ensemble des données d'entraînement pendant l'apprentissage.
- Fenêtre de contexteLa fenêtre de contexte est la quantité de texte (en tokens) qu'un modèle peut prendre en compte d'un coup — son « espace de travail ».
- Fenêtre de contexte vs RAGTout mettre dans la fenêtre de contexte signifie fournir directement au modèle l'ensemble des documents ; le RAG, lui, ne récupère que les passages pertinents à la demande.
- Few-shot (apprentissage par quelques exemples)Le few-shot consiste à donner au modèle quelques exemples de la tâche directement dans le prompt, pour guider le format et le style de sa réponse.
- Fine-tuning (ajustement fin)Le fine-tuning consiste à ré-entraîner un modèle pré-existant sur des données spécifiques, pour l'adapter à un domaine ou un style.
- Flatterie (sycophantie) d'un modèleLa flatterie, ou sycophantie, est la tendance d'un modèle à dire à l'utilisateur ce qu'il semble vouloir entendre, plutôt que ce qui est exact ou utile.
- Fonction de perte (loss function)La fonction de perte mesure l'écart entre la prédiction d'un modèle et la réponse attendue : plus elle est basse, meilleur est le modèle sur l'exemple.
- Garde-fous (guardrails)Les garde-fous sont les mécanismes qui contraignent les entrées et sorties d'un modèle pour qu'il reste dans un cadre sûr et conforme.
- Garde-fous vs alignementLes garde-fous filtrent les entrées et sorties d'un modèle déjà entraîné, comme une barrière externe ; l'alignement vise à façonner le comportement du modèle lui-même pendant son entraînement.
- GPU (processeur graphique)Un GPU est un processeur conçu pour effectuer des calculs en parallèle massif, ce qui en fait le matériel de référence pour entraîner et faire tourner les modèles d'IA.
- IA constitutionnelle (Constitutional AI)L'IA constitutionnelle est la méthode d'Anthropic pour aligner Claude : le modèle suit un ensemble de principes (une « constitution ») guidant des réponses utiles, honnêtes et inoffensives.
- InférenceL'inférence est l'étape où un modèle déjà entraîné produit une réponse à partir d'une entrée — l'« exécution » du modèle, par opposition à l'entraînement.
- Interprétabilité mécanisteL'interprétabilité mécaniste cherche à comprendre le fonctionnement interne d'un modèle, en identifiant les circuits et représentations qui produisent ses comportements.
- Jailbreak (contournement de garde-fous)Un jailbreak est une manipulation du prompt visant à faire produire à un modèle un contenu que ses règles de sécurité devraient refuser.
- Jeu de données (dataset)Un jeu de données est l'ensemble structuré d'exemples utilisé pour entraîner, valider ou évaluer un modèle d'IA.
- Latence (latency)La latence est le délai entre l'envoi d'une requête à un modèle et la réception de sa réponse, souvent mesuré jusqu'au premier token généré.
- Limite de débit (rate limit)Une limite de débit plafonne le nombre de requêtes ou de tokens qu'un client peut envoyer à une API d'IA sur une période donnée.
- LLM (grand modèle de langage)Un LLM (Large Language Model) est un modèle d'IA entraîné sur d'immenses corpus de texte pour comprendre et générer du langage.
- LLM juge (LLM-as-a-judge)Le LLM juge consiste à utiliser un modèle de langage pour noter ou comparer les réponses d'un autre modèle, selon des critères de qualité définis.
- Lois d'échelle (scaling laws)Les lois d'échelle décrivent comment la performance d'un modèle s'améliore, de façon régulière, avec l'augmentation des données, des paramètres et de la puissance de calcul.
- LoRA (adaptation de faible rang)LoRA (Low-Rank Adaptation) est une méthode de fine-tuning efficace qui n'entraîne qu'un petit nombre de paramètres ajoutés, en gelant le modèle d'origine.
- Marquage (watermarking) de contenu IALe marquage de contenu IA consiste à insérer un signal discret dans un texte, une image ou un son généré, afin d'en signaler l'origine artificielle.
- MCP (Model Context Protocol)Le MCP (Model Context Protocol) est un standard ouvert, introduit par Anthropic, qui connecte un modèle à des sources de données et des outils externes de façon uniforme.
- MCP vs pluginUn plugin est une extension propre à une plateforme donnée, tandis que le MCP (Model Context Protocol) est un standard ouvert qui connecte n'importe quel modèle compatible à des outils et données.
- Mise en cache du contexte (prompt caching)La mise en cache du contexte réutilise une portion de prompt déjà traitée (instructions, documents) au lieu de la recalculer à chaque appel, ce qui réduit la latence et le coût.
- Mixture of Experts (mélange d'experts)Un modèle Mixture of Experts (MoE) n'active qu'une partie de ses paramètres (des « experts ») à chaque requête, pour plus de puissance à coût de calcul réduit.
- MMLUMMLU (Massive Multitask Language Understanding) est un benchmark de questions à choix multiples couvrant de nombreux domaines académiques et professionnels.
- Modèle de diffusionUn modèle de diffusion génère une image (ou vidéo) en partant d'un bruit aléatoire qu'il « débruite » progressivement jusqu'à obtenir le résultat.
- Modèle de fondation (foundation model)Un modèle de fondation est un grand modèle entraîné sur des données très larges, conçu pour être adapté à de nombreuses tâches en aval.
- Modèle de raisonnement (reasoning model)Un modèle de raisonnement consacre des étapes de calcul supplémentaires à réfléchir avant de répondre, ce qui améliore les tâches complexes de logique, de maths et de code.
- Modèle de récompense (reward model)Un modèle de récompense est un modèle entraîné à prédire un score de qualité pour une réponse, en imitant les préférences humaines, afin de guider l'apprentissage d'un autre modèle.
- Modèle frontière (frontier model)Un modèle frontière est l'un des modèles les plus avancés du moment, repoussant les limites de capacité connues.
- MultimodalUn modèle multimodal sait traiter plusieurs types d'entrées — texte, image, audio, parfois vidéo — et non le seul texte.
- Paramètres (parameters)Les paramètres sont les valeurs internes apprises par un modèle pendant l'entraînement ; leur nombre (souvent en milliards) donne une idée de sa taille.
- Perplexité (perplexity)La perplexité mesure à quel point un modèle de langage est « surpris » par un texte : plus elle est basse, mieux le modèle prédit la suite des mots.
- Poids (weights)Les poids sont les valeurs numériques d'un réseau de neurones, apprises pendant l'entraînement, qui déterminent la force des connexions entre neurones.
- Pré-entraînement (pretraining)Le pré-entraînement est la première phase d'apprentissage d'un modèle, sur d'immenses corpus, pour acquérir une compréhension générale du langage.
- Prompt engineering (ingénierie de requête)Le prompt engineering est l'art de formuler des consignes (prompts) claires et structurées pour obtenir les meilleures réponses d'un modèle.
- Prompt injection (injection de requête)La prompt injection est une attaque où un contenu malveillant (dans une page, un document) détourne les instructions d'un modèle pour lui faire exécuter des actions non voulues.
- Prompt système (system prompt)Le prompt système est l'instruction de haut niveau qui définit le rôle, le ton et les règles d'un modèle, avant même le message de l'utilisateur.
- RAG (génération augmentée par récupération)Le RAG (Retrieval-Augmented Generation) consiste à fournir au modèle des documents pertinents récupérés à la volée, pour qu'il réponde sur des faits à jour et cite ses sources.
- RAG agentique (agentic RAG)Le RAG agentique confie la récupération d'informations à un agent qui décide quoi chercher, quand chercher et s'il faut affiner sa requête, au lieu d'une seule recherche fixe.
- Recherche sémantiqueLa recherche sémantique trouve des résultats par leur sens plutôt que par correspondance exacte de mots-clés, en comparant des embeddings.
- Red teaming (test adverse)Le red teaming consiste à attaquer délibérément un modèle pour révéler ses failles : contenus dangereux, contournements, biais, avant une mise en production.
- Régularisation (regularization)La régularisation regroupe les techniques qui contraignent un modèle pendant l'entraînement pour l'empêcher de surapprendre et l'aider à mieux généraliser.
- Reranking (réordonnancement)Le reranking est une seconde étape qui réordonne une liste de résultats déjà récupérés, pour placer en tête les plus pertinents pour la requête.
- Réseau de neurones (neural network)Un réseau de neurones est un modèle composé de couches d'unités interconnectées qui transforment progressivement une entrée en sortie, en ajustant des poids appris.
- Rétropropagation (backpropagation)La rétropropagation est la méthode qui calcule, couche par couche, comment chaque paramètre d'un réseau de neurones contribue à l'erreur, pour savoir comment le corriger.
- RLHF (apprentissage par renforcement avec retour humain)Le RLHF entraîne un modèle à partir de préférences humaines : des humains notent les réponses, et le modèle apprend à produire celles qui sont préférées.
- Score BLEULe score BLEU est une métrique automatique qui évalue une traduction (ou un texte généré) en mesurant son recouvrement de mots et d'expressions avec une ou plusieurs références humaines.
- Self-attention (auto-attention)La self-attention est une forme d'attention où chaque élément d'une séquence se compare à tous les autres éléments de la même séquence, pour enrichir sa représentation par le contexte.
- Similarité cosinus (cosine similarity)La similarité cosinus mesure à quel point deux vecteurs pointent dans la même direction : proche de 1, ils sont très similaires ; proche de 0, sans rapport.
- Sortie structurée (structured output)Une sortie structurée force un modèle à répondre dans un format strict et exploitable par une machine, le plus souvent du JSON conforme à un schéma défini.
- Sous-agent (sub-agent)Un sous-agent est un agent spécialisé qu'un agent principal déclenche pour traiter une partie d'une tâche, avec son propre contexte et ses propres outils.
- Streaming (réponse en flux)Le streaming renvoie la réponse d'un modèle token par token au fur et à mesure de sa génération, au lieu d'attendre la réponse complète.
- Superintelligence (ASI)La superintelligence (ASI) désigne une IA hypothétique dont les capacités dépasseraient largement celles des meilleurs cerveaux humains dans presque tous les domaines.
- Surapprentissage (overfitting)Le surapprentissage survient quand un modèle mémorise trop ses données d'entraînement, au point de mal généraliser sur des données nouvelles.
- Sûreté de l'IA (AI safety)La sûreté de l'IA est le champ qui vise à rendre les systèmes d'IA fiables, contrôlables et bénéfiques, en limitant leurs risques et leurs usages néfastes.
- SWE-benchSWE-bench est un benchmark qui évalue la capacité d'un modèle à résoudre de vrais problèmes de génie logiciel, tirés de dépôts open source.
- Système multi-agentsUn système multi-agents fait collaborer plusieurs agents IA spécialisés — souvent un coordinateur et des sous-agents — pour résoudre une tâche en se répartissant le travail.
- Taux d'apprentissage (learning rate)Le taux d'apprentissage règle l'ampleur de chaque ajustement des paramètres pendant l'entraînement : grand pour apprendre vite, petit pour apprendre finement.
- Température (échantillonnage)La température règle l'aléa des réponses d'un modèle : basse = réponses sûres et déterministes ; haute = plus créatives mais moins fiables.
- Token (jeton)Un token est l'unité de base que traite un LLM : un morceau de mot (souvent ~4 caractères en anglais). Le texte est découpé en tokens avant traitement.
- Tokeniseur (tokenizer)Un tokeniseur est le composant qui découpe un texte en tokens avant qu'un modèle ne le traite, et qui reconvertit les tokens en texte à la sortie.
- Tool use (appel de fonctions)Le tool use, ou appel de fonctions, permet à un modèle de demander l'exécution d'outils externes (recherche, calcul, API) et d'en exploiter le résultat.
- Top-k (échantillonnage)Le top-k limite le choix du prochain mot aux k candidats les plus probables, parmi lesquels le modèle en tire un au hasard.
- Top-p (échantillonnage par noyau)Le top-p, ou nucleus sampling, restreint le choix du prochain mot au plus petit ensemble de candidats dont les probabilités cumulées atteignent un seuil p (par ex. 0,9).
- Transformer (architecture)Le Transformer est l'architecture de réseau de neurones qui sous-tend les LLM modernes, fondée sur le mécanisme d'« attention ».
- TTFT (temps jusqu'au premier token)Le TTFT (time to first token) est le délai entre l'envoi d'une requête et l'apparition du tout premier token de la réponse.