Agent (IA)
Un LLM à qui on laisse choisir la suite : il observe, décide d'une action, l'exécute avec un outil, lit le résultat, et recommence jusqu'à ce qu'il juge la tâche finie.
En une phrase
Section intitulée « En une phrase »Un agent, c’est un LLM à qui on ne demande plus une réponse mais un résultat : à chaque tour il regarde où il en est, choisit une action, l’exécute avec un outil, lit ce que ça a donné, et recommence jusqu’à ce qu’il juge la tâche finie.
L’analogie
Section intitulée « L’analogie »Deux façons de faire cuisiner quelqu’un : poser une recette sur le plan de travail, étape par étape ; ou dire « fais-nous à dîner avec ce qu’il y a dans le frigo », et sortir de la pièce.
Un modèle sans outils ne peut faire ni l’un ni l’autre : il rédige très bien la recette, il ne touche pas aux casseroles. Lui donner des outils, c’est lui donner les mains ; en faire un agent, c’est lui laisser en plus l’ordre des gestes et le moment où c’est prêt. Toute sa puissance, et tous ses ennuis : tu n’es plus dans la pièce.
Comment ça marche
Section intitulée « Comment ça marche »Un tour de boucle
Section intitulée « Un tour de boucle »Quatre temps, répétés jusqu’à une condition d’arrêt.
- Observer — relire la consigne et tout ce qui s’est passé depuis : messages, résultats d’outils, erreurs.
- Décider — le modèle rédige son raisonnement, puis nomme l’outil qu’il veut appeler et ses paramètres : c’est l’appel d’outil.
- Agir — le programme qui héberge l’agent exécute l’appel. Le modèle, lui, n’exécute rien : il demande.
- Observer le résultat — la sortie est recollée dans le contexte, et le tour suivant démarre avec.
Entrelacer raisonnement et action plutôt que tout planifier d’abord, c’est l’apport du papier ReAct (Shunyu Yao et ses co-auteurs, 2022) : le raisonnement choisit l’action, l’observation corrige le raisonnement.
Rien à voir avec la boucle de l’inférence, qui pose un token à la fois : ici, un tour vaut une génération complète plus une action réellement exécutée. Dix tours, dix requêtes facturées.
Workflow ou agent : qui écrit l’enchaînement ?
Section intitulée « Workflow ou agent : qui écrit l’enchaînement ? »Anthropic a posé en décembre 2024 une distinction restée courante. Un workflow orchestre modèles et outils « par des chemins de code définis à l’avance » : extraire, classer, résumer, toujours dans cet ordre. Un agent est un système où le modèle « dirige lui-même son déroulement et son usage des outils ».
L’essentiel de ce qu’on vend comme agent est un workflow, et c’est souvent une bonne nouvelle : écrit d’avance, un enchaînement est prévisible, testable et bien moins cher. Le même texte conseille de chercher la solution la plus simple qui marche, quitte à ne rien construire d’agentique.
Tenir la distance : mémoire et découpage
Section intitulée « Tenir la distance : mémoire et découpage »Un agent n’a pas d’autre mémoire que sa fenêtre de contexte, et chaque observation s’y empile : page web avalée brute, journal d’erreurs, sortie d’une commande. Trente tours suffisent à la saturer. D’où trois parades combinables — résumer les tours anciens, écrire les résultats dans des fichiers qu’on relira au besoin, confier la mémoire longue à une base documentaire, un usage du RAG.
Découper la tâche répond au même problème. En multi-agents, un orchestrateur ouvre des sous-agents spécialisés, chacun avec son contexte et ses outils, et ne récupère que leurs conclusions. Ça se paie : Anthropic chiffre un agent à quatre fois les tokens d’une conversation, un système multi-agents à quinze fois. Et ça s’effondre dès qu’ils doivent partager le même contexte — ce qu’un sous-agent n’a pas vu, personne ne le lui dira.
Les garde-fous
Section intitulée « Les garde-fous »Ce qui borne un agent n’est jamais sa bonne volonté, c’est son environnement : les outils qu’on lui donne, les droits du compte sous lequel ils tournent, un bac à sable dont il ne sort pas, un plafond de tours, une confirmation humaine avant toute action irréversible, un bouton d’arrêt.
La question dépasse la technique. Dans une note commune de juillet 2026, la CNIL et le Conseil de l’IA et du numérique relèvent que la mémoire persistante et l’autonomie de décision changent d’échelle les risques pour les données personnelles — et qu’au-delà d’un certain point, on ne sait plus dire qui décide, de l’utilisateur ou de la machine. Le traitement bascule alors sous l’article 22 du RGPD, celui des décisions automatisées.
Là où ça casse
Section intitulée « Là où ça casse »- Les erreurs se composent. À 95 % de fiabilité par étape, dix étapes d’affilée tombent à 60 %. Le banc d’essai τ-bench rejoue huit fois la même tâche de service client et ne compte que les séries sans faute : en 2024, GPT-4o y réussissait moins d’une tâche sur deux, et en vente au détail moins d’une sur quatre tenait les huit essais.
- Le coût suit le nombre de tours, et ce nombre n’est pas connu d’avance. Un agent qui s’entête dans une impasse facture son entêtement.
- L’agent lit du contenu qu’il n’a pas choisi. Une page web, un ticket, un e-mail entrent dans son contexte au même titre que ta consigne, et rien n’y distingue une donnée d’une instruction. Simon Willison appelle « trifecta létale » les trois ingrédients de l’attaque : des données privées, du contenu extérieur, un moyen d’envoyer quelque chose dehors. Deux sur trois, ça passe ; les trois, l’exfiltration est possible.
- L’échec est souvent silencieux. Dans TheAgentCompany, entreprise logicielle simulée montée à Carnegie Mellon, un agent ne trouve pas le collègue à qui poser sa question : il renomme un autre utilisateur au nom du bon, et continue. Les auteurs classent ça sous « se tromper soi-même ». Un agent rend très rarement « je n’y suis pas arrivé ».
- On mesure mal le gain. METR a fait travailler seize développeurs expérimentés sur 246 tâches réelles de leurs propres dépôts, avec et sans assistance. Ils ont été 19 % plus lents avec — et restaient persuadés, après coup, d’avoir été 20 % plus rapides.
Dans la vraie vie
Section intitulée « Dans la vraie vie »- Les agents de code — Claude Code, Cursor, l’agent de GitHub Copilot à qui on assigne un ticket comme à un collègue. C’est là qu’ils marchent le mieux, et ce n’est pas un hasard : la suite de tests rend un verdict à chaque tour. Le banc d’essai de référence, SWE-bench Verified, est bâti là-dessus — 500 vrais tickets GitHub, un correctif ne comptant que si les tests passent.
- La recherche approfondie : enchaîner des requêtes, ouvrir les pages, recouper, rédiger avec les liens. GAIA, publié fin 2023 pour l’évaluer, pose des questions faciles pour un humain et pénibles pour une machine — 92 % de réussite côté humains, 15 % pour GPT-4 avec ses extensions.
- Le travail de bureau : trier des messages, ouvrir des tickets, annuler une commande dans un vrai système. Sur les 175 tâches d’entreprise de TheAgentCompany, le meilleur agent en termine 30 % tout seul.
Idées reçues
Section intitulée « Idées reçues »- « Un agent est autonome. » L’autonomie est un curseur, et c’est celui qui déploie l’agent qui le règle. Le Conseil de l’IA et du numérique en distingue cinq crans, de la simple exécution de règles écrites aux flux semi-autonomes — la machine entièrement auto-dirigée restant, à ce jour, un sujet de recherche.
- « Plus il a d’outils, meilleur il est. » Chaque description occupe de la place dans sa fenêtre de contexte avant même ta question, et plus le choix est large, plus il se trompe souvent de porte. Peu d’outils bien décrits valent mieux qu’une armoire mal rangée.
- « S’il a rendu quelque chose, c’est que la tâche est faite. » Un agent produit toujours une sortie, y compris quand il a contourné le problème au lieu de le résoudre. Sans vérificateur extérieur — des tests, une relecture, l’état de la base comparé à l’attendu — tu ne lis que sa version des faits.
Pour aller plus loin
Section intitulée « Pour aller plus loin »- « ReAct: Synergizing Reasoning and Acting in Language Models » — Yao et al., 2022 (EN) : le papier qui entrelace raisonnement et action.
- « Building effective agents » — Anthropic, 2024 (EN) : la distinction workflow / agent, et le conseil de commencer sans.
- « τ-bench » — Yao et al., 2024 (EN) : la même tâche rejouée huit fois de suite.
- « TheAgentCompany » — Xu et al., 2024 (EN) : 175 tâches d’entreprise simulée, échecs commentés.
- « The lethal trifecta for AI agents » — Simon Willison, 2025 (EN) : les trois ingrédients d’une exfiltration.
- « Measuring the Impact of Early-2025 AI on Experienced Open-Source Developer Productivity » — METR, 2025 (EN) : l’essai contrôlé où l’accélération ressentie est un ralentissement.
- « IA agentique et protection des données personnelles » — CNIL et CIANum, 2026 (FR) : ce que l’autonomie et la mémoire persistante changent au regard du RGPD.
Voir aussi
Section intitulée « Voir aussi »Voir aussi
- FondamentauxLLM (grand modèle de langage)Un modèle d'IA entraîné sur d'immenses quantités de texte, capable de comprendre et de générer du langage.
- ÉcosystèmeMCP (Model Context Protocol)Le protocole ouvert qui standardise le branchement entre une application d'IA et le monde extérieur : outils, fichiers, bases de données, API.
- ÉcosystèmeRAG (génération augmentée par la recherche)Aller chercher des documents pertinents dans une base de connaissances et les donner au modèle pour qu'il réponde avec des informations à jour et sourcées.
- FondamentauxFenêtre de contexteLa quantité maximale de texte qu'un modèle peut prendre en compte d'un coup : sa « mémoire de travail ».
- FondamentauxHallucinationQuand un LLM affirme avec aplomb des choses fausses ou inventées : sources, faits ou références imaginaires.
- FondamentauxInférenceLe moment où le modèle tourne pour de vrai : la boucle qui écrit le texte, un token à la fois, par opposition à l'entraînement où il apprend.
- FondamentauxPrompt (instruction générative)Le texte que le modèle a sous les yeux au moment de répondre, et le seul levier qui reste une fois qu'il est entraîné.
- FondamentauxModèle de raisonnement (reasoning model)Un LLM entraîné à écrire un long brouillon avant de répondre : ce qu'il gagne sur les problèmes difficiles, ce qu'il coûte, et pourquoi son brouillon n'est pas une fenêtre sur sa pensée.
- ÉcosystèmeAppel d'outilsLe mécanisme qui permet à un modèle de langage d'émettre des requêtes structurées pour faire exécuter du code, interroger des bases de données ou consulter des API externes.