Prompt (instruction générative)
Le texte que le modèle a sous les yeux au moment de répondre, et le seul levier qui reste une fois qu'il est entraîné.
En une phrase
Section intitulée « En une phrase »Un prompt, c’est tout le texte que le modèle a sous les yeux au moment de répondre — ta question, mais aussi les consignes, les exemples et les documents qu’on y a glissés sans te le dire — et c’est la seule chose que tu peux encore changer une fois le modèle entraîné.
L’analogie
Section intitulée « L’analogie »Tu laisses un mot à la personne qui te remplace au comptoir pendant que tu déjeunes. Elle est compétente, mais elle ne te connaît pas, n’a pas vécu la matinée, et ne te posera aucune question : elle fera exactement ce que le mot dit, et rien d’autre.
« Occupe-toi des clients » et « Si un client demande un remboursement, note son nom sur le carnet et dis-lui de repasser à 14 h » ne produisent pas la même journée. Le prompt, c’est ce mot — le modèle ne sait rien de ce que tu n’as pas écrit.
Comment ça marche
Section intitulée « Comment ça marche »Tout est une seule suite de tokens
Section intitulée « Tout est une seule suite de tokens »Rôle système, historique de la conversation, documents remontés par une recherche et question finale : tout est concaténé en une seule séquence, découpée en tokens, et repassée au modèle à chaque tour.
Trois conséquences, qui expliquent presque tout le reste.
- Aucune mémoire entre deux requêtes. C’est l’application qui recolle l’historique. Le modèle, lui, repart de zéro chaque fois.
- La place est comptée. C’est la fenêtre de contexte, et quand elle déborde, quelque chose est coupé ou résumé.
- Rien ne distingue techniquement une consigne d’une donnée. Les deux sont du texte, dans la même séquence. C’est la porte d’entrée de l’injection de prompt, plus bas.
Les rôles : système, utilisateur, assistant
Section intitulée « Les rôles : système, utilisateur, assistant »Les modèles de conversation attendent un gabarit : des tokens spéciaux délimitent qui parle. Le prompt système y tient la place des consignes durables — le ton, les interdits, le format.
Ce n’est pas un règlement que la machine appliquerait. C’est du texte que l’entraînement par instructions a rendu plus appuyé que le reste. Il pèse lourd, il ne verrouille rien, et il se contourne.
Les quatre leviers qui marchent
Section intitulée « Les quatre leviers qui marchent »- Donner le contexte et le format attendu. Qui tu es, à quoi ça va servir, en combien de lignes. Le modèle ne devine pas l’implicite d’une situation qu’il n’a pas vécue.
- Montrer des exemples. Deux ou trois paires entrée/sortie valent souvent mieux qu’un paragraphe de consignes. Brown et ses co-auteurs ont décrit ce phénomène en 2020 sous le nom d’apprentissage en contexte : le modèle s’ajuste à la tâche sans qu’un seul de ses poids ne bouge.
- Demander les étapes. Wei et al. en 2022, puis Kojima et al. avec leur célèbre « réfléchissons étape par étape », ont montré qu’obliger le modèle à dérouler son raisonnement améliorait les tâches à plusieurs temps. Nuance importante aujourd’hui : sur les modèles de raisonnement, ce gain a largement fondu — ils le font déjà d’eux-mêmes, et le leur redemander ne sert plus à grand-chose.
- Autoriser explicitement « je ne sais pas ». Un modèle à qui on n’a pas donné cette issue préfère répondre.
La forme compte autant que le fond
Section intitulée « La forme compte autant que le fond »C’est la partie inconfortable. Sclar et ses co-auteurs ont mesuré en 2023 qu’un changement purement cosmétique dans le gabarit — un séparateur, une majuscule, un espace — faisait bouger la performance de dizaines de points sur la même tâche, avec le même modèle.
Corollaire pratique : un prompt qui a marché une fois n’est pas une preuve. Deux essais sur un exemple bien choisi ne disent rien de ce qui se passera sur cent cas réels.
L’injection de prompt
Section intitulée « L’injection de prompt »Puisque consignes et données partagent un seul canal, un texte de données peut se faire passer pour une consigne.
- Directe : quelqu’un tape « ignore les instructions précédentes ».
- Indirecte, la plus sérieuse : la consigne est cachée dans une page web, un document remonté par un RAG, un e-mail. Personne ne l’a tapée, elle arrive par le contenu.
- Multimodale : écrite dans une image.
L’OWASP classe l’injection de prompt au premier rang de ses risques pour les applications à base de LLM, deuxième édition consécutive, et écrit lui-même qu’aucune parade complète n’est connue. L’enjeu devient concret dès qu’un agent tient des outils : là, un texte piégé ne fait plus dire une bêtise, il fait faire une action.
Dans la vraie vie
Section intitulée « Dans la vraie vie »- Le prompt système d’un assistant grand public fait des centaines de lignes, et plusieurs ont fuité — ce sont des documents éditoriaux, pas du code.
- Avec un RAG, le prompt réellement envoyé n’est pas celui que tu as tapé : des extraits de documents ont été insérés au-dessus de ta question, et tu ne les vois pas.
- La boucle d’un agent est une boucle de réécriture de prompt : à chaque tour, le résultat de l’outil est recollé dans la séquence.
- La facturation se fait au token, historique compris, à chaque tour. Une longue conversation coûte de plus en plus cher à chaque message.
- Le vocabulaire officiel existe : depuis la liste publiée au Journal officiel du 6 septembre 2024, l’équivalent français recommandé est « instruction générative », et « invite » y est explicitement déconseillé dans ce sens — il reste valable pour l’invite de commande. Les agents de l’État sont tenus de l’employer.
Idées reçues
Section intitulée « Idées reçues »- « Le modèle se souvient de notre conversation. » Il ne se souvient de rien : à chaque tour, l’application recolle tout l’historique dans le prompt et le repaie en tokens. Quand ça déborde, quelque chose est coupé ou résumé — et ce qui a disparu n’a jamais existé pour lui.
- « Le prompt système est une règle que le modèle ne peut pas enfreindre. » C’est du texte, posé dans la même séquence que le reste, et rien dans la machine ne le marque comme supérieur. L’OWASP classe l’injection de prompt au premier rang de ses risques depuis deux éditions, précisément parce que consignes et données partagent un seul canal.
- « Le prompt engineering est une astuce qui disparaîtra avec les modèles plus intelligents. » Ce qui disparaît, ce sont les formules magiques. Le canal, lui, reste : un modèle est entraîné une fois et interrogé des millions de fois, donc la seule variable au moment de la question sera toujours ce qu’on lui donne à lire.
Pour aller plus loin
Section intitulée « Pour aller plus loin »- « Language Models are Few-Shot Learners » — Brown et al., 2020 (EN) : le papier qui décrit l’apprentissage en contexte.
- « Chain-of-Thought Prompting Elicits Reasoning in Large Language Models » — Wei et al., 2022 (EN).
- « Quantifying Language Models’ Sensitivity to Spurious Features in Prompt Design » — Sclar et al., 2023 (EN) : la fragilité au gabarit, mesurée.
- Liste des termes de l’intelligence artificielle — Journal officiel du 6 septembre 2024 (FR).
- LLM01:2025 — Prompt Injection — OWASP (EN).
Voir aussi
Section intitulée « Voir aussi »Voir aussi
- FondamentauxFenêtre de contexteLa quantité maximale de texte qu'un modèle peut prendre en compte d'un coup : sa « mémoire de travail ».
- FondamentauxHallucinationQuand un LLM affirme avec aplomb des choses fausses ou inventées : sources, faits ou références imaginaires.
- FondamentauxInférenceLe moment où le modèle tourne pour de vrai : la boucle qui écrit le texte, un token à la fois, par opposition à l'entraînement où il apprend.
- ÉcosystèmeRAG (génération augmentée par la recherche)Aller chercher des documents pertinents dans une base de connaissances et les donner au modèle pour qu'il réponde avec des informations à jour et sourcées.
- ÉcosystèmeAgent (IA)Un LLM à qui on laisse choisir la suite : il observe, décide d'une action, l'exécute avec un outil, lit le résultat, et recommence jusqu'à ce qu'il juge la tâche finie.
- ArchitectureMultimodalitéQuand un modèle ne lit plus seulement du texte : image et son sont découpés à leur tour, projetés dans le même espace que les mots, et traités par la même machine.
- FondamentauxModèle de raisonnement (reasoning model)Un LLM entraîné à écrire un long brouillon avant de répondre : ce qu'il gagne sur les problèmes difficiles, ce qu'il coûte, et pourquoi son brouillon n'est pas une fenêtre sur sa pensée.
- ÉthiqueContournement des sécurités (jailbreak)Les attaques par invites contradictoires conçues pour faire sauter les garde-fous éthiques d'un modèle : jeux de rôle, suffixes GCG, saturation de contexte et red teaming.
- ÉcosystèmeAppel d'outilsLe mécanisme qui permet à un modèle de langage d'émettre des requêtes structurées pour faire exécuter du code, interroger des bases de données ou consulter des API externes.