RAG (génération augmentée par la recherche)
Aller chercher des documents pertinents dans une base de connaissances et les donner au modèle pour qu'il réponde avec des informations à jour et sourcées.
En une phrase
Section intitulée « En une phrase »Le RAG, pour retrieval-augmented generation, consiste à chercher les passages utiles dans une base de documents et à les recopier dans la question posée au modèle : il répond alors à partir d’un texte réel, et peut dire d’où vient sa réponse.
L’analogie
Section intitulée « L’analogie »Le RAG, c’est l’examen à livre ouvert. Sans lui, le modèle compose de mémoire : ce qu’il a retenu à l’entraînement, parfois périmé, souvent hors de ton domaine, jamais vérifiable. Avec lui, on pose devant lui les bonnes pages au moment de la question.
Un détail change tout : ce n’est pas le modèle qui va chercher ces pages. Un moteur de recherche les choisit en amont, et il ne verra rien d’autre. La réponse est donc plafonnée par la qualité de ce tri — dont parle tout le reste de la fiche.
Comment ça marche
Section intitulée « Comment ça marche »Deux moments, quatre étapes
Section intitulée « Deux moments, quatre étapes »L’indexation se fait une fois, à l’avance, et se rejoue quand les documents changent. Les trois autres s’enchaînent à chaque question.
- Indexer — découper les documents en fragments, calculer l’embedding de chacun, ranger le tout dans un index.
- Chercher — la question devient un vecteur, on remonte les fragments les plus proches.
- Assembler — les meilleurs sont recopiés dans le prompt, au-dessus de la question.
- Générer — le modèle rédige à partir de ce qu’il a sous les yeux, et de rien d’autre.
Le nom vient d’un papier de Patrick Lewis et de ses co-auteurs, chez Facebook AI Research, en 2020 : Wikipédia découpé en 21 millions de passages de 100 mots, un moteur vectoriel et un générateur entraînés ensemble. Tout ce qui a suivi raffine ces quatre cases — sans rien apprendre au modèle, ce qui sépare le RAG du fine-tuning.
Découper, le réglage qui décide de tout
Section intitulée « Découper, le réglage qui décide de tout »Un manuel de 300 pages parle de tout : son vecteur ne ressemble à aucune question. On découpe donc les documents en fragments, des chunks, et c’est la décision la plus lourde de la chaîne, puisqu’elle est prise avant de connaître les questions.
Trop petits, les fragments perdent ce qui les rendait compréhensibles : un paragraphe qui s’ouvre sur « cette procédure ne s’applique pas aux stagiaires » ne dit plus laquelle. Trop gros, ils mélangent trois sujets et le vecteur en fait la moyenne : ils ressortent mal sur chacun. Les tailles usuelles vont de la centaine à quelques centaines de mots, avec un chevauchement pour ne pas couper une phrase en deux.
D’où une parade répandue : réécrire chaque fragment avant de l’indexer, en lui ajoutant une phrase qui le resitue dans son document. Anthropic l’a chiffrée en 2024 — parmi les vingt fragments remontés, les cas où le bon passage manque baissent de 35 %.
Chercher, puis reclasser
Section intitulée « Chercher, puis reclasser »La recherche dense est celle de la fiche Embedding : question et fragments sont des directions dans un même espace, classées par l’angle qui les sépare. Elle retrouve une reformulation sans un mot commun, mais reste floue sur ce qui doit être exact — une référence d’article, un code produit, un nom rare.
La recherche lexicale, elle, compte les mots. Sa formule de référence, BM25, sort du système Okapi de la City University de Londres et date de 1994 : trente ans plus tard, elle reste la ligne de base que tout nouveau moteur doit battre. Elle ignore le sens, mais ne rate pas un identifiant écrit à l’identique. D’où la recherche hybride : lancer les deux, fusionner les classements. Chez Anthropic, le volet lexical fait passer la baisse de 35 à 49 %.
Reste que l’index compare grossièrement : question et fragment ont été vectorisés séparément. Le reclassement (reranking) corrige ça — on demande large, cinquante ou cent fragments, puis un second modèle relit chaque paire et refait le classement. Trop cher sur la base entière, abordable sur une liste courte : la baisse passe de 49 à 67 %.
Là où ça casse
Section intitulée « Là où ça casse »- Le plafond de la recherche. Aucun modèle plus gros ne rattrape un mauvais tri en amont : ce qui n’est pas remonté n’existe pas.
- Les questions qui ne sont pas des recherches. « Combien de procédures au total ? », « laquelle est la plus récente ? » : la réponse se calcule sur l’ensemble, aucun fragment ne la contient.
- L’index vieillit, et ignore tes droits. Un document corrigé mais non réindexé répond dans son ancienne version, avec le même aplomb. Et tout ce qui est indexé devient atteignable par quiconque interroge l’assistant, sauf à filtrer par utilisateur.
Visualisation
Section intitulée « Visualisation »Une question — « est-ce que j’ai le droit d’utiliser mon téléphone pendant la récré ? » — dans la base d’un lycée fictif. C’est le nuage de la fiche Embedding, même sphère et même mesure d’angle, mais figé : une étape doit se retrouver à l’identique. Les trois documents les plus proches partent dans le prompt, et le bon répond sans jamais employer ni « téléphone » ni « récré ». Va jusqu’à la dernière étape, celle où le deuxième du classement passe premier.
Comment le modèle répond-il à partir de tes documents ?
Est-ce que j'ai le droit d'utiliser mon téléphone pendant la récré ?
La réponse de mémoire
En général, l'usage du téléphone au lycée est encadré par le règlement de chaque établissement. Le mieux est de te renseigner auprès de la vie scolaire.
Étape 1/6 Sans RAG, le modèle répond de mémoire. Ce qu'il dit est plausible, général, et invérifiable : il n'a jamais lu le règlement de ton lycée.
Documents et positions illustratifs, choisis pour rendre le mécanisme lisible.
Dans la vraie vie
Section intitulée « Dans la vraie vie »- France Travail, « Conseils Personnalisés ». Un Mixtral installé sur les serveurs de l’établissement, alimenté par un RAG qui réunit plus de 20 000 formations du catalogue et le profil du demandeur d’emploi. La CNIL, qui a accompagné le projet, y pose une condition : le conseiller doit rester libre de suivre ou non la suggestion.
- Les moteurs de réponse. Perplexity et ses semblables prennent le web pour base : une recherche à chaque question, la réponse rédigée par-dessus, les liens en dessous. Le RAG y est le produit.
- Gemini Notebook, lancé par Google en 2023 sous le nom NotebookLM, fait l’inverse : la base, ce sont les seuls documents que tu déposes, et chaque phrase renvoie au passage dont elle sort.
- L’assistant documentaire d’entreprise, le cas le plus courant et le moins spectaculaire. La difficulté n’y est presque jamais le modèle, mais des documents mal structurés, des versions contradictoires et des droits d’accès à respecter.
Idées reçues
Section intitulée « Idées reçues »- « Avec le RAG, fini les hallucinations. » Il les fait beaucoup baisser, il ne les supprime pas : le modèle peut mal lire un extrait, boucher un trou, ou suivre sa mémoire plutôt que le texte fourni. Les outils juridiques testés par Stanford en 2024 reposaient tous sur du RAG et hallucinaient encore sur 17 à 33 % des requêtes.
- « Si la réponse cite une source, c’est qu’elle en vient. » La source existe, elle a bien été remontée, et la phrase peut quand même ne pas s’y trouver. Nelson Liu, Tianyi Zhang et Percy Liang ont audité quatre moteurs de réponse en 2023 : 51,5 % seulement des phrases produites étaient entièrement étayées par leurs citations. Une citation est une piste, pas une preuve.
- « Les fenêtres d’un million de tokens rendent le RAG inutile. » Elles déplacent le seuil sans le supprimer. En dessous de 200 000 tokens, environ 500 pages, Anthropic recommande de tout coller dans le prompt. Au-dessus, un corpus d’entreprise se compte en centaines de milliers de pages, on le paierait en entier à chaque question, et la qualité se dégrade bien avant la saturation — voir la fiche Fenêtre de contexte.
Pour aller plus loin
Section intitulée « Pour aller plus loin »- « Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks » — Lewis et al., 2020 (EN) : le papier fondateur.
- Guide de la génération augmentée par récupération (RAG) — Direction générale des entreprises, 2024 (FR) : 24 pages pour cadrer un projet, des prérequis aux coûts et aux fuites de données.
- « Introducing Contextual Retrieval » — Anthropic, 2024 (EN) : découpage, hybride et reclassement chiffrés étape par étape.
- « Evaluating Verifiability in Generative Search Engines » — Liu, Zhang et Liang, 2023 (EN) : les citations vérifiées une par une.
- Bac à sable « IA et services publics » — CNIL, avril 2025 (FR) : le projet France Travail détaillé, et ce que le RGPD exige d’un RAG.
Voir aussi
Section intitulée « Voir aussi »Voir aussi
- FondamentauxEmbedding (plongement)La traduction d'un mot ou d'un texte en une liste de nombres qui capture son sens : des coordonnées dans l'espace du sens.
- FondamentauxLLM (grand modèle de langage)Un modèle d'IA entraîné sur d'immenses quantités de texte, capable de comprendre et de générer du langage.
- EntraînementFine-tuning (réglage fin)Poursuivre l'entraînement d'un modèle déjà entraîné sur tes propres données pour lui apprendre un style, un domaine ou une tâche.
- ÉcosystèmeMCP (Model Context Protocol)Le protocole ouvert qui standardise le branchement entre une application d'IA et le monde extérieur : outils, fichiers, bases de données, API.
- FondamentauxHallucinationQuand un LLM affirme avec aplomb des choses fausses ou inventées : sources, faits ou références imaginaires.
- FondamentauxFenêtre de contexteLa quantité maximale de texte qu'un modèle peut prendre en compte d'un coup : sa « mémoire de travail ».
- FondamentauxPrompt (instruction générative)Le texte que le modèle a sous les yeux au moment de répondre, et le seul levier qui reste une fois qu'il est entraîné.