Aller au contenu
Écosystème

RAG (génération augmentée par la recherche)

Aller chercher des documents pertinents dans une base de connaissances et les donner au modèle pour qu'il réponde avec des informations à jour et sourcées.

7 min de lecture
  • #recherche
  • #base vectorielle
  • #contexte

Le RAG, pour retrieval-augmented generation, consiste à chercher les passages utiles dans une base de documents et à les recopier dans la question posée au modèle : il répond alors à partir d’un texte réel, et peut dire d’où vient sa réponse.

Le RAG, c’est l’examen à livre ouvert. Sans lui, le modèle compose de mémoire : ce qu’il a retenu à l’entraînement, parfois périmé, souvent hors de ton domaine, jamais vérifiable. Avec lui, on pose devant lui les bonnes pages au moment de la question.

Un détail change tout : ce n’est pas le modèle qui va chercher ces pages. Un moteur de recherche les choisit en amont, et il ne verra rien d’autre. La réponse est donc plafonnée par la qualité de ce tri — dont parle tout le reste de la fiche.

L’indexation se fait une fois, à l’avance, et se rejoue quand les documents changent. Les trois autres s’enchaînent à chaque question.

  1. Indexer — découper les documents en fragments, calculer l’embedding de chacun, ranger le tout dans un index.
  2. Chercher — la question devient un vecteur, on remonte les fragments les plus proches.
  3. Assembler — les meilleurs sont recopiés dans le prompt, au-dessus de la question.
  4. Générer — le modèle rédige à partir de ce qu’il a sous les yeux, et de rien d’autre.

Le nom vient d’un papier de Patrick Lewis et de ses co-auteurs, chez Facebook AI Research, en 2020 : Wikipédia découpé en 21 millions de passages de 100 mots, un moteur vectoriel et un générateur entraînés ensemble. Tout ce qui a suivi raffine ces quatre cases — sans rien apprendre au modèle, ce qui sépare le RAG du fine-tuning.

Un manuel de 300 pages parle de tout : son vecteur ne ressemble à aucune question. On découpe donc les documents en fragments, des chunks, et c’est la décision la plus lourde de la chaîne, puisqu’elle est prise avant de connaître les questions.

Trop petits, les fragments perdent ce qui les rendait compréhensibles : un paragraphe qui s’ouvre sur « cette procédure ne s’applique pas aux stagiaires » ne dit plus laquelle. Trop gros, ils mélangent trois sujets et le vecteur en fait la moyenne : ils ressortent mal sur chacun. Les tailles usuelles vont de la centaine à quelques centaines de mots, avec un chevauchement pour ne pas couper une phrase en deux.

D’où une parade répandue : réécrire chaque fragment avant de l’indexer, en lui ajoutant une phrase qui le resitue dans son document. Anthropic l’a chiffrée en 2024 — parmi les vingt fragments remontés, les cas où le bon passage manque baissent de 35 %.

La recherche dense est celle de la fiche Embedding : question et fragments sont des directions dans un même espace, classées par l’angle qui les sépare. Elle retrouve une reformulation sans un mot commun, mais reste floue sur ce qui doit être exact — une référence d’article, un code produit, un nom rare.

La recherche lexicale, elle, compte les mots. Sa formule de référence, BM25, sort du système Okapi de la City University de Londres et date de 1994 : trente ans plus tard, elle reste la ligne de base que tout nouveau moteur doit battre. Elle ignore le sens, mais ne rate pas un identifiant écrit à l’identique. D’où la recherche hybride : lancer les deux, fusionner les classements. Chez Anthropic, le volet lexical fait passer la baisse de 35 à 49 %.

Reste que l’index compare grossièrement : question et fragment ont été vectorisés séparément. Le reclassement (reranking) corrige ça — on demande large, cinquante ou cent fragments, puis un second modèle relit chaque paire et refait le classement. Trop cher sur la base entière, abordable sur une liste courte : la baisse passe de 49 à 67 %.

  • Le plafond de la recherche. Aucun modèle plus gros ne rattrape un mauvais tri en amont : ce qui n’est pas remonté n’existe pas.
  • Les questions qui ne sont pas des recherches. « Combien de procédures au total ? », « laquelle est la plus récente ? » : la réponse se calcule sur l’ensemble, aucun fragment ne la contient.
  • L’index vieillit, et ignore tes droits. Un document corrigé mais non réindexé répond dans son ancienne version, avec le même aplomb. Et tout ce qui est indexé devient atteignable par quiconque interroge l’assistant, sauf à filtrer par utilisateur.

Une question — « est-ce que j’ai le droit d’utiliser mon téléphone pendant la récré ? » — dans la base d’un lycée fictif. C’est le nuage de la fiche Embedding, même sphère et même mesure d’angle, mais figé : une étape doit se retrouver à l’identique. Les trois documents les plus proches partent dans le prompt, et le bon répond sans jamais employer ni « téléphone » ni « récré ». Va jusqu’à la dernière étape, celle où le deuxième du classement passe premier.

Comment le modèle répond-il à partir de tes documents ?

Est-ce que j'ai le droit d'utiliser mon téléphone pendant la récré ?

La réponse de mémoire

En général, l'usage du téléphone au lycée est encadré par le règlement de chaque établissement. Le mieux est de te renseigner auprès de la vie scolaire.

Étape 1/6 Sans RAG, le modèle répond de mémoire. Ce qu'il dit est plausible, général, et invérifiable : il n'a jamais lu le règlement de ton lycée.

Documents et positions illustratifs, choisis pour rendre le mécanisme lisible.

  • France Travail, « Conseils Personnalisés ». Un Mixtral installé sur les serveurs de l’établissement, alimenté par un RAG qui réunit plus de 20 000 formations du catalogue et le profil du demandeur d’emploi. La CNIL, qui a accompagné le projet, y pose une condition : le conseiller doit rester libre de suivre ou non la suggestion.
  • Les moteurs de réponse. Perplexity et ses semblables prennent le web pour base : une recherche à chaque question, la réponse rédigée par-dessus, les liens en dessous. Le RAG y est le produit.
  • Gemini Notebook, lancé par Google en 2023 sous le nom NotebookLM, fait l’inverse : la base, ce sont les seuls documents que tu déposes, et chaque phrase renvoie au passage dont elle sort.
  • L’assistant documentaire d’entreprise, le cas le plus courant et le moins spectaculaire. La difficulté n’y est presque jamais le modèle, mais des documents mal structurés, des versions contradictoires et des droits d’accès à respecter.
  • « Avec le RAG, fini les hallucinations. » Il les fait beaucoup baisser, il ne les supprime pas : le modèle peut mal lire un extrait, boucher un trou, ou suivre sa mémoire plutôt que le texte fourni. Les outils juridiques testés par Stanford en 2024 reposaient tous sur du RAG et hallucinaient encore sur 17 à 33 % des requêtes.
  • « Si la réponse cite une source, c’est qu’elle en vient. » La source existe, elle a bien été remontée, et la phrase peut quand même ne pas s’y trouver. Nelson Liu, Tianyi Zhang et Percy Liang ont audité quatre moteurs de réponse en 2023 : 51,5 % seulement des phrases produites étaient entièrement étayées par leurs citations. Une citation est une piste, pas une preuve.
  • « Les fenêtres d’un million de tokens rendent le RAG inutile. » Elles déplacent le seuil sans le supprimer. En dessous de 200 000 tokens, environ 500 pages, Anthropic recommande de tout coller dans le prompt. Au-dessus, un corpus d’entreprise se compte en centaines de milliers de pages, on le paierait en entier à chaque question, et la qualité se dégrade bien avant la saturation — voir la fiche Fenêtre de contexte.

Voir aussi