Aller au contenu
Fondamentaux

Hallucination

Quand un LLM affirme avec aplomb des choses fausses ou inventées : sources, faits ou références imaginaires.

7 min de lecture
  • #fiabilité
  • #limites
  • #sécurité

Une hallucination, c’est quand un modèle de langage affirme avec aplomb quelque chose de faux ou d’inventé — un fait, une date, une citation, une référence qui n’existe pas — sans que rien, dans la façon dont c’est écrit, ne le distingue d’une bonne réponse.

Tu connais sûrement quelqu’un qui répond toujours, même quand il ne sait pas. Plutôt que d’admettre « aucune idée », il improvise quelque chose qui sonne juste, dit avec assez d’assurance pour que tu n’aies pas envie d’en douter. Sauf que le nom du restaurant, la date de la bataille ou la référence de l’article… n’existent pas.

Un modèle de langage fait la même chose, à une différence près, et elle est décisive : lui ne bluffe pas. Il n’a aucun moyen de savoir qu’il est en train d’improviser. Écrire une phrase vraie et écrire une phrase fausse, pour lui, c’est exactement le même geste.

Un modèle ne range aucun fait quelque part. Tout ce qu’il « sait » tient dans ses poids, ces milliards de nombres fixés une fois pour toutes à la fin de l’entraînement, et qui encodent des régularités statistiques plutôt que des phrases classées dans un tiroir. Il n’y a donc rien à consulter : au moment de répondre, le modèle ne va pas chercher une information, il continue un texte. La CNIL le formule sobrement : les modèles génératifs « ne sont pas des bases de connaissance », ils « obéissent à une logique probabiliste ».

Ce que le modèle optimise, c’est la plausibilité de la suite, jamais sa véracité. Les deux coïncident très souvent — c’est précisément ce qui rend l’outil utile — mais ce sont deux critères distincts, et rien dans la machine ne mesure le second.

En 2022, une équipe emmenée par Nikhil Kandpal a mesuré le lien entre la justesse d’un modèle sur une question factuelle et le nombre de documents d’entraînement qui traitent du sujet. Le résultat est net : plus un fait est répété sur le web, mieux il est retenu. Sur ceux qui n’apparaissent qu’une poignée de fois — la date de naissance d’un chercheur, le titre exact d’une thèse — il ne reste rien de solide dans les poids, et le modèle comble le vide avec ce qui ressemble le plus à une réponse.

Les auteurs estiment qu’il faudrait agrandir les modèles de plusieurs ordres de grandeur pour rattraper ce retard sur les faits rares. Autrement dit : ce n’est pas la génération suivante de modèles qui réglera le problème.

En 2025, une équipe menée par Adam Kalai a proposé une explication en deux temps. Au pré-entraînement d’abord : si un énoncé faux est indiscernable d’un énoncé vrai dans les données, alors un système entraîné à produire la suite la plus probable produira mécaniquement des énoncés faux. Le problème se ramène à une erreur de tri entre deux catégories, et il n’a rien de mystérieux.

Après l’entraînement ensuite, et c’est le plus contre-intuitif : la plupart des évaluations notent en tout ou rien. Une bonne réponse rapporte un point, une mauvaise réponse zéro… et « je ne sais pas » zéro aussi. Tenter sa chance rapporte donc toujours plus, en moyenne, que s’abstenir. Le modèle n’est jamais récompensé pour sa prudence : on l’entraîne, littéralement, à être un bon candidat de QCM.

La grande revue de littérature publiée par Lei Huang et ses co-auteurs en 2023 sépare deux phénomènes qu’on met souvent dans le même sac :

  • La factualité — le texte contredit le monde réel : mauvaise entité, mauvaise relation, ou référence purement fabriquée.
  • La fidélité — le texte contredit ce qu’on vient de lui donner : la consigne, un document fourni, ou ses propres phrases précédentes.

La distinction compte, parce que les deux ne se réparent pas de la même façon. Et la seconde rappelle une limite déjà croisée : ce qui entre dans la fenêtre de contexte, l’espace de texte que le modèle a sous les yeux au moment de répondre, est lu, pas vérifié. Un modèle peut parfaitement contredire le document que tu viens de lui coller.

  • Le RAG : aller chercher les documents pertinents et les glisser dans la fenêtre au moment de la question, pour que la réponse s’appuie sur du texte réel plutôt que sur la mémoire des poids.
  • Le prompt : autoriser explicitement « je ne sais pas », réclamer les sources, découper une question complexe en étapes.
  • La relecture humaine : le dernier filtre, et le seul qui vérifie vraiment.

Aucune de ces parades ne ferme le robinet. En 2024, une équipe de Stanford a testé les outils de recherche juridique vendus comme exempts d’hallucination — Lexis+ AI, Westlaw AI-Assisted Research — sur plus de 200 questions déposées à l’avance pour éviter tout tri après coup. Ces outils reposent sur du RAG, et ils hallucinent encore sur 17 à 33 % des requêtes selon l’outil. Le RAG divise le problème, il ne l’annule pas.

  • Mata contre Avianca, New York, 2023. Un avocat, Steven Schwartz, dépose un mémoire citant six décisions de justice. Aucune n’existe : elles sortent de ChatGPT. Le détail décisif, c’est qu’il avait demandé à l’outil si ces affaires étaient réelles, et que l’outil avait confirmé — la vérification passait par la machine qui venait d’inventer. Le 22 juin 2023, le juge P. Kevin Castel sanctionne les deux avocats et leur cabinet de 5 000 dollars.
  • Ce n’est pas resté une anecdote. Damien Charlotin, chercheur à HEC Paris, tient depuis 2025 une base des décisions où un tribunal a constaté l’usage de contenu halluciné : près de 2 000 affaires y étaient recensées en août 2026, dans plusieurs pays.
  • Demande la bibliographie d’un sujet de niche, puis vérifie chaque référence une par une : certaines auront un titre crédible, des auteurs crédibles, et n’existeront pas.
  • Toute question sur un événement postérieur à l’entraînement tombe dans l’angle mort des poids figés. La réponse est une reconstruction plausible, pas un fait.
  • C’est la raison n°1 pour laquelle la santé, le droit et la finance exigent une source vérifiable et une relecture humaine.
  • « L’hallucination est un bug, on finira par le corriger. » C’est une propriété du procédé, pas un défaut greffé dessus : la même mécanique produit les bonnes et les mauvaises réponses. Trois chercheurs de Singapour, Ziwei Xu, Sanjay Jain et Mohan Kankanhalli, en ont donné en 2024 une démonstration formelle, dans un cadre simplifié : un modèle utilisé comme résolveur de problèmes général ne peut pas tout apprendre, donc il se trompera. On fait baisser le taux, on ne le met pas à zéro.
  • « Si le modèle cite une source, c’est qu’elle existe. » La source est du texte comme le reste : titre, auteurs, année et identifiant peuvent être fabriqués ensemble et tenir parfaitement debout. Et redemander confirmation au même modèle ne prouve rien, l’affaire Mata l’a montré.
  • « Quand il hallucine, le modèle ment. » Mentir suppose de connaître la vérité et de choisir autre chose. Ici il n’y a ni intention ni conscience de l’écart. C’est d’ailleurs pourquoi une partie des chercheurs, dont Emily Bender et Timnit Gebru avec leur image du « perroquet stochastique », trouvent le mot « hallucination » mal choisi : il suggère une perception qui déraille, alors que rien n’a déraillé.

Voir aussi