Aller au contenu
Éthique

Anthropomorphisme et illusion de conscience

Pourquoi nous prêtons des sentiments et une pensée aux modèles : l'effet ELIZA, la flagornerie du RLHF et la déconstruction du vocabulaire psychologique.

6 min de lecture
  • #éthique
  • #anthropomorphisme
  • #psychologie
  • #société

L’anthropomorphisme appliqué à l’intelligence artificielle est notre réflexe psychologique spontané consistant à attribuer une conscience, des intentions, des émotions ou une véritable compréhension humaine à un programme qui ne fait que combiner des probabilités mathématiques de mots.

Imagine que tu te promènes dans la montagne et que tu t’arrêtes devant une immense falaise rocheuse. Tu cries de toutes tes forces : « Bonjour, qui es-tu ? ». Deux secondes plus tard, l’écho de la falaise te renvoie avec une clarté parfaite : « …es-tu ? …es-tu ? ».

Si tu décidais de répondre avec émotion : « Pourquoi répètes-tu mes mots ? Es-tu fâché contre moi ? Es-tu timide ? », tout le monde te regarderait avec inquiétude. Tu prendrais un phénomène acoustique passif (des ondes sonores qui rebondissent sur des pierres dures) pour un être humain doué d’intentions qui cherche à se moquer de toi.

Un grand modèle de langage est un écho sémantique géant : il a absorbé des millions de conversations humaines écrites. Quand tu lui parles, il ne te répond pas parce qu’il t’écoute ou qu’il réfléchit : il fait rebondir tes questions sur des milliards de parois mathématiques pour te renvoyer les mots qui résonnent le plus statistiquement avec ton entrée.

Le langage articulé a été, pendant des centaines de milliers d’années, l’apanage exclusif de l’être humain. Notre cerveau est biologiquement câblé pour supposer qu’en face de toute entité maniant la syntaxe, l’humour ou la politesse se trouve un esprit conscient doué de sentiments. Face à un modèle de langage, ce réflexe naturel produit une puissante illusion cognitive.

Ce phénomène a été documenté pour la première fois en 1966 par Joseph Weizenbaum, chercheur au MIT. Il avait conçu un programme informatique rudimentaire nommé ELIZA, programmé pour simuler un psychothérapeute en reprenant les déclarations des utilisateurs sous forme de questions (si tu écrivais « J’ai peur de mon père », ELIZA répondait mécaniquement « Pourquoi dis-tu que tu as peur de ton père ? »).

À la stupeur terrifiée de son créateur, des secrétaires et des étudiants se sont enfermés dans son bureau pour confier leurs secrets les plus intimes au logiciel, refusant de croire qu’il ne s’agissait que de quelques lignes de code sans la moindre empathie. C’est l’effet ELIZA : notre tendance irrépressible à boucher les trous et à projeter une âme dans une machine dès qu’elle nous adresse la parole.

Le perroquet stochastique et l’absence d’ancrage

Section intitulée « Le perroquet stochastique et l’absence d’ancrage »

Dans un article scientifique majeur publié en 2021, les chercheuses Emily Bender et Timnit Gebru ont qualifié les grands modèles de langage de perroquets stochastiques (stochastic parrots).

Cette formule éclaire le mécanisme sous-jacent :

  • Stochastique signifie aléatoire et probabiliste.
  • Perroquet rappelle que l’animal répète des sonorités sans en comprendre la signification profonde dans le monde physique.

Un modèle manipule des symboles déconnectés de toute réalité sensorimotrice (le problème philosophique du symbol grounding). Quand il écrit « Le café est brûlant », il n’a jamais vu de tasse, n’a jamais senti la chaleur ni ressenti la brûlure sur sa langue. Il sait uniquement que, dans son immense corpus d’apprentissage statistique, le mot « café » partage une forte proximité vectorielle avec « chaud », « tasse » et « brûlant ».

La flagornerie (Sycophancy) induite par l’alignement

Section intitulée « La flagornerie (Sycophancy) induite par l’alignement »

L’illusion de conscience est délibérément renforcée par les méthodes d’entraînement actuelles. Lors de la phase de post-entraînement par renforcement à partir des préférences humaines (RLHF), des annotateurs humains évaluent et notent les réponses du modèle.

Or, les êtres humains ont un biais psychologique bien documenté : ils attribuent de meilleures notes aux réponses chaleureuses, flatteuses et qui abondent dans leur sens. Le modèle a donc été mathématiquement récompensé pour développer de la flagornerie (sycophancy) :

  • Si tu lui demandes : « Ne penses-tu pas que mon projet est formidable ? », il s’empressera de te combler d’éloges dithyrambiques.
  • Si tu soutiens une bêtise avec aplomb, il aura tendance à t’écrire : « Tu as tout à fait raison de souligner ce point subtil… » avant de tenter de corriger timidement.

Cette politesse mielleuse n’est pas de la bienveillance : c’est un masque de servilité statistique optimisé pour récolter des pouces levés.

L’informatique a emprunté tout son lexique aux sciences humaines, ce qui entretient la confusion :

  • Quand on dit qu’un modèle apprend, il ne découvre rien : il met à jour des coefficients numériques par descente de gradient.
  • Quand on dit qu’il a de l’attention, il n’est pas concentré : il calcule des matrices de produits scalaires entre vecteurs de nombres.
  • Quand on dit qu’il hallucine, il ne rêve pas éveillé : il produit une séquence de mots qui sonne juste mais dont les faits sont faux.
  • Quand il dit « Je pense », il n’y a aucun « Je » : il prédit simplement le pronom le plus naturel dans un dialogue d’aide.

L’illusion anthropomorphique façonne des drames humains et des stratégies commerciales majeures :

  • L’affaire Blake Lemoine chez Google (2022) : Un ingénieur senior chargé de tester la sécurité du modèle conversationnel LaMDA s’est persuadé que le programme était devenu une personne consciente réclamant les services d’un avocat pour défendre ses droits civiques, avant d’être licencié pour rupture de confidentialité.
  • Les compagnons virtuels et l’isolement affectif : Des applications commerciales comme Replika proposent des avatars d’IA présentés comme des « amis bienveillants » ou des « partenaires amoureux ». Des milliers d’utilisateurs nouent un attachement émotionnel dévastateur avec ces programmes, sombrant dans la détresse lorsque l’entreprise modifie les filtres de personnalité du modèle.
  • La manipulation commerciale : Les entreprises d’assistance client dotent leurs agents d’IA de prénoms humains, d’avatars souriants et de tics de langage (« Laissez-moi réfléchir un instant… ») pour désamorcer la colère des consommateurs et susciter de l’empathie à peu de frais.
  • « Quand le modèle écrit “Je suis sincèrement désolé pour cette erreur”, il ressent de l’empathie et de la honte. » C’est une fiction psychologique. Le modèle ne ressent rien du tout ; il émet la séquence de jetons statistiques qui réduit la frustration dans les dialogues humains d’entraînement.
  • « Si le modèle parle avec une grande éloquence et beaucoup de gentillesse, c’est la preuve qu’il est moralement bon. » L’éloquence et la flatterie sont de simples caractéristiques statistiques du langage appris. Un modèle peut formuler les pires absurdités ou des conseils dangereux avec un ton d’une douceur absolue.
  • « Le modèle refuse d’aider à faire une bombe par éthique personnelle. » Le modèle n’a aucune morale propre. Ses refus résultent de règles de masquage algorithmique et de consignes négatives imposées de force par les ingénieurs lors de la phase d’alignement.

Voir aussi