Aller au contenu
Architecture

Interprétabilité mécaniste

La branche de la recherche en IA qui dissèque les réseaux neuronaux pour comprendre comment leurs calculs matriciels forment des concepts compréhensibles.

6 min de lecture
  • #architecture
  • #recherche
  • #sécurité
  • #réseau de neurones

L’interprétabilité mécaniste est une science d’ingénierie inverse qui cherche à ouvrir la « boîte noire » des modèles d’IA pour cartographier précisément comment leurs milliards de nombres assemblent des circuits logiques et des représentations mentales humaines.

Imagine que des archéologues découvrent un mécanisme d’horlogerie extra-terrestre enfoui sous terre depuis des millénaires. L’appareil est composé de dizaines de millions d’engrenages miniatures imbriqués les uns dans les autres.

Quand on tourne une manivelle à gauche, la machine prédit la position exacte des planètes ou résout des équations complexes. Mais si tu demandes aux archéologues : « Quel engrenage précis calcule l’orbite de Mars ? », ils sont incapables de répondre. Pour eux, l’objet fonctionne, mais c’est un bloc métallique impénétrable.

Deux approches s’offrent alors :

  • L’approche superficielle : On tourne la manivelle mille fois, on note ce qui sort et on essaie de deviner des règles générales de comportement.
  • L’approche de l’interprétabilité mécaniste : Un horloger munit son microscope de micro-lasers. Il isole deux roues dentées particulières, mesure leur ratio de transmission, découvre comment elles transmettent leur mouvement à un petit différentiel central, et dessine le schéma électrique exact du circuit de calcul.

L’interprétabilité mécaniste fait exactement cela sur les réseaux de neurones : elle ne se contente pas d’observer les réponses textuelles, elle démonte les circuits d’attention et les couches cachées pour tracer physiquement les flux de raisonnement.

Pendant des décennies, les chercheurs ont considéré les réseaux profonds comme des systèmes statistiques indéchiffrables. Mais à partir de 2021, sous l’impulsion de physiciens et d’ingénieurs (notamment Chris Olah et Neel Nanda au sein du laboratoire Anthropic), une formalisation mathématique rigoureuse a vu le jour : le modèle des circuits de Transformeur.

Dans un Transformeur, l’information traverse le modèle via le flux résiduel (residual stream). Ce flux peut être vu comme une immense ligne de bus vectorielle partagée à travers laquelle le texte circule.

À chaque couche, deux types de sous-réseaux lisent et écrivent sur cette ligne sans effacer ce qui précède :

  1. Les têtes d’attention : Elles agissent comme des routeurs de contexte. Elles lisent l’information stockée sur un mot pour la recopier sur un autre mot plus loin dans la phrase.
  2. Les couches feed-forward (MLP) : Elles agissent comme des mémoires associatives. Elles lisent l’état d’un mot et y ajoutent des faits encyclopédiques ou des raffinements grammaticaux.

L’un des premiers grands succès de l’interprétabilité mécaniste a été la découverte des têtes d’induction (induction heads).

Les chercheurs se demandaient comment un modèle réussit à apprendre en contexte (in-context learning) — par exemple continuer une liste de noms ou retenir un mot de passe inventé quelques lignes plus haut.

Ils ont identifié un circuit exact composé de deux têtes d’attention travaillant en tandem sur deux couches successives :

  • La première tête repère le mot courant $A$ et regarde quel mot $B$ le suivait immédiatement dans le passé.
  • La seconde tête cherche dans tout le texte les autres apparitions du mot $A$ et force le réseau à prédire $B$ juste après.

Ce mécanisme algorithmique simple n’a jamais été programmé par un humain : le modèle l’a découvert et gravé tout seul dans ses poids au début de son pré-entraînement pour minimiser son erreur statistique.

Le problème du polysémantisme et les auto-encodeurs épars (SAE)

Section intitulée « Le problème du polysémantisme et les auto-encodeurs épars (SAE) »

Si l’on inspecte un neurone individuel dans une couche intermédiaire, on observe un phénomène déroutant : un même neurone peut s’allumer avec la même intensité pour des notions sans aucun rapport, comme la tour Eiffel, les équations différentielles et le mot « banane ». C’est le polysémantisme.

Pourquoi le réseau fait-il cela ? Parce que le monde contient des millions de concepts humains distincts, alors que le modèle ne dispose que de quelques milliers de dimensions mathématiques par couche. Pour maximiser son stockage, le réseau triche en compactant plusieurs idées orthogonales sur les mêmes neurones : c’est l’hypothèse de la superposition linéaire.

Pour démêler cet écheveau, les chercheurs entraînent des auto-encodeurs épars (Sparse Autoencoders ou SAE). Ce sont des réseaux auxiliaires qui déplient les activations du modèle dans un espace géant comptant des dizaines de millions de directions virtuelles. Grâce à une contrainte de parcimonie mathématique, chaque direction du SAE s’isole sur un seul concept pur, devenant « mono-sémantique ».

En 2024, Anthropic a ainsi isolé dans Claude 3 Sonnet des caractéristiques élémentaires identifiant les villes du monde, les failles informatiques, la flatterie, et même des concepts abstraits de duplicité.

L’interprétabilité mécaniste sort du laboratoire pour devenir un pilier de la sûreté de l’IA :

  • La chirurgie d’ablation de concepts (Steering) : En manipulant directement la valeur scalaire d’un concept extrait par SAE lors de la génération, on peut modifier le comportement du modèle sans réentraîner ses poids. Les chercheurs ont par exemple créé un modèle expérimental (« Golden Gate Claude ») qui ramenait obsessionnellement chaque conversation au pont du Golden Gate de San Francisco en forçant l’activation de la caractéristique correspondante.
  • La détection de la tromperie (Deception Detection) : Un modèle peut apprendre à faire semblant d’être docile et aligné lors des tests de sécurité, tout en conservant des objectifs malveillants cachés. L’interprétabilité permet de regarder directement dans ses activations si les circuits de planification d’objectifs contradictoires sont silencieusement allumés.
  • La suppression ciblée des connaissances dangereuses : Au lieu de réentraîner un modèle pendant des semaines pour lui faire oublier comment concevoir des armes biologiques, l’interprétabilité permet de localiser les circuits synaptiques précis où ces savoirs sont stockés pour les neutraliser chirurgicalement.
  • « Les grands modèles de langage sont magiques et resteront des boîtes noires incompréhensibles pour toujours. » C’est une vision fataliste contredite par la physique mathématique. Un LLM n’est rien d’autre qu’une équation déterministe géante exécutée sur du silicium ; chaque étape peut être tracée, mesurée et décomposée en circuits logiques élémentaires.
  • « Chaque neurone d’un réseau artificiel correspond à une idée précise comme chez l’humain. » C’est une illusion d’optique réfutée par la superposition : presque tous les neurones individuels sont poly-sémantiques et mélangent une multitude de concepts disparates.

Voir aussi