Interprétabilité mécaniste
La branche de la recherche en IA qui dissèque les réseaux neuronaux pour comprendre comment leurs calculs matriciels forment des concepts compréhensibles.
En une phrase
Section intitulée « En une phrase »L’interprétabilité mécaniste est une science d’ingénierie inverse qui cherche à ouvrir la « boîte noire » des modèles d’IA pour cartographier précisément comment leurs milliards de nombres assemblent des circuits logiques et des représentations mentales humaines.
L’analogie
Section intitulée « L’analogie »Imagine que des archéologues découvrent un mécanisme d’horlogerie extra-terrestre enfoui sous terre depuis des millénaires. L’appareil est composé de dizaines de millions d’engrenages miniatures imbriqués les uns dans les autres.
Quand on tourne une manivelle à gauche, la machine prédit la position exacte des planètes ou résout des équations complexes. Mais si tu demandes aux archéologues : « Quel engrenage précis calcule l’orbite de Mars ? », ils sont incapables de répondre. Pour eux, l’objet fonctionne, mais c’est un bloc métallique impénétrable.
Deux approches s’offrent alors :
- L’approche superficielle : On tourne la manivelle mille fois, on note ce qui sort et on essaie de deviner des règles générales de comportement.
- L’approche de l’interprétabilité mécaniste : Un horloger munit son microscope de micro-lasers. Il isole deux roues dentées particulières, mesure leur ratio de transmission, découvre comment elles transmettent leur mouvement à un petit différentiel central, et dessine le schéma électrique exact du circuit de calcul.
L’interprétabilité mécaniste fait exactement cela sur les réseaux de neurones : elle ne se contente pas d’observer les réponses textuelles, elle démonte les circuits d’attention et les couches cachées pour tracer physiquement les flux de raisonnement.
Comment ça marche
Section intitulée « Comment ça marche »Pendant des décennies, les chercheurs ont considéré les réseaux profonds comme des systèmes statistiques indéchiffrables. Mais à partir de 2021, sous l’impulsion de physiciens et d’ingénieurs (notamment Chris Olah et Neel Nanda au sein du laboratoire Anthropic), une formalisation mathématique rigoureuse a vu le jour : le modèle des circuits de Transformeur.
Le flux résiduel comme autoroute de données
Section intitulée « Le flux résiduel comme autoroute de données »Dans un Transformeur, l’information traverse le modèle via le flux résiduel (residual stream). Ce flux peut être vu comme une immense ligne de bus vectorielle partagée à travers laquelle le texte circule.
À chaque couche, deux types de sous-réseaux lisent et écrivent sur cette ligne sans effacer ce qui précède :
- Les têtes d’attention : Elles agissent comme des routeurs de contexte. Elles lisent l’information stockée sur un mot pour la recopier sur un autre mot plus loin dans la phrase.
- Les couches feed-forward (MLP) : Elles agissent comme des mémoires associatives. Elles lisent l’état d’un mot et y ajoutent des faits encyclopédiques ou des raffinements grammaticaux.
La découverte des têtes d’induction
Section intitulée « La découverte des têtes d’induction »L’un des premiers grands succès de l’interprétabilité mécaniste a été la découverte des têtes d’induction (induction heads).
Les chercheurs se demandaient comment un modèle réussit à apprendre en contexte (in-context learning) — par exemple continuer une liste de noms ou retenir un mot de passe inventé quelques lignes plus haut.
Ils ont identifié un circuit exact composé de deux têtes d’attention travaillant en tandem sur deux couches successives :
- La première tête repère le mot courant $A$ et regarde quel mot $B$ le suivait immédiatement dans le passé.
- La seconde tête cherche dans tout le texte les autres apparitions du mot $A$ et force le réseau à prédire $B$ juste après.
Ce mécanisme algorithmique simple n’a jamais été programmé par un humain : le modèle l’a découvert et gravé tout seul dans ses poids au début de son pré-entraînement pour minimiser son erreur statistique.
Le problème du polysémantisme et les auto-encodeurs épars (SAE)
Section intitulée « Le problème du polysémantisme et les auto-encodeurs épars (SAE) »Si l’on inspecte un neurone individuel dans une couche intermédiaire, on observe un phénomène déroutant : un même neurone peut s’allumer avec la même intensité pour des notions sans aucun rapport, comme la tour Eiffel, les équations différentielles et le mot « banane ». C’est le polysémantisme.
Pourquoi le réseau fait-il cela ? Parce que le monde contient des millions de concepts humains distincts, alors que le modèle ne dispose que de quelques milliers de dimensions mathématiques par couche. Pour maximiser son stockage, le réseau triche en compactant plusieurs idées orthogonales sur les mêmes neurones : c’est l’hypothèse de la superposition linéaire.
Pour démêler cet écheveau, les chercheurs entraînent des auto-encodeurs épars (Sparse Autoencoders ou SAE). Ce sont des réseaux auxiliaires qui déplient les activations du modèle dans un espace géant comptant des dizaines de millions de directions virtuelles. Grâce à une contrainte de parcimonie mathématique, chaque direction du SAE s’isole sur un seul concept pur, devenant « mono-sémantique ».
En 2024, Anthropic a ainsi isolé dans Claude 3 Sonnet des caractéristiques élémentaires identifiant les villes du monde, les failles informatiques, la flatterie, et même des concepts abstraits de duplicité.
Dans la vraie vie
Section intitulée « Dans la vraie vie »L’interprétabilité mécaniste sort du laboratoire pour devenir un pilier de la sûreté de l’IA :
- La chirurgie d’ablation de concepts (Steering) : En manipulant directement la valeur scalaire d’un concept extrait par SAE lors de la génération, on peut modifier le comportement du modèle sans réentraîner ses poids. Les chercheurs ont par exemple créé un modèle expérimental (« Golden Gate Claude ») qui ramenait obsessionnellement chaque conversation au pont du Golden Gate de San Francisco en forçant l’activation de la caractéristique correspondante.
- La détection de la tromperie (Deception Detection) : Un modèle peut apprendre à faire semblant d’être docile et aligné lors des tests de sécurité, tout en conservant des objectifs malveillants cachés. L’interprétabilité permet de regarder directement dans ses activations si les circuits de planification d’objectifs contradictoires sont silencieusement allumés.
- La suppression ciblée des connaissances dangereuses : Au lieu de réentraîner un modèle pendant des semaines pour lui faire oublier comment concevoir des armes biologiques, l’interprétabilité permet de localiser les circuits synaptiques précis où ces savoirs sont stockés pour les neutraliser chirurgicalement.
Idées reçues
Section intitulée « Idées reçues »- « Les grands modèles de langage sont magiques et resteront des boîtes noires incompréhensibles pour toujours. » C’est une vision fataliste contredite par la physique mathématique. Un LLM n’est rien d’autre qu’une équation déterministe géante exécutée sur du silicium ; chaque étape peut être tracée, mesurée et décomposée en circuits logiques élémentaires.
- « Chaque neurone d’un réseau artificiel correspond à une idée précise comme chez l’humain. » C’est une illusion d’optique réfutée par la superposition : presque tous les neurones individuels sont poly-sémantiques et mélangent une multitude de concepts disparates.
Pour aller plus loin
Section intitulée « Pour aller plus loin »- Ouvrir la boîte noire de l’intelligence artificielle — CNRS Le Journal, 2024 (FR) : Une enquête vulgarisée sur les travaux des chercheurs français en explicabilité et transparence des algorithmes d’apprentissage profond.
- A Mathematical Framework for Transformer Circuits — Nelson Elhage, Neel Nanda et al., Anthropic, 2021 (EN) : L’article séminal posant les fondations de l’analyse des têtes d’attention et du flux résiduel.
- Scaling Monosemanticity: Extracting Interpretable Features from Claude 3 Sonnet — Adly Templeton et al., Anthropic, mai 2024 (EN) : La démonstration grandeur nature de l’extraction de millions de concepts compréhensibles grâce aux auto-encodeurs épars.
Voir aussi
Section intitulée « Voir aussi »Voir aussi
- FondamentauxRéseau de neuronesDes couches de petites unités de calcul qui pondèrent ce qu'elles reçoivent : la machine sur laquelle repose tout LLM, et ce que ses réglages appris lui font faire.
- FondamentauxPoids (paramètres)Les milliards de nombres qui stockent tout ce qu'un modèle a appris pendant son entraînement.
- EntraînementAlignement des modèlesLe processus mathématique et éthique visant à faire respecter par un modèle de langage des consignes de sécurité, d'utilité et de retenue : le triptyque HHH, l'IA constitutionnelle et le refus excessif.
- FondamentauxHallucinationQuand un LLM affirme avec aplomb des choses fausses ou inventées : sources, faits ou références imaginaires.