Architectures alternatives au Transformer
Les modèles à espace d'états (Mamba), l'attention linéaire et les réseaux récurrents modernes conçus pour briser le mur de calcul quadratique du Transformeur.
En une phrase
Section intitulée « En une phrase »Les architectures alternatives sont de nouvelles structures de réseaux neuronaux — comme Mamba ou les modèles à espace d’états — conçues pour traiter des textes de plusieurs millions de mots à coût constant, sans subir l’explosion de calcul du Transformeur classique.
L’analogie
Section intitulée « L’analogie »Imagine que tu doives rédiger un compte rendu d’une réunion marathon qui a duré dix heures consécutives. Deux méthodes de travail radicalement opposées s’offrent à toi :
- La méthode du Transformeur classique (L’archiviste minutieux) : À chaque nouvelle phrase prononcée par un intervenant, l’archiviste relit l’intégralité de toutes les notes prises depuis la première seconde de la réunion. Plus la journée avance, plus chaque nouveau mot lui demande un temps de relecture colossal. Au bout de dix heures, son bureau croule sous une montagne de classeurs (le cache mémoire KV), et ajouter une seule phrase prend un temps déraisonnable.
- La méthode de l’architecture alternative (Le secrétaire au carnet de bord) : Le secrétaire ne relit jamais tout depuis le début. Il tient à la main un petit carnet de bord d’épaisseur fixe (l’état caché). À chaque parole prononcée, il écoute, raye un détail devenu inutile, met à jour un chiffre clé dans sa synthèse, et tourne la page. Que la réunion dure dix minutes ou dix jours, le temps qu’il passe sur chaque mot reste strictement le même, et son bureau ne déborde jamais.
Les architectures alternatives comme Mamba fonctionnent exactement comme ce secrétaire : elles compriment l’information au vol dans une mémoire de taille fixe, rendant le traitement des très longues séquences fluide et instantané.
Comment ça marche
Section intitulée « Comment ça marche »Depuis 2017, l’architecture du Transformeur domine sans partage le monde de l’intelligence artificielle grâce à son mécanisme d’attention croisée. Mais cette hégémonie se paie au prix d’un goulot d’étranglement physique infranchissable : la complexité quadratique $O(N^2)$.
Le piège du calcul quadratique
Section intitulée « Le piège du calcul quadratique »Pour calculer l’attention entre les mots, le Transformeur compare chaque token à tous les tokens précédents via la multiplication matricielle $QK^T$ :
- Si la conversation fait 1 000 tokens, le modèle réalise 1 million de comparaisons.
- Si la conversation s’étend à 100 000 tokens, le nombre de comparaisons bondit à 10 milliards.
- Si l’on vise 1 million de tokens (la taille d’un code source complet ou d’une saison entière de série vidéo), le calcul explose à 1 000 milliards d’opérations à chaque nouveau token généré.
De plus, pour ne pas recalculer les étapes précédentes, les serveurs doivent stocker toutes les clés et valeurs passées dans une mémoire vive ultra-rapide appelée le KV Cache. Sur de très longues fenêtres, ce cache mémoire sature même les GPU les plus puissants du marché.
Les modèles à espace d’états structurés (SSM & Mamba)
Section intitulée « Les modèles à espace d’états structurés (SSM & Mamba) »Pour échapper à cette fatalité mathématique, les chercheurs Albert Gu et Tri Dao ont réintroduit en 2023 les principes de la théorie du contrôle et des systèmes dynamiques linéaires avec l’architecture Mamba.
Un modèle à espace d’états (SSM) s’appuie sur une équation différentielle continue discrétisée pour l’ordinateur :
hₜ = Ā · hₜ₋₁ + B̄ · xₜ et yₜ = C · hₜ
Cette formulation procure à Mamba un « super-pouvoir » à double facette :
- À l’entraînement (La forme convolutive) : L’équation peut être déroulée en parallèle sur l’ensemble de la séquence comme une convolution géante. Le modèle s’entraîne à pleine vitesse sur les puces GPU en temps quasi-linéaire $O(N \log N)$, éliminant la lenteur historique des anciens réseaux récurrents (RNN).
- À l’inférence (La forme récurrente) : Pour générer du texte, le modèle n’a besoin que du vecteur de mémoire interne $h_t$ de taille fixe. Il n’a aucun KV cache à faire grossir : le temps de calcul par mot est en $O(1)$ constant, et l’empreinte mémoire ne change jamais, que l’historique contienne dix mots ou un million.
Le coup de génie de Mamba réside dans son mécanisme de sélection sélective (Selective State Space) : les matrices de mémoire s’ajustent dynamiquement en fonction du contenu de chaque mot, permettant au réseau de décider d’ignorer les mots de liaison insignifiants pour ne conserver que les données vitales dans sa mémoire condensée.
Les architectures hybrides (Jamba)
Section intitulée « Les architectures hybrides (Jamba) »Si Mamba est imbattable sur la vitesse et la consommation mémoire, l’attention du Transformeur conserve un avantage théorique précieux : la capacité de retrouver une aiguille textuelle exacte enfouie au milieu d’une botte de foin d’un million de mots (needle in a haystack). En effet, une mémoire compressée de taille fixe finit inévitablement par flouter les détails minuscules.
C’est pourquoi la tendance industrielle s’oriente vers des architectures hybrides, comme Jamba (conçu par AI21 Labs en 2024). Jamba empile des blocs alternés : une couche d’attention classique toutes les sept ou huit couches Mamba, couplée à un mélange d’experts (MoE). Ce compromis réunit le meilleur des deux mondes : le débit ultra-rapide des SSM et la mémoire photographique absolue du Transformeur.
Dans la vraie vie
Section intitulée « Dans la vraie vie »Les architectures alternatives ouvrent des perspectives inédites dans les domaines où les données sont trop volumineuses pour le Transformeur :
- La génomique et l’analyse de l’ADN : Une molécule d’ADN humain contient des milliards de paires de bases. Des modèles fondés sur Mamba (comme Caduceus) peuvent analyser des séquences génétiques de centaines de milliers de nucléotides d’un seul bloc pour repérer des mutations génétiques sans saturer la mémoire des laboratoires.
- Le traitement de l’audio continu et de la musique : Les signaux sonores bruts comportent 44 100 échantillons par seconde. Les architectures à espace d’états permettent de synthétiser des heures de voix ou d’orchestrations musicales avec une cohérence rythmique parfaite sur le long terme.
- Les assistants embarqués à mémoire infinie : Sur des appareils personnels ou des robots autonomes, un modèle Mamba peut écouter et retenir des journées entières de conversations sans que sa mémoire vive ne déborde jamais.
Idées reçues
Section intitulée « Idées reçues »- « Le Transformeur est indéboulonnable et restera la seule architecture d’IA jusqu’à la fin des temps. » L’histoire de l’informatique montre qu’aucun algorithme ne survit à une complexité quadratique sur des données massives. Mamba et les architectures hybrides prouvent qu’une alternative linéaire mathématiquement viable existe.
- « Une architecture comme Mamba retient une quantité infinie de détails parfaits sans rien oublier. » C’est une impossibilité mathématique (théorème de compression de l’information). Une mémoire de taille fixe est contrainte de résumer ; sur des tâches d’extraction littérale brute sur de très longs textes, l’attention pure reste plus fidèle.
Pour aller plus loin
Section intitulée « Pour aller plus loin »- Mamba : repenser l’architecture des modèles de langue — Inria, 2024 (FR) : Une synthèse analytique des équipes de recherche françaises sur les alternatives linéaires au Transformeur.
- Mamba: Linear-Time Sequence Modeling with Selective State Spaces — Albert Gu et Tri Dao, 2023 (EN) : L’article de recherche séminal décrivant l’algorithme Mamba et son noyau matériel optimisé pour GPU.
- RWKV: Reinventing RNNs for the Transformer Era — Bo Peng et al., 2023 (EN) : L’architecture alternative combinant la parallélisation d’entraînement des transformeurs et l’inférence légère en mémoire constante des RNN.
Voir aussi
Section intitulée « Voir aussi »Voir aussi
- FondamentauxFenêtre de contexteLa quantité maximale de texte qu'un modèle peut prendre en compte d'un coup : sa « mémoire de travail ».
- FondamentauxInférenceLe moment où le modèle tourne pour de vrai : la boucle qui écrit le texte, un token à la fois, par opposition à l'entraînement où il apprend.
- ÉcosystèmeCoût (tarification)Ce que coûte vraiment une réponse de modèle : des tokens facturés à l'entrée et à la sortie, des remises, des pièges, et le prix du matériel quand on l'héberge soi-même.
- ArchitectureMélange d'experts (MoE)Une architecture où chaque token ne passe que par quelques sous-réseaux choisis parmi beaucoup : le modèle grossit sans que chaque mot coûte plus cher à calculer.