Aller au contenu
Architecture

Mélange d'experts (MoE)

Une architecture où chaque token ne passe que par quelques sous-réseaux choisis parmi beaucoup : le modèle grossit sans que chaque mot coûte plus cher à calculer.

7 min de lecture
  • #architecture
  • #MoE
  • #routeur
  • #paramètres actifs

Un mélange d’experts, ou mixture of experts (MoE), est un modèle dont une partie est découpée en nombreux sous-réseaux, les experts, et où chaque token n’en consulte qu’une poignée, choisie à la volée : le modèle peut contenir énormément de paramètres sans que chaque mot coûte plus cher à calculer.

Pense à un grand hôpital. Il emploie des dizaines de spécialistes, mais un patient n’en voit jamais qu’un ou deux : à l’accueil, une infirmière d’orientation lit son dossier et l’envoie vers les bons bureaux. L’hôpital entier doit payer ses murs et ses salaires, mais chaque consultation ne mobilise que deux personnes.

Dans un mélange d’experts, l’infirmière s’appelle le routeur, et le patient est un token. Une différence de taille : personne n’a décidé à l’avance qui serait cardiologue. Les spécialités, s’il y en a, se forment toutes seules pendant l’entraînement.

Un bloc de Transformer enchaîne deux étapes : l’attention, où les tokens échangent de l’information, puis un réseau à propagation avant (feed-forward) qui retravaille chaque token séparément. C’est ce second réseau qui porte l’essentiel des paramètres, et c’est lui qu’on découpe.

Dans un modèle classique, dit dense, chaque token traverse ce réseau en entier. Dans un MoE, on le remplace par plusieurs copies indépendantes, les experts, chacune avec ses propres poids. L’attention, elle, reste commune à tous.

Devant les experts se tient un tout petit réseau, le routeur. Pour chaque token, à chaque couche, il attribue un score à chaque expert. On garde les meilleurs — deux sur huit dans Mixtral —, on fait calculer ceux-là seulement, et on additionne leurs résultats, pondérés par leurs scores. Les autres experts ne font rien pour ce token.

Deux conséquences qu’on oublie souvent.

  • Le choix se fait token par token, pas pour toute la question. Dans une même phrase, « dort » et « sur » peuvent passer par des experts différents, et le même mot peut changer d’experts d’une couche à l’autre.
  • Le routeur s’apprend avec le reste du modèle. Personne ne lui dit quel expert sert à quoi.

C’est tout l’intérêt du procédé, et toute sa difficulté de lecture. Un MoE a deux tailles.

  • Les paramètres totaux : tout ce qu’il faut garder en mémoire, puisque le routeur peut appeler n’importe quel expert au token suivant.
  • Les paramètres actifs : ceux qui calculent réellement pour un token donné. Ce sont eux qui fixent le temps de calcul, donc la vitesse et le coût.

Mixtral 8x7B, publié par Mistral AI en décembre 2023, compte 46,7 milliards de paramètres au total, mais n’en utilise que 12,9 milliards par token. Son nom trompe : seuls les réseaux feed-forward sont multipliés par huit, l’attention et les embeddings restent partagés, d’où un total très en dessous de 8 × 7 = 56 milliards. Mistral annonçait une inférence six fois plus rapide que Llama 2 70B, pour une qualité comparable.

L’idée de combiner des experts remonte à 1991 (Jacobs et al.), mais sa forme moderne vient d’un papier de Noam Shazeer et de ses coauteurs, chez Google, en 2017. Des milliers d’experts y sont glissés entre les couches d’un réseau récurrent, l’architecture qui lisait le texte mot après mot avant le Transformer, et testés en traduction et en modélisation du langage. Le modèle monte jusqu’à 137 milliards de paramètres, avec une capacité multipliée par plus de 1 000 pour une perte d’efficacité minime. En 2021, les Switch Transformers de William Fedus, Barret Zoph et Shazeer simplifient le tout : un seul expert par token. Ils atteignent le millier de milliards de paramètres et un pré-entraînement sept fois plus rapide à calcul égal.

La tendance depuis : plus d’experts, plus petits. DeepSeek-V3 (décembre 2024) aligne dans chaque couche 256 experts, dont 8 sont choisis par token, plus un expert partagé que tous les tokens traversent. Total : 671 milliards de paramètres, 37 milliards actifs, soit environ 5,5 %.

  • L’équilibre de charge. Si le routeur prend l’habitude d’un expert au début de l’entraînement, cet expert progresse plus vite, se fait choisir encore plus, et les autres dépérissent. Le remède classique est une pénalité ajoutée à l’entraînement quand la charge se déséquilibre ; DeepSeek-V3 s’en passe : il ajoute à chaque expert un petit bonus, retiré quand l’expert est surchargé et augmenté quand il chôme, qui ne sert qu’à choisir et jamais à pondérer les résultats.
  • La mémoire. Il faut loger tous les experts, y compris ceux qui dorment. En 16 bits, les 46,7 milliards de Mixtral pèsent plus de 90 Go, alors qu’il ne calcule qu’avec l’équivalent d’un modèle de 13 milliards.
  • La circulation. Sur un serveur à plusieurs cartes, les experts sont répartis entre elles, et chaque token doit voyager vers ceux qui l’attendent. DeepSeek-V3 limite ce trajet à quatre machines par token.

Huit experts, deux tokens de la phrase fil rouge du site. Regarde le routeur noter les experts pour « dort », en allumer deux, puis tout recalculer pour « sur ». La dernière étape remet les chiffres réels de Mixtral en regard : ce qui dort en mémoire, ce qui calcule.

Comment un modèle active seulement une fraction de ses neurones ?

Token en cours : aucun

  • Expert 1 Sous-réseau
  • Expert 2 Sous-réseau
  • Expert 3 Sous-réseau
  • Expert 4 Sous-réseau
  • Expert 5 Sous-réseau
  • Expert 6 Sous-réseau
  • Expert 7 Sous-réseau
  • Expert 8 Sous-réseau

Étape 1/5 Dans un modèle classique, chaque token passe par le même réseau, qui calcule en entier. Dans un mélange d'experts, ce réseau est remplacé par plusieurs copies indépendantes, les experts : ici, 8.

Scores du routeur illustratifs, choisis pour rendre le mécanisme lisible. Le bilan reprend les chiffres publiés de Mixtral 8x7B (Mistral AI, décembre 2023).

  • Plusieurs des plus grands modèles à poids ouverts sont des MoE : Mixtral et Mistral Large 3 chez Mistral AI — ce dernier, sorti en décembre 2025, avec 675 milliards de paramètres dont 41 milliards actifs —, ou DeepSeek-V3.
  • gpt-oss-120b, publié par OpenAI en août 2025 : 117 milliards de paramètres, 5,1 milliards actifs. Une fois quantifié, il tient sur une seule carte de 80 Go, et llama.cpp le fait tourner sur une carte de 16 Go en renvoyant une partie des experts vers le processeur (voir GGUF) : ils calculent peu, on peut les loger plus loin.
  • Lire une fiche technique. Quand un modèle annonce « 120B », demande-toi s’il s’agit du total ou des actifs. Le premier dit la mémoire qu’il te faudra, le second la vitesse à laquelle il répondra.
  • « Chaque expert est spécialisé dans un domaine : un pour le code, un pour la médecine, un pour le droit. » Les auteurs de Mixtral ont cherché ce découpage et ne l’ont pas trouvé : sur des textes d’ArXiv, de biologie ou de philosophie, aucune répartition nette des experts par sujet. Le routeur suit plutôt la syntaxe — le mot self en Python ou « Question » en anglais passent souvent par le même expert. « Expert » est un nom de fonction, pas un diplôme.
  • « Un MoE de 47 milliards tient dans la mémoire d’un modèle de 13 milliards. » Le gain porte sur le calcul, pas sur la mémoire. Tous les experts doivent rester chargés, puisque le routeur peut appeler n’importe lequel au token suivant. Pour la mémoire, Mixtral reste un modèle de 47 milliards.
  • « Mixtral 8x7B, ce sont huit modèles de 7 milliards qui votent. » Il n’y a qu’un modèle, avec une seule attention, et le choix se refait à chaque token et à chaque couche. Chaque couche a son routeur et ses experts à elle : sur les 32 couches de Mixtral, un seul token fait 32 choix successifs, bien loin de huit assistants qui se consulteraient.

Voir aussi