Aller au contenu
Entraînement

Distillation

Entraîner un petit modèle à imiter les réponses d'un grand, pour garder l'essentiel de ses capacités à une fraction de sa taille.

7 min de lecture
  • #entraînement
  • #compression
  • #modèle élève
  • #données synthétiques

La distillation consiste à entraîner un petit modèle, l’élève, à reproduire les réponses d’un grand modèle déjà entraîné, le professeur : l’élève garde une bonne part du savoir-faire du grand, pour une fraction de sa taille et de son coût.

Un grand chef a mis vingt ans à trouver ses recettes. Tu ne peux pas lire dans sa tête, mais tu peux le regarder cuisiner et goûter chacun de ses plats. Tu refais, tu compares, tu corriges. Au bout de quelques mois, tes plats ressemblent aux siens, sans que tu aies son expérience ni sa brigade.

Personne ne t’a transmis son cerveau : tu as appris de ce qu’il produit. Et plus il commente ses hésitations — « là, j’ai failli mettre du romarin plutôt que du thym » —, plus tu apprends vite. La distillation, c’est ce stage, pour un modèle.

L’élève est un réseau distinct, avec ses propres poids, en général bien moins nombreux. Rien n’est recopié du professeur : on le fait tourner sur une masse d’exemples, on garde ses sorties, et l’élève s’entraîne à les reproduire avec la boucle habituelle de l’entraînement — prédire, mesurer l’écart, corriger. Le professeur, lui, reste figé du début à la fin.

Ce qui change par rapport à un entraînement ordinaire, c’est la cible. D’habitude, le modèle apprend une seule bonne réponse par exemple : le mot qui suit vraiment dans le texte. Ici, il apprend ce que le professeur en pense.

Le mot vient d’un papier de Geoffrey Hinton, Oriol Vinyals et Jeff Dean, chez Google, en 2015. Leur point de départ : quand un réseau entraîné classe une image, il ne répond pas seulement « voiture », il distribue des probabilités sur toutes les réponses possibles. Et les plus petites sont précieuses. Leur exemple : une photo de BMW a très peu de chances d’être prise pour un camion-poubelle, mais cette erreur reste bien plus probable que de la prendre pour une carotte. Ces rapports entre petites probabilités disent comment le professeur voit le monde : ce qui ressemble à quoi.

Pour les faire ressortir, on « adoucit » la distribution du professeur avec un réglage appelé température : plus elle est haute, moins la réponse gagnante écrase les autres. Ce sont les cibles souples (soft targets). L’élève apprend sur elles, souvent en même temps que sur les vraies réponses, puis on le ramène à température normale pour s’en servir.

Le gain se voit dès 2015. Sur la reconnaissance de chiffres manuscrits, le grand réseau commet 67 erreurs sur le jeu de test ; un petit réseau entraîné normalement, 146 ; le même petit réseau, distillé, 74.

Pour un modèle de langage, la sortie du professeur à chaque position est une distribution de probabilité sur le token suivant. Deux familles de méthodes en découlent, et elles ne demandent pas du tout le même accès.

  • Par les probabilités. L’élève apprend, token par token, toute la distribution du professeur plutôt que le seul token présent dans le texte. C’est ce que fait Google pour Gemma 2 (2024) : ses versions 2B et 9B sont entraînées par distillation au lieu de la simple prédiction du token suivant. Il faut pour cela lire les probabilités du professeur, donc en pratique le faire tourner soi-même.
  • Par les textes. Le professeur rédige des réponses complètes, et l’élève est entraîné dessus comme sur n’importe quelles données (voir Fine-tuning). Yoon Kim et Alexander Rush ont formalisé cette variante en 2016. Plus besoin des probabilités : les textes suffisent, et une simple API y donne accès.

La seconde est techniquement un fine-tuning supervisé : un entraînement sur des paires question-réponse toutes faites. Ce qui en fait une distillation, c’est l’origine des données : elles sortent d’un autre modèle.

Trois façons d’obtenir un modèle plus léger, qu’on confond souvent.

  • La quantification garde le même modèle et les mêmes poids, écrits avec moins de bits.
  • L’élagage (pruning) retire des poids, des neurones ou des couches entières d’un modèle existant.
  • La distillation entraîne un autre modèle à imiter le premier.

Elles se combinent. Les Llama 3.2 1B et 3B de Meta (septembre 2024) sont d’abord un élagage de Llama 3.1 8B, puis une distillation : les probabilités des Llama 3.1 8B et 70B leur ont servi de cibles pendant le pré-entraînement.

  • DistilBERT, publié par Hugging Face en 2019, a popularisé l’idée : 40 % plus petit que BERT, le modèle de compréhension de texte de Google, 60 % plus rapide, et 97 % de ses capacités de compréhension conservées. Son cousin français, DistilCamemBERT, distille le modèle français CamemBERT ; le Crédit Mutuel Arkéa l’a présenté à la conférence CAp 2022, à Vannes.
  • Les petites tailles des grandes gammes. Gemma 2 2B et 9B, Llama 3.2 1B et 3B : quand un laboratoire sort une famille de modèles, les petits sont de plus en plus souvent les élèves du grand. Dans le rapport Gemma 2, un modèle de 2 milliards de paramètres distillé depuis un professeur de 7 milliards obtient un score moyen de 67,7, contre 60,3 entraîné seul.
  • DeepSeek-R1-Distill, janvier 2025 : six modèles de 1,5 à 70 milliards de paramètres, fabriqués à partir de modèles Qwen et Llama existants, entraînés sur environ 800 000 exemples rédigés par DeepSeek-R1. Aucun apprentissage par renforcement ensuite. Sur un concours de mathématiques (AIME 2024), la version 32B atteint 72,6 %, contre 47,0 % pour la même base entraînée directement par renforcement.
  • La distillation contestée. Puisqu’une API suffit, rien n’empêche techniquement de distiller le modèle d’un concurrent, ce que les conditions d’utilisation des fournisseurs interdisent en général. En février 2026, Anthropic a affirmé avoir détecté environ 24 000 comptes frauduleux et plus de 16 millions d’échanges destinés à distiller ses modèles, qu’il attribue à DeepSeek, Moonshot AI et MiniMax. Ce sont les chiffres d’une partie prenante, que personne n’a vérifiés de façon indépendante.
  • « Distiller un modèle, c’est le compresser. » Rien n’est compressé : l’élève a ses propres poids, souvent une autre architecture, et n’hérite que de ce qui passe par les sorties. DeepSeek-R1-Distill-Llama-8B a l’architecture et les poids de départ de Llama 3.1 8B, pas ceux de DeepSeek-R1 et de ses 671 milliards de paramètres. Garder les mêmes poids en moins de bits, c’est la quantification.
  • « La distillation, c’est du vol de modèle. » La technique est publique depuis 2015, et les laboratoires l’appliquent d’abord à leurs propres modèles : Google, Meta et DeepSeek en donnent trois exemples plus haut. Anthropic écrit lui-même qu’il s’agit d’une méthode d’entraînement « largement utilisée et légitime ». Ce qui se discute, c’est de distiller le modèle d’un autre contre ses conditions d’utilisation.
  • « Un élève ne dépasse jamais son professeur. » C’est le cas le plus fréquent quand il est bien plus petit : 74 erreurs contre 67 dans l’expérience de 2015. Ce n’est pas une loi : en 2018, Tommaso Furlanello et ses coauteurs ont montré qu’un élève de même taille pouvait nettement dépasser son professeur. Et sur le terrain de son professeur, un petit élève peut battre un modèle généraliste de premier plan : DeepSeek-R1-Distill-Qwen-7B obtient 55,5 % à AIME 2024, contre 9,3 % pour GPT-4o dans le même tableau.

Voir aussi