Aller au contenu
Entraînement

Lois d'échelle (scaling laws)

Les régularités mesurées qui relient la taille d'un modèle, le volume de ses données et le calcul dépensé à la qualité de ses prédictions, et ce qu'elles ne permettent pas de prédire.

7 min de lecture
  • #entraînement
  • #calcul
  • #loi de puissance
  • #données d'entraînement

Les lois d’échelle sont des régularités observées, pas des lois de la nature : quand on augmente la taille d’un modèle, la quantité de texte qu’il lit et le calcul qu’on y consacre, son erreur de prédiction baisse de façon assez régulière pour qu’on puisse l’anticiper avant de payer l’entraînement.

Pense à un coureur qui s’entraîne pour un marathon. Les premières semaines, il gagne des minutes entières. Ensuite, chaque minute gagnée demande deux fois plus de kilomètres que la précédente. Le progrès ne s’arrête pas, mais il coûte de plus en plus cher, et assez régulièrement pour qu’un entraîneur prévoie le chrono de la course à partir des premières séances.

Les lois d’échelle sont ce carnet d’entraîneur. Elles disent combien de calcul et de données il faudra pour gagner encore un peu, et les laboratoires s’en servent pour dimensionner un modèle avant de lancer des mois de calcul.

Pendant le pré-entraînement, le modèle apprend à prédire le token suivant, et on mesure son erreur moyenne sur des textes qu’il n’a jamais vus : c’est la perte. En 2020, Jared Kaplan et ses coauteurs, chez OpenAI, montrent que cette perte dépend surtout de trois quantités :

  • N, le nombre de paramètres, c’est-à-dire de poids ;
  • D, le nombre de tokens lus pendant l’entraînement ;
  • C, le calcul dépensé, qu’on estime à environ 6 opérations par paramètre et par token lu.

La relation est une loi de puissance : sur un graphique où les deux axes sont gradués en puissances de dix, la perte descend en ligne droite, et certaines de ces tendances couvrent plus de sept ordres de grandeur. Les détails d’architecture, comme le nombre de couches ou leur largeur, comptent très peu à côté. Les auteurs le disent eux-mêmes dès leur résumé : ces lois sont empiriques, ajustées sur des modèles de 768 paramètres à 1,5 milliard.

Une loi de puissance ne plafonne pas : elle rend chaque progrès plus cher que le précédent. Des chiffres de Kaplan pour le calcul, on déduit que multiplier C par dix réduit la perte d’environ 11 %. Pour gagner encore 11 %, il faut à nouveau dix fois plus.

Comment répartir le budget : Kaplan, puis Chinchilla

Section intitulée « Comment répartir le budget : Kaplan, puis Chinchilla »

À calcul donné, faut-il un modèle plus gros ou plus de données ? En 2020, Kaplan conseille de mettre l’essentiel du supplément dans la taille. Les grands modèles de l’époque sont bâtis ainsi : GPT-3 compte 175 milliards de paramètres pour 300 milliards de tokens lus, moins de deux tokens par paramètre.

En 2022, une équipe de DeepMind menée par Jordan Hoffmann, où figure Arthur Mensch, futur cofondateur de Mistral AI, corrige la recette : à budget optimal, taille et données doivent croître au même rythme, et chaque doublement du modèle réclame deux fois plus de tokens. Pour le prouver, elle entraîne Chinchilla, 70 milliards de paramètres sur 1 400 milliards de tokens, avec le même calcul que Gopher, son modèle de 280 milliards. Le petit bat le gros : 67,5 % contre 60,0 % sur le test de connaissances MMLU (voir Évaluation). Les grands modèles d’alors étaient, selon les auteurs, nettement sous-entraînés.

De là vient une règle qui circule partout : environ 20 tokens par paramètre. Elle n’est pas écrite telle quelle dans le papier. On la déduit de ses tableaux (1 milliard de paramètres pour 20 milliards de tokens, 10 milliards pour 205 milliards) et de Chinchilla lui-même, 1 400 divisé par 70.

Le papier Chinchilla propose aussi une formule qui prédit la perte à partir de N et D, avec un plancher que ni la taille ni les données ne franchissent : l’imprévisibilité propre au texte. En 2024, Tamay Besiroglu et ses coauteurs, de l’institut Epoch AI, ont tenté de reproduire cet ajustement et le jugent incohérent avec le reste du papier ; une fois refait, il rejoint pourtant la conclusion principale. Retiens l’idée (taille et données à égalité), pas les décimales.

L’optimum Chinchilla minimise le coût de l’entraînement, et rien d’autre. Or un modèle qu’on va interroger des millions de fois coûte surtout à l’usage, et chaque requête est moins chère sur un petit modèle (voir Inférence et Coût). D’où le surentraînement assumé, à ne pas confondre avec le surapprentissage : un modèle plus petit, nourri bien au-delà de son optimum. Fin 2023, Nikhil Sardana et ses coauteurs le formalisent : dès qu’on prévoit de l’ordre d’un milliard de requêtes, mieux vaut entraîner « plus petit et plus longtemps », et la qualité progresse encore à 10 000 tokens par paramètre.

Ce que les lois prédisent, et ce qu’elles ne prédisent pas

Section intitulée « Ce que les lois prédisent, et ce qu’elles ne prédisent pas »

Elles prédisent la perte, et bien : OpenAI a annoncé la perte finale de GPT-4 à partir de modèles entraînés avec jusqu’à 10 000 fois moins de calcul. Mais la perte n’est pas une compétence. Le même rapport prévient que certaines capacités restent difficiles à prévoir. En 2022, Jason Wei et ses coauteurs décrivent des capacités « émergentes », qui apparaissent d’un coup au-delà d’une certaine taille ; en 2023, Rylan Schaeffer et ses coauteurs y voient en partie un effet des métriques choisies. Le débat reste ouvert.

  • Llama 3 dépasse l’optimum de loin. Meta écrit en avril 2024 que l’optimum Chinchilla pour un modèle de 8 milliards de paramètres correspond à environ 200 milliards de tokens. Llama 3 8B en a lu 15 000 milliards, environ 75 fois plus, et progressait encore. Pour son plus grand modèle, Meta a ajusté sa propre loi d’échelle, qui prévoyait un optimum de 402 milliards de paramètres ; Llama 3 en compte 405.
  • CroissantLLM, un choix énergétique. Ce modèle franco-portugais de 1,3 milliard de paramètres, entraîné en partie sur le supercalculateur public Jean Zay, a lu 3 000 milliards de tokens, 115 fois l’optimum Chinchilla. Ses auteurs le justifient par l’usage : chaque réponse consomme bien moins d’énergie qu’un modèle optimal de performance équivalente, et le modèle tourne même sans carte graphique.
  • Un deuxième axe : le calcul au moment de l’inférence. Depuis 2024, une partie des gains vient du temps de réflexion accordé à chaque question plutôt que de la taille. Charlie Snell et ses coauteurs montrent qu’à calcul total égal, un petit modèle qui réfléchit mieux peut battre un modèle quatorze fois plus gros, sur les questions à sa portée.
  • « Plus un modèle a de paramètres, meilleur il est. » À budget de calcul égal, Chinchilla, quatre fois plus petit que Gopher mais nourri de quatre fois plus de données, le dépasse de 7,5 points sur MMLU. La taille n’est qu’une des trois variables, et les données pèsent autant qu’elle.
  • « Les lois d’échelle garantissent que le progrès va continuer. » Ce sont des régularités mesurées sur une plage donnée et pour une recette donnée. Leurs coefficients ont déjà été révisés deux fois. Dario Amodei, coauteur du papier de 2020, résume en 2024 : rien d’autre que l’extrapolation des tendances passées ne dit que les deux prochaines années ressembleront aux dix dernières. La même année, Ilya Sutskever juge que le passage à l’échelle du seul pré-entraînement plafonne.
  • « Le bon ratio est 20 tokens par paramètre, au-delà on gaspille. » C’est l’optimum du seul coût d’entraînement. Llama 3 8B en est à près de 1 900 tokens par paramètre, CroissantLLM à 2 300, et Sardana et ses coauteurs observent encore des gains à 10 000.

Voir aussi