Lois d'échelle (scaling laws)
Les régularités mesurées qui relient la taille d'un modèle, le volume de ses données et le calcul dépensé à la qualité de ses prédictions, et ce qu'elles ne permettent pas de prédire.
En une phrase
Section intitulée « En une phrase »Les lois d’échelle sont des régularités observées, pas des lois de la nature : quand on augmente la taille d’un modèle, la quantité de texte qu’il lit et le calcul qu’on y consacre, son erreur de prédiction baisse de façon assez régulière pour qu’on puisse l’anticiper avant de payer l’entraînement.
L’analogie
Section intitulée « L’analogie »Pense à un coureur qui s’entraîne pour un marathon. Les premières semaines, il gagne des minutes entières. Ensuite, chaque minute gagnée demande deux fois plus de kilomètres que la précédente. Le progrès ne s’arrête pas, mais il coûte de plus en plus cher, et assez régulièrement pour qu’un entraîneur prévoie le chrono de la course à partir des premières séances.
Les lois d’échelle sont ce carnet d’entraîneur. Elles disent combien de calcul et de données il faudra pour gagner encore un peu, et les laboratoires s’en servent pour dimensionner un modèle avant de lancer des mois de calcul.
Comment ça marche
Section intitulée « Comment ça marche »Trois ingrédients, une courbe
Section intitulée « Trois ingrédients, une courbe »Pendant le pré-entraînement, le modèle apprend à prédire le token suivant, et on mesure son erreur moyenne sur des textes qu’il n’a jamais vus : c’est la perte. En 2020, Jared Kaplan et ses coauteurs, chez OpenAI, montrent que cette perte dépend surtout de trois quantités :
- N, le nombre de paramètres, c’est-à-dire de poids ;
- D, le nombre de tokens lus pendant l’entraînement ;
- C, le calcul dépensé, qu’on estime à environ 6 opérations par paramètre et par token lu.
La relation est une loi de puissance : sur un graphique où les deux axes sont gradués en puissances de dix, la perte descend en ligne droite, et certaines de ces tendances couvrent plus de sept ordres de grandeur. Les détails d’architecture, comme le nombre de couches ou leur largeur, comptent très peu à côté. Les auteurs le disent eux-mêmes dès leur résumé : ces lois sont empiriques, ajustées sur des modèles de 768 paramètres à 1,5 milliard.
Des rendements décroissants, pas un mur
Section intitulée « Des rendements décroissants, pas un mur »Une loi de puissance ne plafonne pas : elle rend chaque progrès plus cher que le précédent. Des chiffres de Kaplan pour le calcul, on déduit que multiplier C par dix réduit la perte d’environ 11 %. Pour gagner encore 11 %, il faut à nouveau dix fois plus.
Comment répartir le budget : Kaplan, puis Chinchilla
Section intitulée « Comment répartir le budget : Kaplan, puis Chinchilla »À calcul donné, faut-il un modèle plus gros ou plus de données ? En 2020, Kaplan conseille de mettre l’essentiel du supplément dans la taille. Les grands modèles de l’époque sont bâtis ainsi : GPT-3 compte 175 milliards de paramètres pour 300 milliards de tokens lus, moins de deux tokens par paramètre.
En 2022, une équipe de DeepMind menée par Jordan Hoffmann, où figure Arthur Mensch, futur cofondateur de Mistral AI, corrige la recette : à budget optimal, taille et données doivent croître au même rythme, et chaque doublement du modèle réclame deux fois plus de tokens. Pour le prouver, elle entraîne Chinchilla, 70 milliards de paramètres sur 1 400 milliards de tokens, avec le même calcul que Gopher, son modèle de 280 milliards. Le petit bat le gros : 67,5 % contre 60,0 % sur le test de connaissances MMLU (voir Évaluation). Les grands modèles d’alors étaient, selon les auteurs, nettement sous-entraînés.
De là vient une règle qui circule partout : environ 20 tokens par paramètre. Elle n’est pas écrite telle quelle dans le papier. On la déduit de ses tableaux (1 milliard de paramètres pour 20 milliards de tokens, 10 milliards pour 205 milliards) et de Chinchilla lui-même, 1 400 divisé par 70.
Des coefficients à manier avec prudence
Section intitulée « Des coefficients à manier avec prudence »Le papier Chinchilla propose aussi une formule qui prédit la perte à partir de N et D, avec un plancher que ni la taille ni les données ne franchissent : l’imprévisibilité propre au texte. En 2024, Tamay Besiroglu et ses coauteurs, de l’institut Epoch AI, ont tenté de reproduire cet ajustement et le jugent incohérent avec le reste du papier ; une fois refait, il rejoint pourtant la conclusion principale. Retiens l’idée (taille et données à égalité), pas les décimales.
Pourquoi on s’écarte exprès de l’optimum
Section intitulée « Pourquoi on s’écarte exprès de l’optimum »L’optimum Chinchilla minimise le coût de l’entraînement, et rien d’autre. Or un modèle qu’on va interroger des millions de fois coûte surtout à l’usage, et chaque requête est moins chère sur un petit modèle (voir Inférence et Coût). D’où le surentraînement assumé, à ne pas confondre avec le surapprentissage : un modèle plus petit, nourri bien au-delà de son optimum. Fin 2023, Nikhil Sardana et ses coauteurs le formalisent : dès qu’on prévoit de l’ordre d’un milliard de requêtes, mieux vaut entraîner « plus petit et plus longtemps », et la qualité progresse encore à 10 000 tokens par paramètre.
Ce que les lois prédisent, et ce qu’elles ne prédisent pas
Section intitulée « Ce que les lois prédisent, et ce qu’elles ne prédisent pas »Elles prédisent la perte, et bien : OpenAI a annoncé la perte finale de GPT-4 à partir de modèles entraînés avec jusqu’à 10 000 fois moins de calcul. Mais la perte n’est pas une compétence. Le même rapport prévient que certaines capacités restent difficiles à prévoir. En 2022, Jason Wei et ses coauteurs décrivent des capacités « émergentes », qui apparaissent d’un coup au-delà d’une certaine taille ; en 2023, Rylan Schaeffer et ses coauteurs y voient en partie un effet des métriques choisies. Le débat reste ouvert.
Dans la vraie vie
Section intitulée « Dans la vraie vie »- Llama 3 dépasse l’optimum de loin. Meta écrit en avril 2024 que l’optimum Chinchilla pour un modèle de 8 milliards de paramètres correspond à environ 200 milliards de tokens. Llama 3 8B en a lu 15 000 milliards, environ 75 fois plus, et progressait encore. Pour son plus grand modèle, Meta a ajusté sa propre loi d’échelle, qui prévoyait un optimum de 402 milliards de paramètres ; Llama 3 en compte 405.
- CroissantLLM, un choix énergétique. Ce modèle franco-portugais de 1,3 milliard de paramètres, entraîné en partie sur le supercalculateur public Jean Zay, a lu 3 000 milliards de tokens, 115 fois l’optimum Chinchilla. Ses auteurs le justifient par l’usage : chaque réponse consomme bien moins d’énergie qu’un modèle optimal de performance équivalente, et le modèle tourne même sans carte graphique.
- Un deuxième axe : le calcul au moment de l’inférence. Depuis 2024, une partie des gains vient du temps de réflexion accordé à chaque question plutôt que de la taille. Charlie Snell et ses coauteurs montrent qu’à calcul total égal, un petit modèle qui réfléchit mieux peut battre un modèle quatorze fois plus gros, sur les questions à sa portée.
Idées reçues
Section intitulée « Idées reçues »- « Plus un modèle a de paramètres, meilleur il est. » À budget de calcul égal, Chinchilla, quatre fois plus petit que Gopher mais nourri de quatre fois plus de données, le dépasse de 7,5 points sur MMLU. La taille n’est qu’une des trois variables, et les données pèsent autant qu’elle.
- « Les lois d’échelle garantissent que le progrès va continuer. » Ce sont des régularités mesurées sur une plage donnée et pour une recette donnée. Leurs coefficients ont déjà été révisés deux fois. Dario Amodei, coauteur du papier de 2020, résume en 2024 : rien d’autre que l’extrapolation des tendances passées ne dit que les deux prochaines années ressembleront aux dix dernières. La même année, Ilya Sutskever juge que le passage à l’échelle du seul pré-entraînement plafonne.
- « Le bon ratio est 20 tokens par paramètre, au-delà on gaspille. » C’est l’optimum du seul coût d’entraînement. Llama 3 8B en est à près de 1 900 tokens par paramètre, CroissantLLM à 2 300, et Sardana et ses coauteurs observent encore des gains à 10 000.
Pour aller plus loin
Section intitulée « Pour aller plus loin »- « Le plafond de verre des grands modèles de langage » — Jean-Claude Heudin, Futura-Sciences, 2026 (FR) : le débat sur le plafonnement, raconté pour le grand public.
- « Scaling Laws for Neural Language Models » — Kaplan et al., 2020 (EN) : les premières lois de puissance entre taille, données, calcul et perte.
- « Training Compute-Optimal Large Language Models » — Hoffmann et al., 2022 (EN) : le papier Chinchilla, qui rééquilibre taille et données.
- « Chinchilla Scaling: A replication attempt » — Besiroglu et al., 2024 (EN) : ce qui tient et ce qui ne tient pas dans les coefficients de Chinchilla.
- « Beyond Chinchilla-Optimal » — Sardana et al., 2023 (EN) : pourquoi le coût d’usage pousse vers des modèles plus petits entraînés plus longtemps.
- « CroissantLLM: A Truly Bilingual French-English Language Model » — Faysse et al., 2024 (EN) : un modèle français surentraîné exprès, avec son bilan énergétique.
Voir aussi
Section intitulée « Voir aussi »Voir aussi
- EntraînementPré-entraînementLa première phase de la vie d'un LLM, et de loin la plus chère : des semaines de calcul à deviner le token suivant sur des milliers de milliards de tokens, pour obtenir un modèle de base.
- EntraînementDonnées d'entraînementLes textes sur lesquels on a réglé les poids d'un modèle : d'où ils viennent, ce qu'on en jette, et pourquoi ils décident de ce qu'il saura dire.
- FondamentauxÉvaluation (benchmarks)Comment on note un modèle de langage : des jeux de questions, des duels arbitrés par des humains ou par un autre modèle, et tout ce qui peut faire mentir un score.
- ÉcosystèmeCoût (tarification)Ce que coûte vraiment une réponse de modèle : des tokens facturés à l'entrée et à la sortie, des remises, des pièges, et le prix du matériel quand on l'héberge soi-même.
- FondamentauxInférenceLe moment où le modèle tourne pour de vrai : la boucle qui écrit le texte, un token à la fois, par opposition à l'entraînement où il apprend.
- ArchitectureMélange d'experts (MoE)Une architecture où chaque token ne passe que par quelques sous-réseaux choisis parmi beaucoup : le modèle grossit sans que chaque mot coûte plus cher à calculer.
- EntraînementEntraînementLa boucle qui règle les poids d'un modèle : mesurer son erreur, calculer dans quel sens corriger chaque nombre, faire un petit pas, et recommencer.
- FondamentauxModèle de raisonnement (reasoning model)Un LLM entraîné à écrire un long brouillon avant de répondre : ce qu'il gagne sur les problèmes difficiles, ce qu'il coûte, et pourquoi son brouillon n'est pas une fenêtre sur sa pensée.
- ÉthiqueEmpreinte environnementaleCe que coûtent à l'environnement la fabrication du matériel, l'entraînement d'un modèle et chacune de ses réponses : électricité, carbone, eau, métaux, et pourquoi les chiffres qui circulent divergent autant.
- FondamentauxCapacités émergentesLes aptitudes cognitives qui semblent apparaître subitement à partir d'une certaine taille de modèle : saut qualitatif mystérieux ou mirage de nos méthodes de mesure ?