Aller au contenu
Entraînement

Pré-entraînement

La première phase de la vie d'un LLM, et de loin la plus chère : des semaines de calcul à deviner le token suivant sur des milliers de milliards de tokens, pour obtenir un modèle de base.

7 min de lecture
  • #entraînement
  • #modèle de base
  • #apprentissage autosupervisé
  • #prédiction du token suivant

Le pré-entraînement est la première phase de la vie d’un LLM, et de loin la plus coûteuse : pendant des semaines, le modèle apprend à deviner la suite de centaines de milliards de textes, et en ressort capable de continuer n’importe lequel, sans savoir encore répondre à une question.

On te confie une bibliothèque entière, avec une seule consigne. Tu lis ligne à ligne en cachant la suite avec ta main ; à chaque mot, tu paries sur le suivant, tu soulèves la main, tu vérifies. Personne ne te fait cours, personne ne corrige tes copies : le livre te donne lui-même la réponse.

Au bout de quelques milliards de paris, tu connais la grammaire, beaucoup de faits et une foule de styles, et tu es imbattable pour finir une phrase. Mais si quelqu’un te pose une question, tu risques d’enchaîner sur une autre question, comme dans une liste d’examen : on ne t’a jamais appris à converser.

Le principe tient en une ligne. Le CNRS le résumait ainsi en 2022, à la sortie de BLOOM : apprendre en répétant la tâche de « prédire le prochain mot d’un texte dont on connait le début ». En réalité, le modèle prédit des tokens, des morceaux de mots, mais l’idée est la même.

Ce qui rend l’exercice si puissant, c’est qu’il ne demande aucune annotation humaine. La bonne réponse est déjà dans le texte : c’est le token qui vient ensuite. N’importe quelle page web, n’importe quel livre devient une montagne d’exercices corrigés d’avance. On parle d’apprentissage autosupervisé, un terme publié au Journal officiel en février 2026, dont la note précise qu’il est « systématiquement utilisé dans les grands modèles de langage ».

À chaque erreur, les poids sont corrigés d’un petit pas. Cette boucle (perte, gradient, mise à jour) est détaillée dans la fiche Entraînement ; le pré-entraînement la fait simplement tourner à une échelle hors norme, sur le corpus décrit dans Données d’entraînement.

Le schéma « d’abord un apprentissage général, puis une spécialisation » est antérieur aux assistants. OpenAI le popularise en 2018, dans le papier du premier GPT : des gains importants peuvent venir d’un « pré-entraînement génératif » sur un corpus varié de textes non annotés, suivi d’un fine-tuning pour chaque tâche. GPT signifie d’ailleurs Generative Pre-trained Transformer : le « P », c’est cette étape.

Pour estimer le calcul, on utilise une règle simple : environ 6 opérations par paramètre et par token lu (voir Lois d’échelle). Elle colle aux chiffres publiés.

  • GPT-3 (2020) : 174,6 milliards de paramètres, 300 milliards de tokens, soit 3,14 × 10²³ opérations.
  • Llama 3 405B (2024) : 15 600 milliards de tokens et 3,8 × 10²⁵ opérations, soit environ 120 fois GPT-3 si l’on divise l’un par l’autre, avec jusqu’à 16 000 cartes graphiques H100. La fiche technique de Llama 3.1 compte 30,84 millions d’heures de carte graphique pour cette seule taille.

Le pré-entraînement écrase tout le reste. DeepSeek a détaillé en 2024 la facture de son modèle V3 : 2,664 millions d’heures de carte graphique pour le pré-entraînement, 5 000 seulement pour le post-entraînement, sur 2,788 millions au total. Environ 96 % d’un côté, 0,2 % de l’autre.

Attention aux comparaisons : une heure de V100, de A100 ou de H100 ne fait pas le même calcul. Quand on le peut, on compare en opérations.

La tâche ne change pas du premier au dernier pas. Ce qui peut changer, c’est ce qu’on donne à lire. Lucie-7B, un modèle français publié en 2025, a été pré-entraîné en trois temps : un peu plus de 3 000 milliards de tokens avec une fenêtre de contexte de 4 096 tokens, puis 5 milliards pour allonger cette fenêtre à 32 000, et enfin 5 milliards de textes de haute qualité pour finir.

Le résultat s’appelle un modèle de base. La Commission d’enrichissement de la langue française a retenu en 2024 le terme « modèle préentraîné », écrit sans trait d’union (l’usage courant en met un, comme le titre de cette fiche) : le « résultat d’un apprentissage automatique généraliste réalisé sur un grand volume de données, qui est destiné à être réutilisé dans une grande variété de tâches ». Dans une autre fiche, elle déconseille « modèle de fondation ».

Un modèle de base continue un texte, il ne répond pas à une consigne. Le comportement d’assistant vient après, pendant le post-entraînement : un fine-tuning sur des exemples de dialogues, puis un alignement sur des préférences humaines comme le RLHF. Une fois ces étapes finies, les poids sont figés : le modèle n’apprend plus rien en servant.

  • BLOOM a été pré-entraîné en France, de mars à juillet 2022, sur 384 cartes A100 du supercalculateur public Jean Zay. L’article scientifique compte 1 082 990 heures de carte graphique pour ce seul entraînement. Les « 5 millions d’heures de calcul » du communiqué du CNRS désignent l’enveloppe accordée à tout le projet BigScience : ses expériences, modèles intermédiaires compris, en ont consommé 3,46 millions. La consommation électrique du calcul, 433 196 kWh, correspond à environ 24,7 tonnes d’équivalent CO₂, et à 50,5 tonnes en comptant aussi la fabrication du matériel et sa consommation au repos. Un bilan bas que ses auteurs attribuent au réseau électrique français, largement nucléaire.
  • GPT-3, à titre de comparaison, n’a aucun bilan officiel : OpenAI n’a publié ni heures de calcul ni consommation. Le chiffre qui circule, 1 287 MWh, est une estimation de chercheurs extérieurs (Patterson et al., 2021).
  • Llama 3.1 et Lucie-7B existent chacun en deux versions : la version de base, sortie du pré-entraînement, et une version « Instruct », passée par le post-entraînement. La fiche technique de Lucie-7B prévient que le modèle de base n’a pas été ajusté pour suivre des consignes.
  • « Un modèle qui sort du pré-entraînement est déjà un assistant comme ChatGPT. » Il a appris à continuer du texte, pas à suivre une consigne. En 2022, OpenAI a montré que les réponses d’InstructGPT, 1,3 milliard de paramètres passés par le post-entraînement, étaient préférées par des humains à celles de GPT-3 et de ses 174,6 milliards, resté un modèle de base. La taille ne suffit pas à faire un assistant.
  • « Pendant le pré-entraînement, le modèle stocke une copie d’Internet. » Il ne garde que ses poids. Fais le calcul pour BLOOM : 176 milliards de paramètres en 16 bits, environ 350 Go, pour un corpus de 1,61 To. Le modèle peut pourtant restituer mot pour mot certains passages, surtout ceux que le corpus répétait souvent, et Carlini et ses coauteurs ont montré en 2022 que ce phénomène croît avec la taille du modèle.
  • « DeepSeek a prouvé qu’on peut pré-entraîner un modèle de pointe pour 5,6 millions de dollars. » Ce montant est un prix de location : 2,788 millions d’heures de carte graphique à 2 dollars l’heure, pour l’entraînement final seulement. Le rapport précise lui-même qu’il exclut la recherche préalable et les expériences intermédiaires, et il ne compte ni l’achat du matériel ni les salaires.

Voir aussi