Pré-entraînement
La première phase de la vie d'un LLM, et de loin la plus chère : des semaines de calcul à deviner le token suivant sur des milliers de milliards de tokens, pour obtenir un modèle de base.
En une phrase
Section intitulée « En une phrase »Le pré-entraînement est la première phase de la vie d’un LLM, et de loin la plus coûteuse : pendant des semaines, le modèle apprend à deviner la suite de centaines de milliards de textes, et en ressort capable de continuer n’importe lequel, sans savoir encore répondre à une question.
L’analogie
Section intitulée « L’analogie »On te confie une bibliothèque entière, avec une seule consigne. Tu lis ligne à ligne en cachant la suite avec ta main ; à chaque mot, tu paries sur le suivant, tu soulèves la main, tu vérifies. Personne ne te fait cours, personne ne corrige tes copies : le livre te donne lui-même la réponse.
Au bout de quelques milliards de paris, tu connais la grammaire, beaucoup de faits et une foule de styles, et tu es imbattable pour finir une phrase. Mais si quelqu’un te pose une question, tu risques d’enchaîner sur une autre question, comme dans une liste d’examen : on ne t’a jamais appris à converser.
Comment ça marche
Section intitulée « Comment ça marche »Une seule tâche : le token suivant
Section intitulée « Une seule tâche : le token suivant »Le principe tient en une ligne. Le CNRS le résumait ainsi en 2022, à la sortie de BLOOM : apprendre en répétant la tâche de « prédire le prochain mot d’un texte dont on connait le début ». En réalité, le modèle prédit des tokens, des morceaux de mots, mais l’idée est la même.
Ce qui rend l’exercice si puissant, c’est qu’il ne demande aucune annotation humaine. La bonne réponse est déjà dans le texte : c’est le token qui vient ensuite. N’importe quelle page web, n’importe quel livre devient une montagne d’exercices corrigés d’avance. On parle d’apprentissage autosupervisé, un terme publié au Journal officiel en février 2026, dont la note précise qu’il est « systématiquement utilisé dans les grands modèles de langage ».
À chaque erreur, les poids sont corrigés d’un petit pas. Cette boucle (perte, gradient, mise à jour) est détaillée dans la fiche Entraînement ; le pré-entraînement la fait simplement tourner à une échelle hors norme, sur le corpus décrit dans Données d’entraînement.
Le « P » de GPT
Section intitulée « Le « P » de GPT »Le schéma « d’abord un apprentissage général, puis une spécialisation » est antérieur aux assistants. OpenAI le popularise en 2018, dans le papier du premier GPT : des gains importants peuvent venir d’un « pré-entraînement génératif » sur un corpus varié de textes non annotés, suivi d’un fine-tuning pour chaque tâche. GPT signifie d’ailleurs Generative Pre-trained Transformer : le « P », c’est cette étape.
Ce que ça coûte
Section intitulée « Ce que ça coûte »Pour estimer le calcul, on utilise une règle simple : environ 6 opérations par paramètre et par token lu (voir Lois d’échelle). Elle colle aux chiffres publiés.
- GPT-3 (2020) : 174,6 milliards de paramètres, 300 milliards de tokens, soit 3,14 × 10²³ opérations.
- Llama 3 405B (2024) : 15 600 milliards de tokens et 3,8 × 10²⁵ opérations, soit environ 120 fois GPT-3 si l’on divise l’un par l’autre, avec jusqu’à 16 000 cartes graphiques H100. La fiche technique de Llama 3.1 compte 30,84 millions d’heures de carte graphique pour cette seule taille.
Le pré-entraînement écrase tout le reste. DeepSeek a détaillé en 2024 la facture de son modèle V3 : 2,664 millions d’heures de carte graphique pour le pré-entraînement, 5 000 seulement pour le post-entraînement, sur 2,788 millions au total. Environ 96 % d’un côté, 0,2 % de l’autre.
Attention aux comparaisons : une heure de V100, de A100 ou de H100 ne fait pas le même calcul. Quand on le peut, on compare en opérations.
Un objectif fixe, un corpus qui évolue
Section intitulée « Un objectif fixe, un corpus qui évolue »La tâche ne change pas du premier au dernier pas. Ce qui peut changer, c’est ce qu’on donne à lire. Lucie-7B, un modèle français publié en 2025, a été pré-entraîné en trois temps : un peu plus de 3 000 milliards de tokens avec une fenêtre de contexte de 4 096 tokens, puis 5 milliards pour allonger cette fenêtre à 32 000, et enfin 5 milliards de textes de haute qualité pour finir.
Ce qui en sort : un modèle de base
Section intitulée « Ce qui en sort : un modèle de base »Le résultat s’appelle un modèle de base. La Commission d’enrichissement de la langue française a retenu en 2024 le terme « modèle préentraîné », écrit sans trait d’union (l’usage courant en met un, comme le titre de cette fiche) : le « résultat d’un apprentissage automatique généraliste réalisé sur un grand volume de données, qui est destiné à être réutilisé dans une grande variété de tâches ». Dans une autre fiche, elle déconseille « modèle de fondation ».
Un modèle de base continue un texte, il ne répond pas à une consigne. Le comportement d’assistant vient après, pendant le post-entraînement : un fine-tuning sur des exemples de dialogues, puis un alignement sur des préférences humaines comme le RLHF. Une fois ces étapes finies, les poids sont figés : le modèle n’apprend plus rien en servant.
Dans la vraie vie
Section intitulée « Dans la vraie vie »- BLOOM a été pré-entraîné en France, de mars à juillet 2022, sur 384 cartes A100 du supercalculateur public Jean Zay. L’article scientifique compte 1 082 990 heures de carte graphique pour ce seul entraînement. Les « 5 millions d’heures de calcul » du communiqué du CNRS désignent l’enveloppe accordée à tout le projet BigScience : ses expériences, modèles intermédiaires compris, en ont consommé 3,46 millions. La consommation électrique du calcul, 433 196 kWh, correspond à environ 24,7 tonnes d’équivalent CO₂, et à 50,5 tonnes en comptant aussi la fabrication du matériel et sa consommation au repos. Un bilan bas que ses auteurs attribuent au réseau électrique français, largement nucléaire.
- GPT-3, à titre de comparaison, n’a aucun bilan officiel : OpenAI n’a publié ni heures de calcul ni consommation. Le chiffre qui circule, 1 287 MWh, est une estimation de chercheurs extérieurs (Patterson et al., 2021).
- Llama 3.1 et Lucie-7B existent chacun en deux versions : la version de base, sortie du pré-entraînement, et une version « Instruct », passée par le post-entraînement. La fiche technique de Lucie-7B prévient que le modèle de base n’a pas été ajusté pour suivre des consignes.
Idées reçues
Section intitulée « Idées reçues »- « Un modèle qui sort du pré-entraînement est déjà un assistant comme ChatGPT. » Il a appris à continuer du texte, pas à suivre une consigne. En 2022, OpenAI a montré que les réponses d’InstructGPT, 1,3 milliard de paramètres passés par le post-entraînement, étaient préférées par des humains à celles de GPT-3 et de ses 174,6 milliards, resté un modèle de base. La taille ne suffit pas à faire un assistant.
- « Pendant le pré-entraînement, le modèle stocke une copie d’Internet. » Il ne garde que ses poids. Fais le calcul pour BLOOM : 176 milliards de paramètres en 16 bits, environ 350 Go, pour un corpus de 1,61 To. Le modèle peut pourtant restituer mot pour mot certains passages, surtout ceux que le corpus répétait souvent, et Carlini et ses coauteurs ont montré en 2022 que ce phénomène croît avec la taille du modèle.
- « DeepSeek a prouvé qu’on peut pré-entraîner un modèle de pointe pour 5,6 millions de dollars. » Ce montant est un prix de location : 2,788 millions d’heures de carte graphique à 2 dollars l’heure, pour l’entraînement final seulement. Le rapport précise lui-même qu’il exclut la recherche préalable et les expériences intermédiaires, et il ne compte ni l’achat du matériel ni les salaires.
Pour aller plus loin
Section intitulée « Pour aller plus loin »- « Modèle préentraîné » — FranceTerme, Journal officiel du 6 septembre 2024 (FR) : la définition officielle et sa graphie.
- « Livraison du plus grand modèle de langue multilingue “open science” jamais entraîné » — CNRS, communiqué du 12 juillet 2022 (FR) : BLOOM et Jean Zay.
- « Improving Language Understanding by Generative Pre-Training » — Radford et al., OpenAI, 2018 (EN) : le papier du premier GPT.
- « Training language models to follow instructions with human feedback » — Ouyang et al., OpenAI, 2022 (EN) : pourquoi un modèle de base n’est pas un assistant.
- « Estimating the Carbon Footprint of BLOOM » — Luccioni, Viguier et Ligozat, 2022 (EN) : heures de calcul, énergie et émissions d’un pré-entraînement.
- « DeepSeek-V3 Technical Report » — DeepSeek-AI, 2024 (EN) : le tableau 1 ventile le coût entre pré- et post-entraînement.
Voir aussi
Section intitulée « Voir aussi »Voir aussi
- EntraînementEntraînementLa boucle qui règle les poids d'un modèle : mesurer son erreur, calculer dans quel sens corriger chaque nombre, faire un petit pas, et recommencer.
- EntraînementDonnées d'entraînementLes textes sur lesquels on a réglé les poids d'un modèle : d'où ils viennent, ce qu'on en jette, et pourquoi ils décident de ce qu'il saura dire.
- FondamentauxPoids (paramètres)Les milliards de nombres qui stockent tout ce qu'un modèle a appris pendant son entraînement.
- EntraînementFine-tuning (réglage fin)Poursuivre l'entraînement d'un modèle déjà entraîné sur tes propres données pour lui apprendre un style, un domaine ou une tâche.
- EntraînementRLHFL'entraînement par comparaison de réponses, qui apprend à un modèle non pas à répondre juste, mais à répondre comme on l'attend.
- ArchitectureTransformer (transformeur)L'architecture de réseau de neurones sur laquelle tous les LLM sont bâtis : une pile de blocs identiques que le texte traverse de bout en bout.
- EntraînementLois d'échelle (scaling laws)Les régularités mesurées qui relient la taille d'un modèle, le volume de ses données et le calcul dépensé à la qualité de ses prédictions, et ce qu'elles ne permettent pas de prédire.
- ÉthiqueEmpreinte environnementaleCe que coûtent à l'environnement la fabrication du matériel, l'entraînement d'un modèle et chacune de ses réponses : électricité, carbone, eau, métaux, et pourquoi les chiffres qui circulent divergent autant.