Données d'entraînement
Les textes sur lesquels on a réglé les poids d'un modèle : d'où ils viennent, ce qu'on en jette, et pourquoi ils décident de ce qu'il saura dire.
En une phrase
Section intitulée « En une phrase »Les données d’entraînement sont l’ensemble des textes sur lesquels on a réglé les poids d’un modèle : ce qu’il saura dire, dans quelles langues et jusqu’à quelle date, vient de ce qu’on y a mis, et de ce qu’on en a retiré.
L’analogie
Section intitulée « L’analogie »Pense à un étudiant enfermé un an dans une bibliothèque qu’il n’a pas choisie. Avant son arrivée, quelqu’un a trié les rayons : jeté les prospectus, retiré les doublons, gardé plusieurs exemplaires des meilleurs manuels. À la sortie, il rend tous les livres.
Il ne lui reste que ce qu’il en a retenu. Avec les lacunes de la bibliothèque, les préférences de celui qui l’a triée, et rien de ce qui a paru après la fermeture de la porte.
Comment ça marche
Section intitulée « Comment ça marche »Deux sortes de données
Section intitulée « Deux sortes de données »Un LLM apprend en deux temps, chacun avec ses données.
- Le corpus de pré-entraînement est gigantesque et brut : des pages web, des livres, du code, des articles. La seule tâche est de prédire le token suivant, et c’est là, écrit Meta à propos de Llama 3, que le modèle apprend la structure de la langue et une grande quantité de connaissances sur le monde.
- Les données de post-entraînement sont bien plus petites et plus ciblées : des exemples de conversations, des réponses classées par préférence. Elles servent au fine-tuning et au RLHF.
Cette fiche parle surtout du premier. On le mesure en tokens : Llama 3 en a vu environ 15 600 milliards. Ce compte dépend de l’outil de découpage (le tokenizer), et deux corpus mesurés avec des outils différents se comparent mal.
D’où vient le texte
Section intitulée « D’où vient le texte »L’essentiel vient du web, et les corpus ouverts les mieux documentés, comme FineWeb (Hugging Face) ou Dolma (Allen Institute), partent de la même source : Common Crawl, une fondation américaine à but non lucratif qui aspire le web depuis 2008 et en publie les archives gratuitement. Elle revendique plus de 300 milliards de pages sur quinze ans. Son robot respecte le fichier robots.txt par lequel un site refuse d’être aspiré.
À côté du web, les corpus ajoutent des sources jugées plus propres : Wikipédia, des livres du domaine public, des articles scientifiques, du code. Dans Dolma, le web représente encore environ 81 % des tokens.
Du web brut au corpus
Section intitulée « Du web brut au corpus »Le texte aspiré est inutilisable tel quel. FineWeb, Dolma et le rapport de Llama 3 décrivent des chaînes proches, dont voici les étapes.
- Extraire le texte du HTML, sans les menus, les publicités et les gabarits de page.
- Filtrer les adresses : listes de sites adultes, dangereux ou riches en données personnelles.
- Identifier la langue et ne garder que celles qu’on vise.
- Filtrer la qualité, par des règles simples (retirer les lignes sans ponctuation finale, les pages bourrées de répétitions) puis par des modèles entraînés à reconnaître un texte soigné.
- Dédupliquer : retirer les pages identiques ou presque.
- Anonymiser ce qui peut l’être, comme les adresses e-mail.
- Décontaminer : retirer les passages qui recoupent les tests servant à évaluer les modèles.
Presque tout disparaît en route. Pour GPT-3, OpenAI est parti de 45 To de texte compressé issu de Common Crawl et en a gardé 570 Go.
La recette du mélange
Section intitulée « La recette du mélange »Un corpus n’est pas un grand sac où chaque source pèse selon sa taille. On décide d’un mélange, et les sources jugées meilleures sont lues plus souvent. GPT-3 a lu Wikipédia 3,4 fois, mais un peu moins de la moitié seulement de sa part de Common Crawl. Llama 3 vise environ 50 % de connaissances générales, 25 % de mathématiques et de raisonnement, 17 % de code et 8 % de textes multilingues, et termine son entraînement sur une petite sélection de données de haute qualité.
Une date de coupure
Section intitulée « Une date de coupure »Un corpus s’arrête quelque part. Celui de Llama 3 contient des connaissances jusqu’à la fin de 2023 : ce qui s’est passé ensuite n’existe pas pour le modèle, sauf si on le lui donne au moment de la question, par une recherche web ou par le RAG. C’est une source d’hallucination toute simple : le modèle répond avec assurance sur un monde qui a changé.
Ce qu’il en reste
Section intitulée « Ce qu’il en reste »Une fois l’entraînement fini, le corpus n’est plus là. Le modèle ne le consulte jamais : il ne reste que les poids. Mais ces poids peuvent retenir des fragments mot pour mot, surtout ceux que le corpus répétait. Lee et ses coauteurs ont trouvé dans C4, un corpus tiré de Common Crawl, une phrase de 61 mots répétée plus de 60 000 fois. Sur les corpus qu’ils ont étudiés, plus de 1 % de ce qu’écrivent les modèles sans consigne est recopié tel quel ; dédupliquer les données divise par dix la fréquence de ces restitutions.
Dans la vraie vie
Section intitulée « Dans la vraie vie »- Lucie-7B, publié en 2025 par OpenLLM-France et LINAGORA, documente son corpus en entier : 40 % de sources françaises, dont Gallica, HAL, theses.fr et des débats parlementaires. L’équipe a retiré les adresses sans
robots.txtou qui refusaient le robot de Common Crawl en juillet 2024, pour respecter la directive européenne de 2019 sur le droit d’auteur. Elle ne redistribue pas le corpus Persée, dont on a découvert après le début de l’entraînement qu’il contenait des textes protégés. - À l’autre bout, le rapport technique de GPT-4 ne donne aucun détail sur la construction de ses données.
- Depuis le 2 août 2025, le règlement européen sur l’IA oblige tout fournisseur de modèle à usage général à publier un résumé suffisamment détaillé de ses données d’entraînement, avec notamment la liste des domaines les plus aspirés. Les sanctions s’appliquent à partir d’août 2026, et les modèles déjà sur le marché ont jusqu’en août 2027.
- En France, la CNIL précise en 2025 ce qu’exige le RGPD pour aspirer le web : des critères de collecte fixés à l’avance, et le respect des refus exprimés par
robots.txtou par un CAPTCHA. - Dans l’archive de Common Crawl de septembre 2026, l’anglais pèse 41,86 % des pages et le français 4,68 % : une source directe de biais entre les langues.
Idées reçues
Section intitulée « Idées reçues »- « Les LLM sont entraînés sur tout Internet. » Même Common Crawl n’en est qu’un échantillon, qui n’archive en général qu’une partie de chaque site et laisse de côté ceux qui le refusent. Ensuite, les chaînes de filtrage en jettent l’essentiel : GPT-3 a gardé 570 Go sur 45 To, Dolma est passé d’environ 200 To bruts à 11 To.
- « Plus il y a de données, meilleur est le modèle : on garde tout. » FineWeb-Edu ne retient que 1 300 milliards de tokens sur les 15 000 milliards de FineWeb, ceux qu’un modèle de tri juge éducatifs, et les modèles entraînés dessus font nettement mieux sur des tests de connaissances comme MMLU. La quantité compte, l’étude Chinchilla de DeepMind l’a montré en 2022 en trouvant beaucoup de grands modèles sous-alimentés en données, mais pas à qualité quelconque.
- « Un bon score à un test prouve que le modèle sait résoudre ce type de problème. » Les tests circulent sur le web et finissent dans les corpus. OpenAI reconnaît qu’un bug a laissé passer des recoupements dans GPT-3, trop coûteux à réentraîner. Meta estime que 85 % des questions du test HellaSwag recoupent le corpus de Llama 3, tout en précisant que ces mesures produisent des faux positifs et des faux négatifs.
Pour aller plus loin
Section intitulée « Pour aller plus loin »- « Collecte par moissonnage » — CNIL, fiche pratique IA, 2025 (FR) : ce que le RGPD impose quand on aspire le web.
- « Régulation des données : les corpus de pré-entraînement des IA » — Benoît Sagot, Université Paris Dauphine-PSL, 2024 (FR) : données blanches, grises et noires.
- « The FineWeb Datasets » — Penedo et al., Hugging Face, 2024 (EN) : chaque étape de filtrage, testée une par une.
- « The Llama 3 Herd of Models » — Meta, 2024 (EN) : la section 3.1 détaille le filtrage, le mélange et la date de coupure du corpus.
- « The Lucie-7B LLM and the Lucie Training Dataset » — Gouvert et al., 2025 (EN) : un corpus centré sur le français, documenté source par source.
- « Deduplicating Training Data Makes Language Models Better » — Lee et al., 2021 (EN) : doublons, mémorisation et recoupements avec les tests.
- La FAQ de Common Crawl — Common Crawl (EN)
Voir aussi
Section intitulée « Voir aussi »Voir aussi
- FondamentauxPoids (paramètres)Les milliards de nombres qui stockent tout ce qu'un modèle a appris pendant son entraînement.
- ÉthiqueBiais (d'un modèle)Un écart systématique dans les réponses d'un modèle, hérité des textes qui ont fixé ses poids et des choix faits pour l'aligner — pas une erreur au hasard, mais toujours la même, dans le même sens.
- FondamentauxHallucinationQuand un LLM affirme avec aplomb des choses fausses ou inventées : sources, faits ou références imaginaires.
- EntraînementFine-tuning (réglage fin)Poursuivre l'entraînement d'un modèle déjà entraîné sur tes propres données pour lui apprendre un style, un domaine ou une tâche.
- EntraînementRLHFL'entraînement par comparaison de réponses, qui apprend à un modèle non pas à répondre juste, mais à répondre comme on l'attend.
- ÉcosystèmeRAG (génération augmentée par la recherche)Aller chercher des documents pertinents dans une base de connaissances et les donner au modèle pour qu'il réponde avec des informations à jour et sourcées.
- EntraînementPré-entraînementLa première phase de la vie d'un LLM, et de loin la plus chère : des semaines de calcul à deviner le token suivant sur des milliers de milliards de tokens, pour obtenir un modèle de base.
- EntraînementEntraînementLa boucle qui règle les poids d'un modèle : mesurer son erreur, calculer dans quel sens corriger chaque nombre, faire un petit pas, et recommencer.
- FondamentauxÉvaluation (benchmarks)Comment on note un modèle de langage : des jeux de questions, des duels arbitrés par des humains ou par un autre modèle, et tout ce qui peut faire mentir un score.
- EntraînementLois d'échelle (scaling laws)Les régularités mesurées qui relient la taille d'un modèle, le volume de ses données et le calcul dépensé à la qualité de ses prédictions, et ce qu'elles ne permettent pas de prédire.
- EntraînementDonnées synthétiquesDes textes, des codes ou des exemples artificiels fabriqués par des modèles d'IA pour enrichir, spécialiser ou nettoyer l'entraînement d'autres modèles.