Aller au contenu
Entraînement

Données d'entraînement

Les textes sur lesquels on a réglé les poids d'un modèle : d'où ils viennent, ce qu'on en jette, et pourquoi ils décident de ce qu'il saura dire.

7 min de lecture
  • #données d'entraînement
  • #corpus
  • #filtrage
  • #contamination

Les données d’entraînement sont l’ensemble des textes sur lesquels on a réglé les poids d’un modèle : ce qu’il saura dire, dans quelles langues et jusqu’à quelle date, vient de ce qu’on y a mis, et de ce qu’on en a retiré.

Pense à un étudiant enfermé un an dans une bibliothèque qu’il n’a pas choisie. Avant son arrivée, quelqu’un a trié les rayons : jeté les prospectus, retiré les doublons, gardé plusieurs exemplaires des meilleurs manuels. À la sortie, il rend tous les livres.

Il ne lui reste que ce qu’il en a retenu. Avec les lacunes de la bibliothèque, les préférences de celui qui l’a triée, et rien de ce qui a paru après la fermeture de la porte.

Un LLM apprend en deux temps, chacun avec ses données.

  • Le corpus de pré-entraînement est gigantesque et brut : des pages web, des livres, du code, des articles. La seule tâche est de prédire le token suivant, et c’est là, écrit Meta à propos de Llama 3, que le modèle apprend la structure de la langue et une grande quantité de connaissances sur le monde.
  • Les données de post-entraînement sont bien plus petites et plus ciblées : des exemples de conversations, des réponses classées par préférence. Elles servent au fine-tuning et au RLHF.

Cette fiche parle surtout du premier. On le mesure en tokens : Llama 3 en a vu environ 15 600 milliards. Ce compte dépend de l’outil de découpage (le tokenizer), et deux corpus mesurés avec des outils différents se comparent mal.

L’essentiel vient du web, et les corpus ouverts les mieux documentés, comme FineWeb (Hugging Face) ou Dolma (Allen Institute), partent de la même source : Common Crawl, une fondation américaine à but non lucratif qui aspire le web depuis 2008 et en publie les archives gratuitement. Elle revendique plus de 300 milliards de pages sur quinze ans. Son robot respecte le fichier robots.txt par lequel un site refuse d’être aspiré.

À côté du web, les corpus ajoutent des sources jugées plus propres : Wikipédia, des livres du domaine public, des articles scientifiques, du code. Dans Dolma, le web représente encore environ 81 % des tokens.

Le texte aspiré est inutilisable tel quel. FineWeb, Dolma et le rapport de Llama 3 décrivent des chaînes proches, dont voici les étapes.

  1. Extraire le texte du HTML, sans les menus, les publicités et les gabarits de page.
  2. Filtrer les adresses : listes de sites adultes, dangereux ou riches en données personnelles.
  3. Identifier la langue et ne garder que celles qu’on vise.
  4. Filtrer la qualité, par des règles simples (retirer les lignes sans ponctuation finale, les pages bourrées de répétitions) puis par des modèles entraînés à reconnaître un texte soigné.
  5. Dédupliquer : retirer les pages identiques ou presque.
  6. Anonymiser ce qui peut l’être, comme les adresses e-mail.
  7. Décontaminer : retirer les passages qui recoupent les tests servant à évaluer les modèles.

Presque tout disparaît en route. Pour GPT-3, OpenAI est parti de 45 To de texte compressé issu de Common Crawl et en a gardé 570 Go.

Un corpus n’est pas un grand sac où chaque source pèse selon sa taille. On décide d’un mélange, et les sources jugées meilleures sont lues plus souvent. GPT-3 a lu Wikipédia 3,4 fois, mais un peu moins de la moitié seulement de sa part de Common Crawl. Llama 3 vise environ 50 % de connaissances générales, 25 % de mathématiques et de raisonnement, 17 % de code et 8 % de textes multilingues, et termine son entraînement sur une petite sélection de données de haute qualité.

Un corpus s’arrête quelque part. Celui de Llama 3 contient des connaissances jusqu’à la fin de 2023 : ce qui s’est passé ensuite n’existe pas pour le modèle, sauf si on le lui donne au moment de la question, par une recherche web ou par le RAG. C’est une source d’hallucination toute simple : le modèle répond avec assurance sur un monde qui a changé.

Une fois l’entraînement fini, le corpus n’est plus là. Le modèle ne le consulte jamais : il ne reste que les poids. Mais ces poids peuvent retenir des fragments mot pour mot, surtout ceux que le corpus répétait. Lee et ses coauteurs ont trouvé dans C4, un corpus tiré de Common Crawl, une phrase de 61 mots répétée plus de 60 000 fois. Sur les corpus qu’ils ont étudiés, plus de 1 % de ce qu’écrivent les modèles sans consigne est recopié tel quel ; dédupliquer les données divise par dix la fréquence de ces restitutions.

  • Lucie-7B, publié en 2025 par OpenLLM-France et LINAGORA, documente son corpus en entier : 40 % de sources françaises, dont Gallica, HAL, theses.fr et des débats parlementaires. L’équipe a retiré les adresses sans robots.txt ou qui refusaient le robot de Common Crawl en juillet 2024, pour respecter la directive européenne de 2019 sur le droit d’auteur. Elle ne redistribue pas le corpus Persée, dont on a découvert après le début de l’entraînement qu’il contenait des textes protégés.
  • À l’autre bout, le rapport technique de GPT-4 ne donne aucun détail sur la construction de ses données.
  • Depuis le 2 août 2025, le règlement européen sur l’IA oblige tout fournisseur de modèle à usage général à publier un résumé suffisamment détaillé de ses données d’entraînement, avec notamment la liste des domaines les plus aspirés. Les sanctions s’appliquent à partir d’août 2026, et les modèles déjà sur le marché ont jusqu’en août 2027.
  • En France, la CNIL précise en 2025 ce qu’exige le RGPD pour aspirer le web : des critères de collecte fixés à l’avance, et le respect des refus exprimés par robots.txt ou par un CAPTCHA.
  • Dans l’archive de Common Crawl de septembre 2026, l’anglais pèse 41,86 % des pages et le français 4,68 % : une source directe de biais entre les langues.
  • « Les LLM sont entraînés sur tout Internet. » Même Common Crawl n’en est qu’un échantillon, qui n’archive en général qu’une partie de chaque site et laisse de côté ceux qui le refusent. Ensuite, les chaînes de filtrage en jettent l’essentiel : GPT-3 a gardé 570 Go sur 45 To, Dolma est passé d’environ 200 To bruts à 11 To.
  • « Plus il y a de données, meilleur est le modèle : on garde tout. » FineWeb-Edu ne retient que 1 300 milliards de tokens sur les 15 000 milliards de FineWeb, ceux qu’un modèle de tri juge éducatifs, et les modèles entraînés dessus font nettement mieux sur des tests de connaissances comme MMLU. La quantité compte, l’étude Chinchilla de DeepMind l’a montré en 2022 en trouvant beaucoup de grands modèles sous-alimentés en données, mais pas à qualité quelconque.
  • « Un bon score à un test prouve que le modèle sait résoudre ce type de problème. » Les tests circulent sur le web et finissent dans les corpus. OpenAI reconnaît qu’un bug a laissé passer des recoupements dans GPT-3, trop coûteux à réentraîner. Meta estime que 85 % des questions du test HellaSwag recoupent le corpus de Llama 3, tout en précisant que ces mesures produisent des faux positifs et des faux négatifs.

Voir aussi