Aller au contenu
Entraînement

Données synthétiques

Des textes, des codes ou des exemples artificiels fabriqués par des modèles d'IA pour enrichir, spécialiser ou nettoyer l'entraînement d'autres modèles.

6 min de lecture
  • #entraînement
  • #données d'entraînement
  • #données synthétiques
  • #qualité

Les données synthétiques sont des textes, des dialogues ou des lignes de code générés par des algorithmes ou d’autres modèles d’intelligence artificielle plutôt que rédigés par des êtres humains, dans le but d’entraîner et d’améliorer de nouveaux systèmes.

Pense à un équipage d’astronautes qui se prépare pour une mission sur la planète Mars.

Sur Terre, personne n’a jamais marché sur le sol martien : il est impossible de filmer des vidéos réelles ou d’expérimenter en direct des tempêtes de poussière rouge grandeur nature. Pour s’entraîner malgré tout, les ingénieurs de la NASA conçoivent des simulateurs de vol ultramodernes en réalité virtuelle et construisent d’immenses hangars remplis de sable teinté et de décors artificiels.

Ces décors ne sont pas de « vraies » roches martiennes prélevées dans l’espace, mais ils ont été minutieusement calculés par des physiciens pour reproduire fidèlement la gravité, la texture et les pièges du terrain. En s’exerçant des milliers d’heures dans cet environnement synthétique rigoureux, les pilotes acquièrent de véritables réflexes salvateurs.

Les données synthétiques fonctionnent selon le même principe : lorsqu’on manque de données humaines de qualité ou qu’on souhaite cibler des cas d’usage rares et complexes, on demande à un modèle d’IA puissant de fabriquer sur mesure des exercices et des exemples d’entraînement artificiels pour former ses successeurs.

L’entraînement des grands modèles de langage a longtemps reposé sur l’aspiration massive du Web public : forums de discussion, articles de presse, blogs et encyclopédies. Mais vers 2023, les laboratoires de recherche se sont heurtés à un double mur : d’une part, les réserves de textes humains de qualité en libre accès ont commencé à s’épuiser (le « mur des données ») ; d’autre part, le Web regorge d’insultes, d’erreurs factuelles, de fautes de syntaxe et de redondances.

Pour franchir ce palier, les chercheurs ont mis au point des chaînes de production de données artificielles.

La technique pionnière, formalisée fin 2022 par des chercheurs de l’Université de Washington, repose sur un amorçage récursif :

  1. Le jeu d’amorces initial (seed tasks) : On rédige manuellement une centaine d’exemples d’instructions humaines diversifiées et de très haute qualité (questions ouvertes, traductions, réécritures de poèmes, logique).
  2. Génération par un modèle maître : On fournit ces exemples à un modèle très performant (comme GPT-4) et on lui demande d’inventer de nouvelles consignes inédites dans le même esprit.
  3. Filtrage et déduplication : Un algorithme mathématique élimine automatiquement les propositions trop proches de celles déjà existantes (mesure de similarité textuelle ROUGE-L) et écarte les phrases mal formées.
  4. Rédaction des réponses : Le modèle maître rédige la solution détaillée pour chaque consigne retenue. En quelques jours, un corpus de dizaines de milliers d’exercices impeccables est constitué.

Pour apprendre au modèle à résoudre des problèmes difficiles, la méthode Evol-Instruct pousse le concept plus loin. L’algorithme prend une consigne simple (par exemple : « Écris une boucle en Python pour trier une liste ») et ordonne au modèle de la muter méthodiquement :

  • Ajout de contraintes : « Ajoute une contrainte d’efficacité mémoire en temps constant $O(1)$ ».
  • Approfondissement logique : « Transforme ce problème pour qu’il gère des structures d’arbres binaires déséquilibrés ».
  • Raisonnement par étapes : « Explique d’abord trois approches erronées possibles avant de donner la bonne ».

En gravissant cette échelle de complexité, on obtient des jeux de données d’un niveau technique bien supérieur à la moyenne des tutoriels éparpillés sur Internet.

Le grand péril : l’effondrement de modèle (Model Collapse)

Section intitulée « Le grand péril : l’effondrement de modèle (Model Collapse) »

Si les données synthétiques présentent d’immenses vertus, leur usage non contrôlé comporte un piège mathématique redoutable documenté par des chercheurs des universités d’Oxford et de Cambridge dans la revue Nature en 2024.

Lorsqu’un modèle d’IA génère du texte, il échantillonne préférentiellement les tokens les plus probables, c’est-à-dire le cœur de la distribution statistique. Ce faisant, il gomme silencieusement les événements rares, les subtilités stylistiques et les tournures originales qui constituent la richesse de la langue.

Si une deuxième génération de modèles est entraînée exclusivement sur les sorties de la première, puis une troisième sur celles de la deuxième, les queues de distribution s’effacent complètement :

  • L’effondrement précoce : Le modèle perd la mémoire des faits historiques secondaires et commence à standardiser son vocabulaire.
  • L’effondrement tardif : Le modèle dégénère en boucles répétitives de charabia absurde, ses représentations mathématiques s’étant rétractées sur un point fixe sans signification.

Pour éviter cette gangrène algorithmique, les données synthétiques ne doivent jamais être injectées brutes : elles doivent impérativement être vérifiées par des filtres externes (un compilateur pour le code, un solveur pour les mathématiques) et mélangées à un socle inaltérable de données réelles d’origine humaine.

Les données synthétiques ont changé la manière dont les entreprises fabriquent l’intelligence artificielle :

  • Les modèles compacts ultra-efficaces : La gamme des modèles phi de Microsoft (phi-1, phi-2, phi-3) a démontré qu’un modèle de seulement 1,3 ou 3,8 milliards de paramètres pouvait battre des modèles dix fois plus gros s’il était nourri d’exercices synthétiques rédigés comme des manuels scolaires parfaits.
  • La protection des données médicales et bancaires : Les hôpitaux et les banques créent des dossiers médicaux ou des historiques de transactions entièrement synthétiques qui reproduisent les propriétés statistiques des vraies données sans jamais contenir le nom ni la vie privée d’un vrai patient, permettant la recherche médicale dans le respect du secret professionnel.
  • La sécurité et l’alignement : Pour apprendre à un modèle à refuser d’aider à concevoir des cyberattaques ou des poisons, les ingénieurs génèrent des millions de requêtes agressives synthétiques sans jamais faire courir de risque à des utilisateurs réels.
  • « Entraîner une IA sur des données synthétiques produit forcément et immédiatement des résultats dégénérés. » C’est faux dès lors qu’il existe un arbitre objectif externe : en programmation ou en mathématiques, le résultat est validé par un programme de vérification formelle, garantissant que les données synthétiques sont exemptes d’erreurs factuelles.
  • « Les données synthétiques permettent de créer de nouvelles connaissances scientifiques à partir de rien. » Le modèle synthétiseur ne peut pas inventer de nouvelles lois de la physique ; il ne fait que reformuler, combiner et expliciter des connaissances déjà latentes dans les données humaines initiales.

Voir aussi