Données synthétiques
Des textes, des codes ou des exemples artificiels fabriqués par des modèles d'IA pour enrichir, spécialiser ou nettoyer l'entraînement d'autres modèles.
En une phrase
Section intitulée « En une phrase »Les données synthétiques sont des textes, des dialogues ou des lignes de code générés par des algorithmes ou d’autres modèles d’intelligence artificielle plutôt que rédigés par des êtres humains, dans le but d’entraîner et d’améliorer de nouveaux systèmes.
L’analogie
Section intitulée « L’analogie »Pense à un équipage d’astronautes qui se prépare pour une mission sur la planète Mars.
Sur Terre, personne n’a jamais marché sur le sol martien : il est impossible de filmer des vidéos réelles ou d’expérimenter en direct des tempêtes de poussière rouge grandeur nature. Pour s’entraîner malgré tout, les ingénieurs de la NASA conçoivent des simulateurs de vol ultramodernes en réalité virtuelle et construisent d’immenses hangars remplis de sable teinté et de décors artificiels.
Ces décors ne sont pas de « vraies » roches martiennes prélevées dans l’espace, mais ils ont été minutieusement calculés par des physiciens pour reproduire fidèlement la gravité, la texture et les pièges du terrain. En s’exerçant des milliers d’heures dans cet environnement synthétique rigoureux, les pilotes acquièrent de véritables réflexes salvateurs.
Les données synthétiques fonctionnent selon le même principe : lorsqu’on manque de données humaines de qualité ou qu’on souhaite cibler des cas d’usage rares et complexes, on demande à un modèle d’IA puissant de fabriquer sur mesure des exercices et des exemples d’entraînement artificiels pour former ses successeurs.
Comment ça marche
Section intitulée « Comment ça marche »L’entraînement des grands modèles de langage a longtemps reposé sur l’aspiration massive du Web public : forums de discussion, articles de presse, blogs et encyclopédies. Mais vers 2023, les laboratoires de recherche se sont heurtés à un double mur : d’une part, les réserves de textes humains de qualité en libre accès ont commencé à s’épuiser (le « mur des données ») ; d’autre part, le Web regorge d’insultes, d’erreurs factuelles, de fautes de syntaxe et de redondances.
Pour franchir ce palier, les chercheurs ont mis au point des chaînes de production de données artificielles.
Le protocole d’auto-instruction (Self-Instruct)
Section intitulée « Le protocole d’auto-instruction (Self-Instruct) »La technique pionnière, formalisée fin 2022 par des chercheurs de l’Université de Washington, repose sur un amorçage récursif :
- Le jeu d’amorces initial (seed tasks) : On rédige manuellement une centaine d’exemples d’instructions humaines diversifiées et de très haute qualité (questions ouvertes, traductions, réécritures de poèmes, logique).
- Génération par un modèle maître : On fournit ces exemples à un modèle très performant (comme GPT-4) et on lui demande d’inventer de nouvelles consignes inédites dans le même esprit.
- Filtrage et déduplication : Un algorithme mathématique élimine automatiquement les propositions trop proches de celles déjà existantes (mesure de similarité textuelle ROUGE-L) et écarte les phrases mal formées.
- Rédaction des réponses : Le modèle maître rédige la solution détaillée pour chaque consigne retenue. En quelques jours, un corpus de dizaines de milliers d’exercices impeccables est constitué.
La complexification méthodique (Evol-Instruct)
Section intitulée « La complexification méthodique (Evol-Instruct) »Pour apprendre au modèle à résoudre des problèmes difficiles, la méthode Evol-Instruct pousse le concept plus loin. L’algorithme prend une consigne simple (par exemple : « Écris une boucle en Python pour trier une liste ») et ordonne au modèle de la muter méthodiquement :
- Ajout de contraintes : « Ajoute une contrainte d’efficacité mémoire en temps constant $O(1)$ ».
- Approfondissement logique : « Transforme ce problème pour qu’il gère des structures d’arbres binaires déséquilibrés ».
- Raisonnement par étapes : « Explique d’abord trois approches erronées possibles avant de donner la bonne ».
En gravissant cette échelle de complexité, on obtient des jeux de données d’un niveau technique bien supérieur à la moyenne des tutoriels éparpillés sur Internet.
Le grand péril : l’effondrement de modèle (Model Collapse)
Section intitulée « Le grand péril : l’effondrement de modèle (Model Collapse) »Si les données synthétiques présentent d’immenses vertus, leur usage non contrôlé comporte un piège mathématique redoutable documenté par des chercheurs des universités d’Oxford et de Cambridge dans la revue Nature en 2024.
Lorsqu’un modèle d’IA génère du texte, il échantillonne préférentiellement les tokens les plus probables, c’est-à-dire le cœur de la distribution statistique. Ce faisant, il gomme silencieusement les événements rares, les subtilités stylistiques et les tournures originales qui constituent la richesse de la langue.
Si une deuxième génération de modèles est entraînée exclusivement sur les sorties de la première, puis une troisième sur celles de la deuxième, les queues de distribution s’effacent complètement :
- L’effondrement précoce : Le modèle perd la mémoire des faits historiques secondaires et commence à standardiser son vocabulaire.
- L’effondrement tardif : Le modèle dégénère en boucles répétitives de charabia absurde, ses représentations mathématiques s’étant rétractées sur un point fixe sans signification.
Pour éviter cette gangrène algorithmique, les données synthétiques ne doivent jamais être injectées brutes : elles doivent impérativement être vérifiées par des filtres externes (un compilateur pour le code, un solveur pour les mathématiques) et mélangées à un socle inaltérable de données réelles d’origine humaine.
Dans la vraie vie
Section intitulée « Dans la vraie vie »Les données synthétiques ont changé la manière dont les entreprises fabriquent l’intelligence artificielle :
- Les modèles compacts ultra-efficaces : La gamme des modèles phi de Microsoft (phi-1, phi-2, phi-3) a démontré qu’un modèle de seulement 1,3 ou 3,8 milliards de paramètres pouvait battre des modèles dix fois plus gros s’il était nourri d’exercices synthétiques rédigés comme des manuels scolaires parfaits.
- La protection des données médicales et bancaires : Les hôpitaux et les banques créent des dossiers médicaux ou des historiques de transactions entièrement synthétiques qui reproduisent les propriétés statistiques des vraies données sans jamais contenir le nom ni la vie privée d’un vrai patient, permettant la recherche médicale dans le respect du secret professionnel.
- La sécurité et l’alignement : Pour apprendre à un modèle à refuser d’aider à concevoir des cyberattaques ou des poisons, les ingénieurs génèrent des millions de requêtes agressives synthétiques sans jamais faire courir de risque à des utilisateurs réels.
Idées reçues
Section intitulée « Idées reçues »- « Entraîner une IA sur des données synthétiques produit forcément et immédiatement des résultats dégénérés. » C’est faux dès lors qu’il existe un arbitre objectif externe : en programmation ou en mathématiques, le résultat est validé par un programme de vérification formelle, garantissant que les données synthétiques sont exemptes d’erreurs factuelles.
- « Les données synthétiques permettent de créer de nouvelles connaissances scientifiques à partir de rien. » Le modèle synthétiseur ne peut pas inventer de nouvelles lois de la physique ; il ne fait que reformuler, combiner et expliciter des connaissances déjà latentes dans les données humaines initiales.
Pour aller plus loin
Section intitulée « Pour aller plus loin »- Génération de données synthétiques : opportunités et garanties pour la vie privée — CNIL (France), 2024 (FR) : L’analyse réglementaire et technique de l’autorité française sur l’anonymisation par données de synthèse conforme au RGPD.
- AI models collapse when trained on recursively generated data — Ilia Shumailov et al., Nature, 2024 (EN) : L’article de recherche fondamental démontrant le risque d’effondrement statistique en cas d’entraînement récursif.
- Textbooks Are All You Need — Suriya Gunasekar et al., Microsoft Research, 2023 (EN) : L’expérience pionnière montrant la supériorité de corpus synthétiques de type manuel scolaire sur le web brut.
Voir aussi
Section intitulée « Voir aussi »Voir aussi
- EntraînementDistillationEntraîner un petit modèle à imiter les réponses d'un grand, pour garder l'essentiel de ses capacités à une fraction de sa taille.
- EntraînementPré-entraînementLa première phase de la vie d'un LLM, et de loin la plus chère : des semaines de calcul à deviner le token suivant sur des milliers de milliards de tokens, pour obtenir un modèle de base.
- EntraînementAlignement des modèlesLe processus mathématique et éthique visant à faire respecter par un modèle de langage des consignes de sécurité, d'utilité et de retenue : le triptyque HHH, l'IA constitutionnelle et le refus excessif.
- ÉthiqueBiais (d'un modèle)Un écart systématique dans les réponses d'un modèle, hérité des textes qui ont fixé ses poids et des choix faits pour l'aligner — pas une erreur au hasard, mais toujours la même, dans le même sens.