Modèles de diffusion
Une famille de modèles génératifs qui créent des images, des sons ou des vidéos en apprenant à éliminer méthodiquement le bruit d'un signal aléatoire.
En une phrase
Section intitulée « En une phrase »Un modèle de diffusion est une intelligence artificielle générative qui produit des images ou des sons en partant d’une purée de pixels aléatoires (du bruit pur) et en apprenant à retirer ce bruit par étapes successives pour révéler une scène nette.
L’analogie
Section intitulée « L’analogie »Imagine un sculpteur face à un gros bloc de marbre brut et informe. Au départ, la pierre ne ressemble à rien : ce n’est qu’un amas de poussière et de roche chaotique.
Le sculpteur ne fait pas apparaître la statue d’un coup de baguette magique. À chaque coup de burin, il enlève un éclat de pierre inutile. Au premier passage, la forme générale se devine à peine. Au dixième passage, on distingue une silhouette humaine. Au quarantième passage, les plis du vêtement et les traits du visage apparaissent avec une netteté parfaite.
Le modèle de diffusion procède exactement comme ce sculpteur : le bloc de marbre brut correspond à une image constituée uniquement de neige télévisuelle (un bruit blanc aléatoire). À chaque étape de calcul, le réseau neuronal agit comme un coup de burin mathématique : il estime la part de bruit parasite à soustraire jusqu’à faire émerger l’image guidée par tes consignes.
Comment ça marche
Section intitulée « Comment ça marche »Alors que les modèles de langage comme le transformeur génèrent du texte de manière autorégressive — en prédisant un jeton discret après l’autre de gauche à droite —, les modèles de diffusion abordent la génération sous un angle radicalement différent : ils opèrent de façon continue et globale sur l’ensemble des dimensions de l’image.
Leur fonctionnement repose sur une symétrie élégante entre deux mouvements physiques inverses.
Le processus direct : apprendre à détruire
Section intitulée « Le processus direct : apprendre à détruire »Pour qu’un réseau de neurones sache nettoyer une image dégradée, il faut d’abord lui enseigner à quoi ressemble la dégradation. C’est le rôle du processus direct (forward process).
Durant cette phase préliminaire, on prend une photographie nette issue du jeu d’entraînement. On lui applique une série d’altérations programmées sur une échelle de temps fictive (par exemple mille pas successifs) :
- À chaque étape, on ajoute une petite dose de bruit statistique selon une loi normale gaussienne.
- Au début, la photo originale reste parfaitement visible sous un léger voile granuleux.
- À mi-chemin, les formes principales sont encore décelables mais les détails fins ont disparu.
- À la dernière étape, l’image d’origine a été totalement détruite : il ne reste qu’une matrice de pixels colorés purement aléatoires, sans aucune structure résiduelle.
Ce processus direct est purement déterministe et mathématique : il ne nécessite aucun entraînement neuronal, car la formule d’ajout de bruit est fixée par une équation d’avance.
Le processus inverse : apprendre à restaurer
Section intitulée « Le processus inverse : apprendre à restaurer »Le cœur de l’intelligence artificielle réside dans le processus inverse (reverse process). On présente au réseau de neurones une image dégradée prise à un instant précis du calendrier de bruitage, et on lui pose une seule question mathématique : « Quel est le vecteur de bruit exact qui a été injecté pour en arriver là ? »
Le réseau apprend à prédire ce bruit parasite. Lorsqu’il sait prédire avec précision le bruit présent dans une image floue, il suffit de soustraire mathématiquement ce bruit prédit pour obtenir une version légèrement plus nette de l’image précédente.
Ce mécanisme s’appuie sur deux fondations théoriques majeures unifiées par la recherche : les modèles probabilistes de diffusion débruitants (DDPM) et les modèles basés sur le score (score matching), où le réseau apprend à estimer le gradient de la fonction de densité de probabilité pour guider les pixels vers des structures visuelles cohérentes.
En répétant cette opération de soustraction pas à pas — en partant du bruit total et en remontant jusqu’à l’image propre —, le modèle est capable de fabriquer une œuvre visuelle inédite de toutes pièces.
Le guidage par le texte et l’espace latent
Section intitulée « Le guidage par le texte et l’espace latent »Comment faire pour que le modèle génère un astronaute à cheval plutôt qu’un paysage de montagne ? En introduisant un mécanisme de conditionnement textuel.
Dans les architectures modernes comme Stable Diffusion ou Flux, le texte de ton prompt est d’abord converti en vecteurs d’embeddings par un modèle de vision-langage (comme CLIP ou T5). Ces vecteurs de sens sont ensuite injectés dans le réseau de débruitage à travers des couches d’attention croisée (cross-attention). À chaque étape où le modèle retire du bruit, l’attention force les pixels à s’organiser de manière à respecter la sémantique de tes mots.
De plus, pour éviter de manipuler directement des millions de pixels réels (ce qui exigerait une puissance de calcul colossale), les modèles de diffusion latente (Latent Diffusion Models) utilisent un auto-encodeur variationnel pour compresser l’image dans un espace mathématique réduit (l’espace latent) avant de réaliser le débruitage, multipliant la vitesse d’exécution par dix.
Visualisation
Section intitulée « Visualisation »Cinq étapes du calendrier de débruitage : d’une matrice de bruit gaussien pur à une illustration complète guidée par la consigne textuelle. Observe comment les basses fréquences (silhouettes) émergent avant les hautes fréquences (détails fins).
Comment un modèle transforme-t-il du bruit pur en image ?
Étape 1/5 Au départ, il n'y a rien qu'un carré de bruit statistique pur : des milliers de pixels aléatoires tirés d'une loi normale gaussienne (la 'neige' d'un écran sans signal).
Chiffres illustratifs, choisis pour rendre le mécanisme lisible.
Dans la vraie vie
Section intitulée « Dans la vraie vie »Les modèles de diffusion sont devenus la référence absolue pour toute la création numérique multimédia contemporaine :
- Génération d’images artistiques et publicitaires : Des plateformes grand public comme Midjourney, DALL-E 3 ou Adobe Firefly s’appuient sur des modèles de diffusion pour permettre à des graphistes et créatifs de produire des illustrations haute résolution en quelques secondes.
- Production et synthèse de vidéos : Les architectures récentes de diffusion spatio-temporelle (comme Sora ou Runway Gen-3) appliquent le débruitage à des blocs de plusieurs images simultanées, garantissant une cohérence physique des mouvements dans le temps.
- Restauration et retouche d’images (Inpainting) : En masquant une zone précise d’une photographie ancienne (une rayure, un passant indésirable) et en y injectant du bruit, un modèle de diffusion peut reconstituer la partie manquante en parfaite harmonie avec le décor environnant.
- Conception de médicaments et biologie structurale : Le principe mathématique de débruitage est également appliqué pour générer de nouvelles molécules chimiques et prédire le repliement tridimensionnel des protéines en modélisant leurs coordonnées spatiales continues.
Idées reçues
Section intitulée « Idées reçues »- « Midjourney et Stable Diffusion génèrent des images en copiant et collant des bouts de photographies glanées sur Internet. » C’est une erreur complète sur le mécanisme physique. Le modèle ne conserve aucune bibliothèque d’images dans ses poids. Il commence son calcul sur un écran de neige aléatoire et calcule mathématiquement chaque nuance de couleur à partir de lois de probabilité apprises.
- « Une description textuelle plus longue met plus de temps à fabriquer l’image. » Le temps de génération d’une image dépend exclusivement de la résolution souhaitée et du nombre d’étapes de débruitage demandées à l’échantillonneur. Le prompt textuel, quant à lui, est analysé en une fraction de milliseconde au tout début du processus.
- « Les modèles de diffusion fonctionnent sur la même logique de prédiction de mot suivant que ChatGPT. » Un modèle de langage est discret et autorégressif (il empile des mots un par un), tandis qu’un modèle de diffusion est continu et itératif (il affine l’ensemble des pixels de l’image simultanément sur plusieurs passes).
Pour aller plus loin
Section intitulée « Pour aller plus loin »- Denoising Diffusion Probabilistic Models (DDPM) — Jonathan Ho et al., 2020 (EN) : L’article séminal qui a posé les bases mathématiques de la génération d’images par débruitage stochastique moderne.
- Comprendre les modèles de diffusion pour la génération d’images — Loïck Bourdois, 2023 (FR) : Une synthèse technique claire et abondamment illustrée en français expliquant le passage du bruit à l’image haute définition.
- High-Resolution Image Synthesis with Latent Diffusion Models — Robin Rombach et al., 2022 (EN) : La publication officielle détaillant l’architecture de Stable Diffusion et l’utilisation de l’espace latent pour accélérer le calcul.
Voir aussi
Section intitulée « Voir aussi »Voir aussi
- ArchitectureTransformer (transformeur)L'architecture de réseau de neurones sur laquelle tous les LLM sont bâtis : une pile de blocs identiques que le texte traverse de bout en bout.
- ArchitectureMultimodalitéQuand un modèle ne lit plus seulement du texte : image et son sont découpés à leur tour, projetés dans le même espace que les mots, et traités par la même machine.
- ArchitectureAttention (self-attention)Le mécanisme qui permet à chaque token de regarder les autres pour décider lesquels comptent pour son propre sens.
- ÉthiqueDésinformation et hypertrucagesL'impact des modèles génératifs sur la fabrication massive de faux récits, d'images trompeuses et d'hypertrucages, et les limites de l'authentification par la norme C2PA.