Aller au contenu
Architecture

Modèles de diffusion

Une famille de modèles génératifs qui créent des images, des sons ou des vidéos en apprenant à éliminer méthodiquement le bruit d'un signal aléatoire.

6 min de lecture
  • #architecture
  • #diffusion
  • #multimodal
  • #génération

Un modèle de diffusion est une intelligence artificielle générative qui produit des images ou des sons en partant d’une purée de pixels aléatoires (du bruit pur) et en apprenant à retirer ce bruit par étapes successives pour révéler une scène nette.

Imagine un sculpteur face à un gros bloc de marbre brut et informe. Au départ, la pierre ne ressemble à rien : ce n’est qu’un amas de poussière et de roche chaotique.

Le sculpteur ne fait pas apparaître la statue d’un coup de baguette magique. À chaque coup de burin, il enlève un éclat de pierre inutile. Au premier passage, la forme générale se devine à peine. Au dixième passage, on distingue une silhouette humaine. Au quarantième passage, les plis du vêtement et les traits du visage apparaissent avec une netteté parfaite.

Le modèle de diffusion procède exactement comme ce sculpteur : le bloc de marbre brut correspond à une image constituée uniquement de neige télévisuelle (un bruit blanc aléatoire). À chaque étape de calcul, le réseau neuronal agit comme un coup de burin mathématique : il estime la part de bruit parasite à soustraire jusqu’à faire émerger l’image guidée par tes consignes.

Alors que les modèles de langage comme le transformeur génèrent du texte de manière autorégressive — en prédisant un jeton discret après l’autre de gauche à droite —, les modèles de diffusion abordent la génération sous un angle radicalement différent : ils opèrent de façon continue et globale sur l’ensemble des dimensions de l’image.

Leur fonctionnement repose sur une symétrie élégante entre deux mouvements physiques inverses.

Pour qu’un réseau de neurones sache nettoyer une image dégradée, il faut d’abord lui enseigner à quoi ressemble la dégradation. C’est le rôle du processus direct (forward process).

Durant cette phase préliminaire, on prend une photographie nette issue du jeu d’entraînement. On lui applique une série d’altérations programmées sur une échelle de temps fictive (par exemple mille pas successifs) :

  1. À chaque étape, on ajoute une petite dose de bruit statistique selon une loi normale gaussienne.
  2. Au début, la photo originale reste parfaitement visible sous un léger voile granuleux.
  3. À mi-chemin, les formes principales sont encore décelables mais les détails fins ont disparu.
  4. À la dernière étape, l’image d’origine a été totalement détruite : il ne reste qu’une matrice de pixels colorés purement aléatoires, sans aucune structure résiduelle.

Ce processus direct est purement déterministe et mathématique : il ne nécessite aucun entraînement neuronal, car la formule d’ajout de bruit est fixée par une équation d’avance.

Le cœur de l’intelligence artificielle réside dans le processus inverse (reverse process). On présente au réseau de neurones une image dégradée prise à un instant précis du calendrier de bruitage, et on lui pose une seule question mathématique : « Quel est le vecteur de bruit exact qui a été injecté pour en arriver là ? »

Le réseau apprend à prédire ce bruit parasite. Lorsqu’il sait prédire avec précision le bruit présent dans une image floue, il suffit de soustraire mathématiquement ce bruit prédit pour obtenir une version légèrement plus nette de l’image précédente.

Ce mécanisme s’appuie sur deux fondations théoriques majeures unifiées par la recherche : les modèles probabilistes de diffusion débruitants (DDPM) et les modèles basés sur le score (score matching), où le réseau apprend à estimer le gradient de la fonction de densité de probabilité pour guider les pixels vers des structures visuelles cohérentes.

En répétant cette opération de soustraction pas à pas — en partant du bruit total et en remontant jusqu’à l’image propre —, le modèle est capable de fabriquer une œuvre visuelle inédite de toutes pièces.

Comment faire pour que le modèle génère un astronaute à cheval plutôt qu’un paysage de montagne ? En introduisant un mécanisme de conditionnement textuel.

Dans les architectures modernes comme Stable Diffusion ou Flux, le texte de ton prompt est d’abord converti en vecteurs d’embeddings par un modèle de vision-langage (comme CLIP ou T5). Ces vecteurs de sens sont ensuite injectés dans le réseau de débruitage à travers des couches d’attention croisée (cross-attention). À chaque étape où le modèle retire du bruit, l’attention force les pixels à s’organiser de manière à respecter la sémantique de tes mots.

De plus, pour éviter de manipuler directement des millions de pixels réels (ce qui exigerait une puissance de calcul colossale), les modèles de diffusion latente (Latent Diffusion Models) utilisent un auto-encodeur variationnel pour compresser l’image dans un espace mathématique réduit (l’espace latent) avant de réaliser le débruitage, multipliant la vitesse d’exécution par dix.

Cinq étapes du calendrier de débruitage : d’une matrice de bruit gaussien pur à une illustration complète guidée par la consigne textuelle. Observe comment les basses fréquences (silhouettes) émergent avant les hautes fréquences (détails fins).

Comment un modèle transforme-t-il du bruit pur en image ?

Niveau de bruit 100% (t = 1000)
Phase Bruit gaussien pur
Prompt « Chat astronaute sur la Lune »

Étape 1/5 Au départ, il n'y a rien qu'un carré de bruit statistique pur : des milliers de pixels aléatoires tirés d'une loi normale gaussienne (la 'neige' d'un écran sans signal).

Chiffres illustratifs, choisis pour rendre le mécanisme lisible.

Les modèles de diffusion sont devenus la référence absolue pour toute la création numérique multimédia contemporaine :

  • Génération d’images artistiques et publicitaires : Des plateformes grand public comme Midjourney, DALL-E 3 ou Adobe Firefly s’appuient sur des modèles de diffusion pour permettre à des graphistes et créatifs de produire des illustrations haute résolution en quelques secondes.
  • Production et synthèse de vidéos : Les architectures récentes de diffusion spatio-temporelle (comme Sora ou Runway Gen-3) appliquent le débruitage à des blocs de plusieurs images simultanées, garantissant une cohérence physique des mouvements dans le temps.
  • Restauration et retouche d’images (Inpainting) : En masquant une zone précise d’une photographie ancienne (une rayure, un passant indésirable) et en y injectant du bruit, un modèle de diffusion peut reconstituer la partie manquante en parfaite harmonie avec le décor environnant.
  • Conception de médicaments et biologie structurale : Le principe mathématique de débruitage est également appliqué pour générer de nouvelles molécules chimiques et prédire le repliement tridimensionnel des protéines en modélisant leurs coordonnées spatiales continues.
  • « Midjourney et Stable Diffusion génèrent des images en copiant et collant des bouts de photographies glanées sur Internet. » C’est une erreur complète sur le mécanisme physique. Le modèle ne conserve aucune bibliothèque d’images dans ses poids. Il commence son calcul sur un écran de neige aléatoire et calcule mathématiquement chaque nuance de couleur à partir de lois de probabilité apprises.
  • « Une description textuelle plus longue met plus de temps à fabriquer l’image. » Le temps de génération d’une image dépend exclusivement de la résolution souhaitée et du nombre d’étapes de débruitage demandées à l’échantillonneur. Le prompt textuel, quant à lui, est analysé en une fraction de milliseconde au tout début du processus.
  • « Les modèles de diffusion fonctionnent sur la même logique de prédiction de mot suivant que ChatGPT. » Un modèle de langage est discret et autorégressif (il empile des mots un par un), tandis qu’un modèle de diffusion est continu et itératif (il affine l’ensemble des pixels de l’image simultanément sur plusieurs passes).

Voir aussi