Aller au contenu
Architecture

Multimodalité

Quand un modèle ne lit plus seulement du texte : image et son sont découpés à leur tour, projetés dans le même espace que les mots, et traités par la même machine.

5 min de lecture
  • #vision
  • #audio
  • #encodeur
  • #patchs

Un modèle multimodal, c’est un modèle de langage à qui on a branché des traducteurs : une image ou un son sont découpés en petits morceaux, convertis dans la même sorte de nombres qu’un mot, et mis à la suite du texte — si bien que la machine qui lit derrière n’a jamais eu besoin d’apprendre à voir.

Une réunion où chacun parle une langue différente. Plutôt que d’apprendre toutes les langues à l’animatrice, on place un interprète devant chaque participant, et tous traduisent vers la même langue de travail.

Elle n’entend donc qu’une langue, et n’a jamais besoin de savoir d’où venait la phrase. Un modèle multimodal marche comme ça : il n’a pas appris à voir, on a mis un traducteur d’images devant lui.

L’idée décisive vient du Vision Transformer (Dosovitskiy et al., 2020) : on découpe l’image en carrés de 16 pixels de côté, on aplatit chacun en une liste de nombres, on la projette en vecteur, et on ajoute un repère de position. Un patch est au transformeur ce qu’un token est au texte.

Les ordres de grandeur comptent, parce qu’ils se paient : une image de 224 × 224 pixels donne 196 patchs, et une image pleine résolution chez un assistant grand public consomme de l’ordre du millier de tokens de fenêtre de contexte.

Reste à ce que les nombres d’une image et ceux d’un mot vivent dans le même monde. CLIP (Radford et al., 2021) y parvient avec 400 millions de paires image/légende récoltées sur le web, deux encodeurs — un pour l’image, un pour le texte — et un entraînement contrastif : rapprocher les paires qui vont ensemble, éloigner les autres.

Résultat : la photo d’un chat et le mot « chat » finissent au même endroit de l’espace des embeddings. C’est ce qui rend possible de chercher dans une photothèque avec des mots.

LLaVA (Liu et al., 2023) montre à quel point le raccord peut être économique : on gèle l’encodeur d’images et le modèle de langage, on n’entraîne qu’une petite couche de projection entre les deux, puis on affine sur des instructions visuelles. Quelques heures de GPU, là où entraîner un modèle de langage coûte des mois.

Flamingo (Alayrac et al., 2022) avait exploré une autre voie : insérer des couches d’attention croisée dans la pile plutôt que de tout faire passer par l’entrée.

Les modèles récents ne sont plus recollés après coup : ils sont entraînés nativement sur du texte, des images et du son mêlés. Le son suit d’ailleurs la même recette que l’image — on le convertit en spectrogramme, une représentation visuelle du temps et des fréquences, qu’on découpe (Whisper, 2022).

Une asymétrie mérite d’être connue : lire une image et fabriquer une image ne relèvent pas du même procédé. La génération d’images passe par la diffusion, pas par la prédiction de token. C’est pourquoi écrire un texte et produire une illustration ne coûtent pas du tout la même chose.

Lire l’heure sur une horloge à aiguilles, compter précisément des objets nombreux, suivre la douzième ligne d’un tableau dense : ces échecs sont réguliers, et ils viennent du découpage. Ce qui n’a pas survécu à la résolution des patchs n’existe pas pour le modèle — qui répondra quand même.

Et une consigne cachée dans une image est une injection de prompt : l’OWASP a ajouté ce vecteur multimodal à sa liste des risques en 2025.

  • Photographier un exercice de maths et demander l’explication : c’est l’usage scolaire le plus répandu, et celui où les erreurs de lecture de l’énoncé se voient le plus.
  • La description d’images pour les personnes aveugles ou malvoyantes. Be My Eyes a branché un modèle multimodal sur son service d’assistance en 2023, sous le nom « Be My AI » — un cas où la technologie remplace une attente humaine par une réponse immédiate.
  • Le sous-titrage automatique dans les outils de visioconférence repose sur des modèles de la famille de Whisper.
  • Chercher « photos de vélo » dans une photothèque jamais étiquetée : c’est CLIP tel quel, sans génération de texte.
  • Le revers : une image mange la fenêtre, donc l’argent, et part sur un serveur. Une photo d’un document administratif est un document administratif envoyé à un tiers.
  • « Le modèle voit vraiment l’image. » Il reçoit une grille de vecteurs calculée par un encodeur, à une résolution fixée à l’avance. Ce qui n’a pas survécu au découpage — un texte minuscule, deux aiguilles d’horloge, la douzième ligne d’un tableau — n’existe tout simplement pas pour lui, et il répondra quand même.
  • « Un modèle multimodal, c’est plusieurs modèles reliés par un aiguillage. » Il n’y a pas d’aiguillage qui déciderait « ceci est une image, j’appelle le module image » : patchs et tokens sont mis bout à bout dans une seule séquence et traversent les mêmes couches d’attention. C’est ce mélange qui te permet de poser une question sur un détail précis de la photo.
  • « Ce qui est écrit dans une image ne peut pas être une consigne. » Si : une phrase peinte sur un mur, ou écrite en gris très clair dans un coin, arrive dans la même séquence que ta question, avec le même statut. L’OWASP a ajouté l’injection multimodale à sa liste des risques en 2025.

Voir aussi