Multimodalité
Quand un modèle ne lit plus seulement du texte : image et son sont découpés à leur tour, projetés dans le même espace que les mots, et traités par la même machine.
En une phrase
Section intitulée « En une phrase »Un modèle multimodal, c’est un modèle de langage à qui on a branché des traducteurs : une image ou un son sont découpés en petits morceaux, convertis dans la même sorte de nombres qu’un mot, et mis à la suite du texte — si bien que la machine qui lit derrière n’a jamais eu besoin d’apprendre à voir.
L’analogie
Section intitulée « L’analogie »Une réunion où chacun parle une langue différente. Plutôt que d’apprendre toutes les langues à l’animatrice, on place un interprète devant chaque participant, et tous traduisent vers la même langue de travail.
Elle n’entend donc qu’une langue, et n’a jamais besoin de savoir d’où venait la phrase. Un modèle multimodal marche comme ça : il n’a pas appris à voir, on a mis un traducteur d’images devant lui.
Comment ça marche
Section intitulée « Comment ça marche »Découper une image comme on découpe une phrase
Section intitulée « Découper une image comme on découpe une phrase »L’idée décisive vient du Vision Transformer (Dosovitskiy et al., 2020) : on découpe l’image en carrés de 16 pixels de côté, on aplatit chacun en une liste de nombres, on la projette en vecteur, et on ajoute un repère de position. Un patch est au transformeur ce qu’un token est au texte.
Les ordres de grandeur comptent, parce qu’ils se paient : une image de 224 × 224 pixels donne 196 patchs, et une image pleine résolution chez un assistant grand public consomme de l’ordre du millier de tokens de fenêtre de contexte.
Aligner deux espaces : CLIP
Section intitulée « Aligner deux espaces : CLIP »Reste à ce que les nombres d’une image et ceux d’un mot vivent dans le même monde. CLIP (Radford et al., 2021) y parvient avec 400 millions de paires image/légende récoltées sur le web, deux encodeurs — un pour l’image, un pour le texte — et un entraînement contrastif : rapprocher les paires qui vont ensemble, éloigner les autres.
Résultat : la photo d’un chat et le mot « chat » finissent au même endroit de l’espace des embeddings. C’est ce qui rend possible de chercher dans une photothèque avec des mots.
Coller l’encodeur au modèle : la projection
Section intitulée « Coller l’encodeur au modèle : la projection »LLaVA (Liu et al., 2023) montre à quel point le raccord peut être économique : on gèle l’encodeur d’images et le modèle de langage, on n’entraîne qu’une petite couche de projection entre les deux, puis on affine sur des instructions visuelles. Quelques heures de GPU, là où entraîner un modèle de langage coûte des mois.
Flamingo (Alayrac et al., 2022) avait exploré une autre voie : insérer des couches d’attention croisée dans la pile plutôt que de tout faire passer par l’entrée.
De bout en bout, et dans les deux sens
Section intitulée « De bout en bout, et dans les deux sens »Les modèles récents ne sont plus recollés après coup : ils sont entraînés nativement sur du texte, des images et du son mêlés. Le son suit d’ailleurs la même recette que l’image — on le convertit en spectrogramme, une représentation visuelle du temps et des fréquences, qu’on découpe (Whisper, 2022).
Une asymétrie mérite d’être connue : lire une image et fabriquer une image ne relèvent pas du même procédé. La génération d’images passe par la diffusion, pas par la prédiction de token. C’est pourquoi écrire un texte et produire une illustration ne coûtent pas du tout la même chose.
Ce que ça ne donne pas
Section intitulée « Ce que ça ne donne pas »Lire l’heure sur une horloge à aiguilles, compter précisément des objets nombreux, suivre la douzième ligne d’un tableau dense : ces échecs sont réguliers, et ils viennent du découpage. Ce qui n’a pas survécu à la résolution des patchs n’existe pas pour le modèle — qui répondra quand même.
Et une consigne cachée dans une image est une injection de prompt : l’OWASP a ajouté ce vecteur multimodal à sa liste des risques en 2025.
Dans la vraie vie
Section intitulée « Dans la vraie vie »- Photographier un exercice de maths et demander l’explication : c’est l’usage scolaire le plus répandu, et celui où les erreurs de lecture de l’énoncé se voient le plus.
- La description d’images pour les personnes aveugles ou malvoyantes. Be My Eyes a branché un modèle multimodal sur son service d’assistance en 2023, sous le nom « Be My AI » — un cas où la technologie remplace une attente humaine par une réponse immédiate.
- Le sous-titrage automatique dans les outils de visioconférence repose sur des modèles de la famille de Whisper.
- Chercher « photos de vélo » dans une photothèque jamais étiquetée : c’est CLIP tel quel, sans génération de texte.
- Le revers : une image mange la fenêtre, donc l’argent, et part sur un serveur. Une photo d’un document administratif est un document administratif envoyé à un tiers.
Idées reçues
Section intitulée « Idées reçues »- « Le modèle voit vraiment l’image. » Il reçoit une grille de vecteurs calculée par un encodeur, à une résolution fixée à l’avance. Ce qui n’a pas survécu au découpage — un texte minuscule, deux aiguilles d’horloge, la douzième ligne d’un tableau — n’existe tout simplement pas pour lui, et il répondra quand même.
- « Un modèle multimodal, c’est plusieurs modèles reliés par un aiguillage. » Il n’y a pas d’aiguillage qui déciderait « ceci est une image, j’appelle le module image » : patchs et tokens sont mis bout à bout dans une seule séquence et traversent les mêmes couches d’attention. C’est ce mélange qui te permet de poser une question sur un détail précis de la photo.
- « Ce qui est écrit dans une image ne peut pas être une consigne. » Si : une phrase peinte sur un mur, ou écrite en gris très clair dans un coin, arrive dans la même séquence que ta question, avec le même statut. L’OWASP a ajouté l’injection multimodale à sa liste des risques en 2025.
Pour aller plus loin
Section intitulée « Pour aller plus loin »- « An Image is Worth 16x16 Words » — Dosovitskiy et al., 2020 (EN) : le Vision Transformer.
- « Learning Transferable Visual Models From Natural Language Supervision » — Radford et al., 2021 (EN) : CLIP.
- « Visual Instruction Tuning » — Liu et al., 2023 (EN) : LLaVA, et le raccord à moindre coût.
- « Flamingo: a Visual Language Model for Few-Shot Learning » — Alayrac et al., 2022 (EN).
- « Robust Speech Recognition via Large-Scale Weak Supervision » — Radford et al., 2022 (EN) : Whisper.
- « Qu’est-ce qu’un modèle vision-langage (VLM) ? » — Caballar et Stryker, IBM, 2025 (FR) : encodeur visuel, CLIP et LLaVA expliqués pas à pas.
Voir aussi
Section intitulée « Voir aussi »Voir aussi
- ArchitectureTransformer (transformeur)L'architecture de réseau de neurones sur laquelle tous les LLM sont bâtis : une pile de blocs identiques que le texte traverse de bout en bout.
- ArchitectureAttention (self-attention)Le mécanisme qui permet à chaque token de regarder les autres pour décider lesquels comptent pour son propre sens.
- FondamentauxLLM (grand modèle de langage)Un modèle d'IA entraîné sur d'immenses quantités de texte, capable de comprendre et de générer du langage.
- FondamentauxFenêtre de contexteLa quantité maximale de texte qu'un modèle peut prendre en compte d'un coup : sa « mémoire de travail ».
- FondamentauxPrompt (instruction générative)Le texte que le modèle a sous les yeux au moment de répondre, et le seul levier qui reste une fois qu'il est entraîné.
- ÉthiqueBiais (d'un modèle)Un écart systématique dans les réponses d'un modèle, hérité des textes qui ont fixé ses poids et des choix faits pour l'aligner — pas une erreur au hasard, mais toujours la même, dans le même sens.
- ArchitectureModèles de diffusionUne famille de modèles génératifs qui créent des images, des sons ou des vidéos en apprenant à éliminer méthodiquement le bruit d'un signal aléatoire.