Petits modèles de langage (SLM)
Les modèles compacts de moins de 4 milliards de paramètres conçus pour s'exécuter localement sur des smartphones, des ordinateurs portables et des puces NPU.
En une phrase
Section intitulée « En une phrase »Un petit modèle de langage (ou SLM) est une intelligence artificielle compacte, comptant généralement entre 1 et 4 milliards de paramètres, conçue pour fonctionner localement sur un smartphone ou un ordinateur sans envoyer aucune donnée sur Internet.
L’analogie
Section intitulée « L’analogie »Imagine que tu aies besoin de traduire une lettre importante rédigée en espagnol.
La première solution consiste à te rendre à la bibliothèque nationale au centre-ville. Là-bas se trouve une encyclopédie monumentale en trente volumes qui contient absolument tout : l’histoire de la littérature espagnole, le vocabulaire médiéval, les dialectes des Andes et la grammaire la plus pointue. C’est le grand modèle de 70 ou 400 milliards de paramètres hébergé dans le cloud. Il sait tout faire, mais le trajet est long, la bibliothèque ferme à certaines heures, et tu dois confier ta lettre privée au personnel d’accueil.
La seconde solution consiste à sortir de ta poche un petit dictionnaire de voyage de poche. Il ne pèse que 200 grammes et tient dans ton sac. Il ne contient pas les poèmes du XVIe siècle ni les traités de philosophie antique, mais il possède tous les verbes usuels, le vocabulaire du quotidien et la grammaire moderne. Tu l’ouvres instantanément chez toi, sans connexion, sans abonnement, et personne ne regarde ce que tu lis.
Le petit modèle de langage (SLM) est exactement ce dictionnaire de poche : il ne cherche pas à contenir toute la mémoire du monde, mais il accomplit les tâches du quotidien avec brio directement au creux de ta main.
Comment ça marche
Section intitulée « Comment ça marche »Pendant les premières années de la révolution de l’apprentissage profond (de 2020 à 2023), la course à la puissance était régie par une devise simple : « plus le modèle a de paramètres, plus il est intelligent ». Mais cette fuite en avant s’est heurtée à la réalité matérielle : un modèle géant de 70 milliards de paramètres exige des serveurs spécialisés équipés de plusieurs cartes graphiques hors de prix et reliés à une connexion Internet permanente.
À partir de 2024, un changement de paradigme fondamental a donné naissance aux SLM (Small Language Models).
La loi de Chinchilla et le sur-entraînement (Overtraining)
Section intitulée « La loi de Chinchilla et le sur-entraînement (Overtraining) »Pourquoi les premiers petits modèles de 2 ou 3 milliards de paramètres (sortis en 2021) étaient-ils si décevants ? Parce qu’on arrêtait leur entraînement trop tôt en appliquant la formule de calcul Kaplan de l’époque.
Les travaux fondateurs de DeepMind sur le modèle Chinchilla ont prouvé que la taille du modèle n’est que la moitié de l’équation : ce qui compte tout autant, c’est le volume de texte qu’on lui fait lire. En appliquant une stratégie de sur-entraînement (overtraining), les laboratoires ont nourri de petits modèles avec des volumes colossaux de données :
- Là où un modèle de 3 milliards de paramètres n’absorbait autrefois que 100 milliards de tokens, un modèle moderne comme Microsoft Phi-3-mini (3,8B) ou Llama 3.2 3B est entraîné sur plus de 3 000 à 9 000 milliards de tokens.
- En lisant trente fois plus de données de haute qualité, le petit modèle compresse les régularités statistiques du langage avec une efficacité redoutable et atteint des scores au banc d’essai que l’on croyait réservés aux géants du cloud.
La distillation et les manuels de synthèse
Section intitulée « La distillation et les manuels de synthèse »Pour qu’un petit modèle apprenne vite et bien, la qualité des textes doit être irréprochable. Les concepteurs utilisent deux armes secrètes :
- Les données synthétiques sur mesure : Au lieu de faire ingurgiter au modèle les commentaires houleux des réseaux sociaux, on lui fait lire des millions de petits cours synthétisés par de grands modèles maîtres, rédigés avec une pédagogie parfaite et un raisonnement pas à pas.
- La distillation de connaissances : Durant son entraînement, le petit modèle (l’élève) ne se contente pas de deviner le mot suivant : il est contraint d’imiter la distribution de probabilité complète d’un grand modèle de 70B (le professeur), absorbant ainsi sa finesse de nuance.
L’exécution locale sur NPU (Neural Processing Unit)
Section intitulée « L’exécution locale sur NPU (Neural Processing Unit) »Un modèle de 2 milliards de paramètres stocké avec des poids quantifiés en 4 bits (format GGUF) pèse environ 1,2 gigaoctet sur le disque.
C’est une taille minuscule qui tient facilement dans la mémoire vive partagée d’un téléphone moderne ou d’un PC portable. De plus, les constructeurs de processeurs (Apple avec son Neural Engine, Qualcomm avec Snapdragon, Intel avec les Core Ultra) intègrent désormais des cœurs de calcul matriciel dédiés appelés NPU :
- Le modèle génère 30 à 40 mots par seconde sans faire tourner le ventilateur de l’ordinateur.
- La consommation électrique est de seulement 2 à 5 Watts (contre 700 Watts pour un GPU de centre de données).
- L’impact sur la batterie est négligeable : une session d’assistance complète consomme moins de 1 % de charge.
Dans la vraie vie
Section intitulée « Dans la vraie vie »Les petits modèles de langage révolutionnent l’informatique personnelle et professionnelle :
- L’IA embarquée dans le système d’exploitation : Des fonctionnalités comme Apple Intelligence ou Windows Recall exécutent un petit modèle local pour résumer les notifications, corriger des courriels, trier les photos ou transcrire des réunions en direct.
- La confidentialité absolue et la conformité au RGPD : Pour les avocats, les médecins ou les services de police, faire transiter des pièces de dossier confidentielles sur les serveurs d’une entreprise américaine est interdit. Un petit modèle tournant hors-ligne sur leur ordinateur portable garantit l’anonymat total des dossiers.
- Les zones sans réseau et les secours : En mer, dans un avion, au fond d’une mine ou dans une zone sinistrée par une catastrophe naturelle, un sauveteur équipé d’un petit modèle sur sa tablette dispose d’un manuel de premiers secours interactif opérationnel sans aucune antenne relais.
Idées reçues
Section intitulée « Idées reçues »- « Un modèle de 3 milliards de paramètres est trop bête pour faire quoi que ce soit d’utile. » C’est faux : pour des tâches ciblées de résumé, d’extraction de données, de reformulation ou d’aide au code, un modèle compact moderne surpasse le modèle original de ChatGPT (GPT-3.5 de 175 milliards de paramètres) tout en tournant sur un simple téléphone.
- « Un petit modèle sait tout sur tout comme une encyclopédie mondiale. » Sa mémoire de stockage étant limitée, il ne peut pas retenir des faits historiques obscurs ou des biographies détaillées sans halluciner ; il est fait pour raisonner et transformer du texte, et doit être relié à une recherche locale (RAG) pour les connaissances précises.
Pour aller plus loin
Section intitulée « Pour aller plus loin »- L’intelligence artificielle frugale et embarquée — CNRS, 2024 (FR) : Un état des lieux des initiatives de recherche françaises pour concevoir des modèles sobres adaptés aux processeurs basse consommation.
- Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone — Marah Abdin et al., Microsoft Research, 2024 (EN) : Le rapport technique démontrant les performances spectaculaires de Phi-3-mini sur smartphone.
- Gemma 2: Improving Open Language Models at a Practical Size — Google DeepMind, août 2024 (EN) : L’architecture et la méthode de distillation massive utilisées pour créer des modèles compacts ouverts de 2B et 9B.
Voir aussi
Section intitulée « Voir aussi »Voir aussi
- EntraînementDistillationEntraîner un petit modèle à imiter les réponses d'un grand, pour garder l'essentiel de ses capacités à une fraction de sa taille.
- OptimisationGGUFLe format de fichier standard pour faire tourner des LLM en local : modèle, métadonnées et quantification dans un seul fichier.
- ÉcosystèmePoids ouverts (open weights)Un modèle dont on peut télécharger les poids : il tourne chez toi, se modifie, se compresse — sans que tu saches forcément comment il a été fabriqué.
- ÉcosystèmeCoût (tarification)Ce que coûte vraiment une réponse de modèle : des tokens facturés à l'entrée et à la sortie, des remises, des pièges, et le prix du matériel quand on l'héberge soi-même.