Aller au contenu
Écosystème

Petits modèles de langage (SLM)

Les modèles compacts de moins de 4 milliards de paramètres conçus pour s'exécuter localement sur des smartphones, des ordinateurs portables et des puces NPU.

6 min de lecture
  • #écosystème
  • #inférence locale
  • #modèle de base
  • #déploiement

Un petit modèle de langage (ou SLM) est une intelligence artificielle compacte, comptant généralement entre 1 et 4 milliards de paramètres, conçue pour fonctionner localement sur un smartphone ou un ordinateur sans envoyer aucune donnée sur Internet.

Imagine que tu aies besoin de traduire une lettre importante rédigée en espagnol.

La première solution consiste à te rendre à la bibliothèque nationale au centre-ville. Là-bas se trouve une encyclopédie monumentale en trente volumes qui contient absolument tout : l’histoire de la littérature espagnole, le vocabulaire médiéval, les dialectes des Andes et la grammaire la plus pointue. C’est le grand modèle de 70 ou 400 milliards de paramètres hébergé dans le cloud. Il sait tout faire, mais le trajet est long, la bibliothèque ferme à certaines heures, et tu dois confier ta lettre privée au personnel d’accueil.

La seconde solution consiste à sortir de ta poche un petit dictionnaire de voyage de poche. Il ne pèse que 200 grammes et tient dans ton sac. Il ne contient pas les poèmes du XVIe siècle ni les traités de philosophie antique, mais il possède tous les verbes usuels, le vocabulaire du quotidien et la grammaire moderne. Tu l’ouvres instantanément chez toi, sans connexion, sans abonnement, et personne ne regarde ce que tu lis.

Le petit modèle de langage (SLM) est exactement ce dictionnaire de poche : il ne cherche pas à contenir toute la mémoire du monde, mais il accomplit les tâches du quotidien avec brio directement au creux de ta main.

Pendant les premières années de la révolution de l’apprentissage profond (de 2020 à 2023), la course à la puissance était régie par une devise simple : « plus le modèle a de paramètres, plus il est intelligent ». Mais cette fuite en avant s’est heurtée à la réalité matérielle : un modèle géant de 70 milliards de paramètres exige des serveurs spécialisés équipés de plusieurs cartes graphiques hors de prix et reliés à une connexion Internet permanente.

À partir de 2024, un changement de paradigme fondamental a donné naissance aux SLM (Small Language Models).

La loi de Chinchilla et le sur-entraînement (Overtraining)

Section intitulée « La loi de Chinchilla et le sur-entraînement (Overtraining) »

Pourquoi les premiers petits modèles de 2 ou 3 milliards de paramètres (sortis en 2021) étaient-ils si décevants ? Parce qu’on arrêtait leur entraînement trop tôt en appliquant la formule de calcul Kaplan de l’époque.

Les travaux fondateurs de DeepMind sur le modèle Chinchilla ont prouvé que la taille du modèle n’est que la moitié de l’équation : ce qui compte tout autant, c’est le volume de texte qu’on lui fait lire. En appliquant une stratégie de sur-entraînement (overtraining), les laboratoires ont nourri de petits modèles avec des volumes colossaux de données :

  • Là où un modèle de 3 milliards de paramètres n’absorbait autrefois que 100 milliards de tokens, un modèle moderne comme Microsoft Phi-3-mini (3,8B) ou Llama 3.2 3B est entraîné sur plus de 3 000 à 9 000 milliards de tokens.
  • En lisant trente fois plus de données de haute qualité, le petit modèle compresse les régularités statistiques du langage avec une efficacité redoutable et atteint des scores au banc d’essai que l’on croyait réservés aux géants du cloud.

Pour qu’un petit modèle apprenne vite et bien, la qualité des textes doit être irréprochable. Les concepteurs utilisent deux armes secrètes :

  1. Les données synthétiques sur mesure : Au lieu de faire ingurgiter au modèle les commentaires houleux des réseaux sociaux, on lui fait lire des millions de petits cours synthétisés par de grands modèles maîtres, rédigés avec une pédagogie parfaite et un raisonnement pas à pas.
  2. La distillation de connaissances : Durant son entraînement, le petit modèle (l’élève) ne se contente pas de deviner le mot suivant : il est contraint d’imiter la distribution de probabilité complète d’un grand modèle de 70B (le professeur), absorbant ainsi sa finesse de nuance.

L’exécution locale sur NPU (Neural Processing Unit)

Section intitulée « L’exécution locale sur NPU (Neural Processing Unit) »

Un modèle de 2 milliards de paramètres stocké avec des poids quantifiés en 4 bits (format GGUF) pèse environ 1,2 gigaoctet sur le disque.

C’est une taille minuscule qui tient facilement dans la mémoire vive partagée d’un téléphone moderne ou d’un PC portable. De plus, les constructeurs de processeurs (Apple avec son Neural Engine, Qualcomm avec Snapdragon, Intel avec les Core Ultra) intègrent désormais des cœurs de calcul matriciel dédiés appelés NPU :

  • Le modèle génère 30 à 40 mots par seconde sans faire tourner le ventilateur de l’ordinateur.
  • La consommation électrique est de seulement 2 à 5 Watts (contre 700 Watts pour un GPU de centre de données).
  • L’impact sur la batterie est négligeable : une session d’assistance complète consomme moins de 1 % de charge.

Les petits modèles de langage révolutionnent l’informatique personnelle et professionnelle :

  • L’IA embarquée dans le système d’exploitation : Des fonctionnalités comme Apple Intelligence ou Windows Recall exécutent un petit modèle local pour résumer les notifications, corriger des courriels, trier les photos ou transcrire des réunions en direct.
  • La confidentialité absolue et la conformité au RGPD : Pour les avocats, les médecins ou les services de police, faire transiter des pièces de dossier confidentielles sur les serveurs d’une entreprise américaine est interdit. Un petit modèle tournant hors-ligne sur leur ordinateur portable garantit l’anonymat total des dossiers.
  • Les zones sans réseau et les secours : En mer, dans un avion, au fond d’une mine ou dans une zone sinistrée par une catastrophe naturelle, un sauveteur équipé d’un petit modèle sur sa tablette dispose d’un manuel de premiers secours interactif opérationnel sans aucune antenne relais.
  • « Un modèle de 3 milliards de paramètres est trop bête pour faire quoi que ce soit d’utile. » C’est faux : pour des tâches ciblées de résumé, d’extraction de données, de reformulation ou d’aide au code, un modèle compact moderne surpasse le modèle original de ChatGPT (GPT-3.5 de 175 milliards de paramètres) tout en tournant sur un simple téléphone.
  • « Un petit modèle sait tout sur tout comme une encyclopédie mondiale. » Sa mémoire de stockage étant limitée, il ne peut pas retenir des faits historiques obscurs ou des biographies détaillées sans halluciner ; il est fait pour raisonner et transformer du texte, et doit être relié à une recherche locale (RAG) pour les connaissances précises.

Voir aussi