Élagage des modèles (Pruning)
La suppression physique des connexions, des neurones ou des couches inutiles d'un réseau pour réduire sa taille et accélérer son exécution.
En une phrase
Section intitulée « En une phrase »L’élagage (ou pruning) est une technique d’optimisation qui identifie et coupe physiquement les liaisons synaptiques, les neurones ou les couches redondantes d’un grand modèle de langage pour alléger son poids et accélérer sa vitesse de réponse sans dégrader son intelligence.
L’analogie
Section intitulée « L’analogie »Imagine un viticulteur expérimenté qui s’occupe de ses vignes à la fin de l’hiver.
Au printemps précédent, la vigne a poussé dans tous les sens : elle s’est couverte de milliers de sarments, de brindilles secondaires et de feuilles épaisses. Si le vigneron laisse la vigne telle quelle, la plante va gaspiller une énergie précieuse à faire circuler la sève dans des centaines de branches inutiles, et ses raisins resteront petits et acides.
Muni de son sécateur, le viticulteur élague méthodiquement la vigne. Il coupe les rameaux morts, supprime les gourmands stériles et ne conserve que les branches maîtresses les plus vigoureuses.
À l’automne suivant, le cep est deux fois plus léger, mais ses grappes sont plus concentrées, plus sucrées et plus savoureuses : toute la sève a été concentrée sur les structures essentielles.
L’élagage d’un réseau de neurones suit exactement cette philosophie : un grand modèle sorti d’entraînement est bourré de redondances et de poids synaptiques qui dorment. En passant un coup de sécateur mathématique bien calibré, on supprime la masse superflue pour ne garder que le cœur de calcul utile.
Comment ça marche
Section intitulée « Comment ça marche »L’idée d’élaguer les réseaux neuronaux est ancienne : dès 1989, le chercheur français Yann LeCun et ses collègues des laboratoires Bell publiaient l’article historique Optimal Brain Damage, démontrant qu’on pouvait supprimer la moitié des connexions d’un réseau sans perte de performance. Mais avec l’arrivée des modèles de dizaines de milliards de paramètres, l’élagage a dû se réinventer pour s’exécuter à grande échelle.
Élagage non structuré versus structuré
Section intitulée « Élagage non structuré versus structuré »Il existe deux manières fondamentalement différentes de couper dans un réseau :
- L’élagage non structuré (Unstructured Pruning) : On inspecte tous les poids un par un, et on remplace par un zéro tous ceux dont la valeur absolue est très proche de zéro. Le réseau devient « creux » (sparse) : 50 % ou 60 % de ses matrices sont des zéros.
- Le piège matériel : Sur un processeur informatique ordinaire, multiplier une valeur par zéro prend exactement le même temps que multiplier par n’importe quel autre nombre. Par conséquent, l’élagage non structuré réduit la taille du fichier sur le disque dur si on le compresse, mais n’accélère pas du tout l’exécution en mémoire vive, sauf si l’on dispose de cartes graphiques récentes équipées de circuits spéciaux dédiés à la sparsité (comme les puces NVIDIA Ampere gérant la sparsité semi-structurée 2:4).
- L’élagage structuré (Structured Pruning) : Au lieu de retirer des chiffres isolés, on supprime des rangées entières, des colonnes entières de matrices, des têtes d’attention complètes, ou même des couches entières de calcul.
- L’avantage massif : Les matrices deviennent physiquement plus petites. Il n’y a plus aucun zéro à calculer, et l’accélération est immédiate de 100 % sur n’importe quel processeur, téléphone portable ou ordinateur portable sans équipement spécialisé.
Les algorithmes modernes : SparseGPT et Wanda
Section intitulée « Les algorithmes modernes : SparseGPT et Wanda »Comment savoir quels poids on peut couper sans rendre le modèle fou ?
Pendant longtemps, il fallait recalculer les dérivées secondes de la fonction de perte (la matrice hessienne), une opération mathématique impensable sur un modèle de 70 milliards de paramètres.
Deux avancées majeures ont débloqué la situation en 2023 :
- SparseGPT (Frantar et Alistarh, 2023) : Cet algorithme résout le problème d’élagage couche par couche en une seule passe d’inférence en formulant la coupure comme un problème de régression par moindres carrés. En seulement quelques heures de calcul sur une seule carte graphique, SparseGPT supprime jusqu’à 50 % des connexions d’un grand modèle avec une dégradation de perplexité minime.
- Wanda (Sun et al., 2023) : La méthode Wanda (Pruning by Weights and activations) va encore plus vite : elle démontre qu’il suffit de multiplier la valeur brute d’un poids par la force des activations qu’il reçoit lors du passage de vraies phrases pour connaître immédiatement son utilité. Les poids dont le produit est le plus faible sont tranchés sans aucun calcul matriciel lourd.
L’ablation de couches profondes (Layer Pruning)
Section intitulée « L’ablation de couches profondes (Layer Pruning) »En 2024, des chercheurs ont fait une découverte spectaculaire sur les modèles comme Llama 2 ou Llama 3 : en analysant la similarité des représentations entre couches consécutives, ils ont constaté que plusieurs couches situées vers le milieu du réseau font quasiment du surplace en répétant les calculs précédents.
Avec des méthodes comme ShortGPT, on peut tout simplement débrancher et supprimer d’un coup 5 à 10 couches entières au cœur d’un modèle de 70B, le transformant instantanément en un modèle de 58B qui tourne 20 % plus vite sans avoir eu besoin du moindre réentraînement.
Dans la vraie vie
Section intitulée « Dans la vraie vie »L’élagage est une brique clé pour déployer l’intelligence artificielle au plus près des utilisateurs :
- Le déploiement sur smartphones et microcontrôleurs : Pour faire entrer un modèle dans la mémoire ultra-restreinte d’une montre connectée ou d’une puce automobile, les ingénieurs combinent l’élagage structuré (pour réduire le nombre de couches) et la quantification (pour réduire la précision des nombres restants).
- La réduction de la facture de calcul des centres de données : Sur des millions de requêtes quotidiennes, faire tourner un modèle dont 20 % des couches ont été élaguées permet d’économiser des mégawatts d’électricité et de répondre aux internautes avec une latence deux fois plus faible.
- Le nettoyage des biais et des failles : En localisant et en élaguant les têtes d’attention responsables de biais toxiques ou de failles de sécurité sans toucher au reste du réseau, on peut assainir un modèle de manière chirurgicale.
Idées reçues
Section intitulée « Idées reçues »- « Si on supprime 50 % des poids d’un modèle, il perd immédiatement la moitié de ses connaissances. » C’est une erreur fondamentale sur la nature des grands réseaux. Les LLM sont immensément surparamétrés : une vaste majorité de leurs paramètres sert de redondance et de filet de sécurité statistique, et leur suppression n’affecte pas le socle de connaissances.
- « Élaguer un modèle et le quantifier sont deux mots pour dire la même chose. » Ce sont deux opérations différentes et complémentaires. L’élagage supprime des neurones et des fils de connexion ; la quantification conserve tous les neurones mais note leurs valeurs avec moins de décimales.
Pour aller plus loin
Section intitulée « Pour aller plus loin »- Optimisation et compression des réseaux de neurones profonds — Inria, 2023 (FR) : Un panorama exhaustif des méthodes d’émondage et de compression pour l’IA sobre et frugale.
- SparseGPT: Massive Language Models Can Be Accurately Pruned in One-Shot — Elias Frantar et Dan Alistarh, IST Austria, 2023 (EN) : L’article de référence démontrant l’élagage rapide à grande échelle sans réentraînement.
- Optimal Brain Damage — Yann LeCun, John S. Denker et Sara A. Solla, 1989 (EN) : L’article séminal pionnier posant les bases mathématiques de l’élagage par dérivées de second ordre.
Voir aussi
Section intitulée « Voir aussi »Voir aussi
- OptimisationQuantificationRéduire la précision des poids d'un modèle pour le rendre plus léger, plus rapide et utilisable sur du matériel grand public.
- EntraînementDistillationEntraîner un petit modèle à imiter les réponses d'un grand, pour garder l'essentiel de ses capacités à une fraction de sa taille.
- OptimisationGGUFLe format de fichier standard pour faire tourner des LLM en local : modèle, métadonnées et quantification dans un seul fichier.
- FondamentauxInférenceLe moment où le modèle tourne pour de vrai : la boucle qui écrit le texte, un token à la fois, par opposition à l'entraînement où il apprend.