Capacités émergentes
Les aptitudes cognitives qui semblent apparaître subitement à partir d'une certaine taille de modèle : saut qualitatif mystérieux ou mirage de nos méthodes de mesure ?
En une phrase
Section intitulée « En une phrase »Les capacités émergentes désignent l’apparition en apparence soudaine et imprévisible de nouvelles compétences complexes (comme le calcul arithmétique ou la traduction) lorsqu’un grand modèle de langage dépasse un seuil critique de taille et de données.
L’analogie
Section intitulée « L’analogie »Imagine que tu apprennes à sauter en hauteur à l’école. La barre est fixée à 1,50 mètre de haut.
Au début, tes jambes manquent de force : tu sautes à 1,10 mètre. Le professeur note sur son carnet : « Échec, zéro point ». Le mois suivant, tu t’entraînes d’arrache-pied, tes muscles se développent de manière continue et régulière, et tu parviens à sauter à 1,40 mètre. Pourtant, comme la barre tombe toujours, le professeur note encore impitoyablement : « Échec, zéro point ».
Puis, après une énième semaine d’efforts, tu améliores ta détente de seulement dix petits centimètres et tu franchis 1,51 mètre. La barre reste en place. Le professeur s’écrie alors avec stupéfaction : « C’est un miracle ! Pendant six mois cet élève était totalement incapable de sauter, et d’un coup, il a acquis le don magique du saut en hauteur ! ».
En réalité, il n’y a eu aucune magie ni aucune mutation subite : tes fibres musculaires ont progressé de façon parfaitement linéaire et continue. C’est le barème d’évaluation — la règle du « tout-ou-rien » de la barre — qui a transformé une courbe d’apprentissage fluide en un saut spectaculaire en apparence discontinu.
Le débat sur les capacités émergentes de l’intelligence artificielle pose exactement cette question : le modèle acquiert-il subitement de nouvelles facultés mystérieuses, ou est-ce notre façon de compter les points qui crée cette illusion ?
Comment ça marche
Section intitulée « Comment ça marche »Lorsque les chercheurs ont commencé à évaluer les grands modèles sur des batteries de tests exhaustives (comme le projet international BIG-bench réunissant des centaines de laboratoires), ils ont observé un phénomène saisissant :
- Sur des tâches d’arithmétique à plusieurs chiffres, de manipulation de symboles ou de résolution d’énigmes logiques, les modèles de 1, 7 ou 13 milliards de paramètres obtenaient tous un score rigoureusement plat de 0 %.
- Puis, en testant le modèle de 175 milliards de paramètres, le score bondissait d’un coup à 40 %, 60 % ou 80 % de réussite.
Dans un article retentissant publié en 2022 (Emergent Abilities of Large Language Models), Jason Wei et ses co-auteurs chez Google Research ont théorisé ce comportement : de même que l’eau liquide gèle brutalement en glace à 0 °C sans que rien ne laisse présager ce changement d’état à 1 °C, les grands modèles subiraient des « transitions de phase » cognitives où la quantité de calcul se métamorphose spontanément en qualité intellectuelle.
L’antithèse du mirage métrique
Section intitulée « L’antithèse du mirage métrique »En 2023, une équipe de chercheurs de l’Université de Stanford (Rylan Schaeffer, Brando Miranda et Sanmi Koyejo) a publié une démonstration mathématique qui a bouleversé la communauté et remporté le prix du meilleur article scientifique à la conférence NeurIPS : l’émergence discontinue est très souvent un mirage métrique.
Leur démonstration repose sur un calcul probabiliste simple mais implacable :
- Supposons qu’un modèle doive répondre à un problème dont la solution exige une chaîne de $L$ étapes consécutives (par exemple faire une multiplication de deux nombres à quatre chiffres, ce qui demande d’aligner plusieurs chiffres justes d’affilée).
- Au fur et à mesure que le modèle grandit, son mécanisme interne s’améliore de façon parfaitement fluide et prévisible selon les lois d’échelle : la probabilité $p$ qu’il a d’émettre chaque chiffre individuel correct augmente régulièrement (par exemple de 40 % à 50 %, puis 60 %, 70 %, etc.).
- Si la métrique choisie par les examinateurs est la « correspondance exacte » (exact string match, la règle du tout-ou-rien où une réponse comportant neuf chiffres justes et une seule erreur finale reçoit la note 0), la probabilité de réussir l’épreuve entière vaut $p^L$.
Or, dès que $L$ est supérieur à 4 ou 5, la fonction mathématique $p^L$ prend la forme d’un coude extrêmement abrupte : elle reste écrasée au ras du sol pendant très longtemps, avant de se redresser à la verticale comme une falaise.
En remplaçant cette métrique rigide par une métrique continue (comme la distance d’édition qui compte le nombre de chiffres déjà justes, ou la probabilité logarithmique des tokens), les chercheurs ont prouvé que la discontinuité disparaît instantanément. La courbe redevient une ligne d’apprentissage continue et prévisible sans aucune rupture magique.
Ce qui reste réellement fascinant
Section intitulée « Ce qui reste réellement fascinant »Cette démystification ne signifie pas que les grands modèles ne sont pas impressionnants :
- Même si la progression des probabilités est continue, le résultat pratique pour l’utilisateur reste spectaculaire : un programme informatique qui ne compilait pas hier se met à fonctionner aujourd’hui.
- La composition de compétences multiples : Un modèle ne devient pas simplement meilleur sur une seule tâche ; il devient capable de croiser simultanément la maîtrise de la syntaxe, la traduction d’une langue rare et le respect d’une contrainte poétique au sein d’une seule et même invite.
Dans la vraie vie
Section intitulée « Dans la vraie vie »Comprendre la nature continue ou discontinue de l’émergence est capital pour l’industrie et la société :
- La prévisibilité des coûts de recherche : Si les capacités des modèles progressent de manière continue et prévisible le long des lois d’échelle, les laboratoires peuvent anticiper avec une grande précision les performances de leurs futurs modèles avant même de dépenser des dizaines de millions de dollars en calcul.
- La sécurité et la prévention des risques extrêmes : Si des capacités dangereuses (comme la synthèse d’armes ou l’exploitation de cyberattaques) pouvaient réellement apparaître de façon totalement discontinue sans aucun signe avant-coureur, il serait impossible de sécuriser les modèles avant leur entraînement. La métrique continue permet de détecter les prémices d’une compétence bien avant qu’elle n’atteigne le seuil critique du tout-ou-rien.
- La conception des examens d’évaluation : Les universités et les centres d’évaluation repensent leurs bancs d’essai pour abandonner les questions à choix multiples simplistes au profit d’évaluations granulaires mesurant les étapes intermédiaires de raisonnement.
Idées reçues
Section intitulée « Idées reçues »- « Les grands modèles de langage acquièrent une conscience et une âme dès qu’ils dépassent 100 milliards de paramètres. » C’est une interprétation anthropomorphique trompeuse. Les modèles restent des optimiseurs statistiques géants qui minimisent l’entropie croisée sur des tokens ; l’impression d’illumination soudaine provient de notre tendance humaine à juger l’intelligence par des seuils binaires de réussite.
- « Il est impossible de prévoir ce qu’un modèle saura faire avant d’avoir achevé son pré-entraînement complet. » En utilisant des métriques d’évaluation continues et fines, les chercheurs savent tracer et projeter la trajectoire d’acquisition des compétences avec une grande fidélité.
Pour aller plus loin
Section intitulée « Pour aller plus loin »- L’émergence dans les modèles d’apprentissage : réalité ou artefact ? — Inria, 2024 (FR) : Une analyse critique des débats scientifiques autour des seuils de performance dans les modèles de fondation.
- Are Emergent Abilities of Large Language Models a Mirage? — Rylan Schaeffer, Brando Miranda et Sanmi Koyejo, Stanford University, NeurIPS 2023 (EN) : L’article primé démontrant mathématiquement comment le choix des métriques discontinues fabrique l’illusion de l’émergence.
- Emergent Abilities of Large Language Models — Jason Wei et al., Google Research, 2022 (EN) : L’article de recherche initial qui a documenté et popularisé la notion de capacités émergentes sur les benchmarks de raisonnement.
Voir aussi
Section intitulée « Voir aussi »Voir aussi
- FondamentauxModèle de raisonnement (reasoning model)Un LLM entraîné à écrire un long brouillon avant de répondre : ce qu'il gagne sur les problèmes difficiles, ce qu'il coûte, et pourquoi son brouillon n'est pas une fenêtre sur sa pensée.
- EntraînementPré-entraînementLa première phase de la vie d'un LLM, et de loin la plus chère : des semaines de calcul à deviner le token suivant sur des milliers de milliards de tokens, pour obtenir un modèle de base.
- FondamentauxPoids (paramètres)Les milliards de nombres qui stockent tout ce qu'un modèle a appris pendant son entraînement.
- FondamentauxLLM (grand modèle de langage)Un modèle d'IA entraîné sur d'immenses quantités de texte, capable de comprendre et de générer du langage.