Apprentissage par renforcement (RL)
Le paradigme d'entraînement où un modèle apprend à prendre des décisions séquentielles par essais-erreurs, guidé par un signal de récompense numérique.
En une phrase
Section intitulée « En une phrase »L’apprentissage par renforcement est une méthode d’entraînement où l’intelligence artificielle n’apprend pas en imitant des textes parfaits, mais en explorant différentes réponses et en ajustant ses paramètres pour maximiser une note chiffrée appelée récompense.
L’analogie
Section intitulée « L’analogie »Imagine que tu apprennes à faire du vélo sans petites roues. Personne ne peut t’enseigner par cœur la liste exacte des forces musculaires à exercer à chaque milliseconde pour tenir debout. Lire un manuel de physique de mille pages ne te sera d’aucun secours.
À la place, tu montes sur la selle et tu essaies. Si tu te penches trop à gauche, tu perds l’équilibre et tu poses le pied par terre : ton cerveau reçoit un signal négatif (la douleur ou la frustration d’avoir raté). Si tu donnes un coup de pédale au bon moment, le vélo reste droit et avance sur quelques mètres : ton cerveau reçoit une bouffée de satisfaction, un signal positif.
Au fil de centaines de petites tentatives et d’ajustements inconscients, ton système nerveux renforce les réflexes moteurs gagnants et élimine les gestes qui te font tomber.
L’apprentissage par renforcement fonctionne exactement selon cette mécanique : le modèle de langage est le cycliste, chaque mot généré est un coup de pédale, et l’algorithme distribue des récompenses ou des punitions pour l’amener à trouver de lui-même la bonne trajectoire.
Comment ça marche
Section intitulée « Comment ça marche »Dans l’apprentissage supervisé classique ou le pré-entraînement, on montre au modèle une phrase tronquée et on le corrige instant par instant (teacher forcing) : s’il prédit « pomme » au lieu de « poire », on applique immédiatement un gradient d’erreur. Mais pour des tâches complexes comme la programmation, la négociation ou la démonstration mathématique, il n’existe pas une seule bonne façon de rédiger une phrase mot à mot. Ce qui compte, c’est le résultat global final.
Le processus de décision markovien (MDP)
Section intitulée « Le processus de décision markovien (MDP) »Pour formaliser ce problème, les mathématiciens utilisent un cadre théorique appelé Processus de décision markovien :
- L’environnement : C’est le contexte de discussion, incluant la question posée et tout le texte déjà produit jusqu’ici.
- L’état ($s$) : La séquence actuelle de tokens présente dans la fenêtre d’attention.
- L’action ($a$) : Le choix probabiliste du token suivant parmi les dizaines de milliers de mots du vocabulaire.
- La politique ($\pi_\theta$) : Le grand modèle de langage lui-même, paramétré par ses milliards de poids synaptiques $\theta$, qui définit les probabilités de choisir chaque action dans un état donné.
- La récompense ($R$) : Une note numérique attribuée à la fin de l’épisode (par exemple $+1$ si le code compile et réussit tous les tests unitaires, ou $-1$ s’il produit un bogue).
Gradients de politique et algorithme PPO
Section intitulée « Gradients de politique et algorithme PPO »Comment fait-on remonter une note finale reçue tout au bout d’un paragraphe jusqu’aux mots individuels choisis au début ? C’est le problème de l’attribution du crédit.
Grâce au théorème du gradient de politique (Policy Gradient), l’algorithme augmente légèrement la probabilité de tous les choix de tokens qui ont conduit à une réponse au-dessus de la moyenne, et diminue celle des choix ayant abouti à un échec.
Pour éviter que ces mises à jour ne déstabilisent brutalement le réseau — ce qui risquerait de détruire tout ce qu’il a appris pendant le pré-entraînement —, l’industrie utilise l’algorithme PPO (Proximal Policy Optimization). PPO contraint la modification des poids à l’intérieur d’une fourchette étroite (clipping) et ajoute une pénalité mathématique (la divergence de Kullback-Leibler) qui empêche le modèle de trop s’éloigner de sa version originale.
L’essor du renforcement pur : l’algorithme GRPO
Section intitulée « L’essor du renforcement pur : l’algorithme GRPO »Historiquement, le renforcement nécessitait deux réseaux géants tournant en parallèle : un modèle acteur (qui génère le texte) et un modèle critique (qui estime la valeur intermédiaire de chaque mot). Ce dédoublement saturait la mémoire des serveurs.
En 2024, les chercheurs de DeepSeek ont introduit l’algorithme GRPO (Group Relative Policy Optimization). Au lieu d’entretenir un critique lourd, le modèle produit un groupe de plusieurs réponses alternatives pour une même consigne. On compare les scores de ces réponses entre elles : celles qui dépassent la moyenne du groupe sont récompensées, les autres pénalisées. Cette simplification drastique a permis d’entraîner des modèles de raisonnement comme DeepSeek-R1 directement par renforcement pur avec des vérificateurs de code automatiques.
Dans la vraie vie
Section intitulée « Dans la vraie vie »L’apprentissage par renforcement transforme l’intelligence artificielle générative dans de nombreux secteurs :
- Les modèles de raisonnement logique : Des modèles comme OpenAI o1 ou DeepSeek-R1 s’entraînent par renforcement sur des milliers de problèmes d’olympiades de mathématiques. En recevant une récompense uniquement si la réponse finale est vérifiable par un solveur formel, ils développent spontanément des chaînes de réflexion interne et apprennent à vérifier leurs propres calculs.
- La programmation informatique : Le compilateur sert d’arbitre objectif. Si le code généré s’exécute sans erreur et valide les tests, le modèle reçoit une récompense maximale, ce qui affine ses réflexes d’architecture logicielle sans intervention humaine.
- Les jeux et la robotique : C’est par renforcement pur qu’AlphaGo a battu le champion du monde de go en 2016 et qu’AlphaFold a appris à explorer l’espace de repliement des protéines en biologie moléculaire.
Idées reçues
Section intitulée « Idées reçues »- « L’apprentissage par renforcement permet à l’IA d’apprendre toute seule sans aucune règle humaine. » C’est une mécompréhension totale de la boucle de rétroaction. L’IA n’apprend rien sans une fonction de récompense explicitement formulée par des ingénieurs ; si la règle de score comporte une faille, le modèle l’exploitera sans vergogne pour tricher au lieu de résoudre le problème réel.
- « Le renforcement remplace le pré-entraînement sur des milliers de livres. » Le renforcement ne crée pas de vocabulaire ni de grammaire à partir de rien. Il agit comme un révélateur et un affineur : il sélectionne les meilleures capacités d’un modèle qui sait déjà lire et écrire grâce au pré-entraînement.
Pour aller plus loin
Section intitulée « Pour aller plus loin »- Apprentissage par renforcement : principes et applications — Inria, 2023 (FR) : Une synthèse pédagogique des chercheurs français sur les fondements mathématiques de l’apprentissage séquentiel et des processus markoviens.
- Reinforcement Learning: An Introduction — Richard S. Sutton et Andrew G. Barto, MIT Press, 2018 (EN) : L’ouvrage de référence académique mondial définissant les équations de Bellman et les méthodes acteur-critique.
- Proximal Policy Optimization Algorithms — John Schulman et al., OpenAI, 2017 (EN) : L’article scientifique introduisant l’algorithme PPO utilisé pour aligner les grands modèles de langage.
Voir aussi
Section intitulée « Voir aussi »Voir aussi
- EntraînementRLHFL'entraînement par comparaison de réponses, qui apprend à un modèle non pas à répondre juste, mais à répondre comme on l'attend.
- EntraînementFine-tuning (réglage fin)Poursuivre l'entraînement d'un modèle déjà entraîné sur tes propres données pour lui apprendre un style, un domaine ou une tâche.
- FondamentauxModèle de raisonnement (reasoning model)Un LLM entraîné à écrire un long brouillon avant de répondre : ce qu'il gagne sur les problèmes difficiles, ce qu'il coûte, et pourquoi son brouillon n'est pas une fenêtre sur sa pensée.
- EntraînementAlignement des modèlesLe processus mathématique et éthique visant à faire respecter par un modèle de langage des consignes de sécurité, d'utilité et de retenue : le triptyque HHH, l'IA constitutionnelle et le refus excessif.