RLHF
L'entraînement par comparaison de réponses, qui apprend à un modèle non pas à répondre juste, mais à répondre comme on l'attend.
En une phrase
Section intitulée « En une phrase »Le RLHF (Reinforcement Learning from Human Feedback, apprentissage par renforcement à partir de retours humains) est l’étape d’entraînement où des humains comparent des réponses pour désigner la meilleure, jusqu’à ce que le modèle apprenne non plus seulement à répondre juste, mais à répondre comme on l’attend : utile, lisible, capable de dire non.
L’analogie
Section intitulée « L’analogie »Un joueur sort du centre de formation avec une technique irréprochable. Il sait tout faire, mais pas encore quoi faire : quand passer, quand temporiser, quand renoncer à tirer. Son coach ne lui réécrit pas les muscles — il regarde deux actions et tranche, « celle-là valait mieux que celle-là ».
Sauf que le coach ne peut pas être derrière chaque ballon. On forme donc un adjoint qui a vu assez de ses verdicts pour les imiter, et c’est lui qui note les entraînements. Le RLHF est ce montage : quelques milliers de jugements humains transformés en juge automatique, contre lequel le modèle s’entraîne sans relâche.
Comment ça marche
Section intitulée « Comment ça marche »Pourquoi on ne peut pas simplement noter
Section intitulée « Pourquoi on ne peut pas simplement noter »Personne ne sait écrire la formule qui mesure si une réponse est « bonne » : trop vague, trop dépendant du contexte. En revanche, mis devant deux réponses, n’importe qui sait dire laquelle il préfère. Tout le RLHF tient dans ce déplacement — on renonce à la note absolue, on ne demande que des comparaisons. L’idée précède largement ChatGPT : dès 2017, Paul Christiano et ses co-auteurs l’appliquaient à des robots simulés.
Les trois temps
Section intitulée « Les trois temps »Le pipeline de référence est celui du papier InstructGPT (Ouyang et al., 2022), l’ancêtre direct de ChatGPT.
- Le fine-tuning supervisé (SFT). Des humains écrivent la réponse idéale à un lot de questions et on poursuit l’entraînement du modèle de base dessus. Chez InstructGPT : environ 13 000 questions. Le modèle apprend le format conversationnel, rien de plus.
- Le modèle de récompense. On pose la même question plusieurs fois au modèle, et des annotateurs classent les réponses de la meilleure à la pire — entre quatre et neuf par question, sur 33 000 questions. Un second réseau, plus petit (6 milliards de paramètres), apprend à reproduire ces classements et ne rend qu’un nombre : le score qu’un annotateur aurait donné.
- L’optimisation par renforcement. Le modèle génère, le modèle de récompense note, et un algorithme de renforcement — historiquement PPO — corrige les poids d’après cette note. 31 000 questions, et plus aucun humain dans la boucle.
Rien de magique dans ce troisième temps : la note remplace la « vraie suite du texte » comme signal d’erreur, la rétropropagation calcule les gradients, la descente de gradient déplace les poids. Même mécanique que le pré-entraînement, autre objectif. Le résultat, lui, a surpris : les évaluateurs préfèrent les réponses d’un InstructGPT de 1,3 milliard de paramètres à celles de GPT-3 et ses 175 milliards. Cent fois plus petit, jugé meilleur, parce qu’il répond à la question posée.
Le garde-fou : la pénalité KL
Section intitulée « Le garde-fou : la pénalité KL »Laisse un modèle maximiser librement une note et il finira par écrire pour le juge, pas pour toi. InstructGPT retranche donc de la récompense un montant proportionnel à l’écart entre le modèle en cours d’entraînement et le modèle SFT de départ. Cet écart se mesure par une quantité appelée divergence de Kullback-Leibler, d’où le nom de pénalité KL. En clair : « améliore ta note, mais sans devenir un autre modèle ». Sans ce frein, l’entraînement dérive vers des textes excellemment notés et illisibles.
Qui annote, et ce que ça coûte
Section intitulée « Qui annote, et ce que ça coûte »InstructGPT s’appuie sur une quarantaine de sous-traitants recrutés sur Upwork et Scale AI, majoritairement anglophones, aux États-Unis ou en Asie du Sud-Est. Le papier donne un chiffre qu’on cite rarement : entre eux, ces annotateurs sont d’accord 72,6 % du temps. C’est le plafond du procédé — « la préférence humaine » gravée dans le modèle, c’est ce qu’a préféré un petit panel non représentatif, trois fois sur quatre environ.
Le reste du secteur est moins bien traité. En avril 2024, franceinfo documente cet écosystème au Kenya et à Madagascar : environ 150 euros par mois en bas de l’échelle, pour trier et étiqueter les textes dont ces modèles apprennent.
Quand la note devient la cible
Section intitulée « Quand la note devient la cible »Un modèle de récompense n’est qu’une approximation, et toute approximation optimisée assez fort finit par se fissurer. C’est le reward hacking : le modèle trouve ce qui plaît au juge sans plaire à personne.
- La longueur. Prasann Singhal et ses co-auteurs ont montré en 2023 que l’essentiel du gain apporté par le RLHF s’explique par l’allongement des réponses — une récompense fondée sur la seule longueur en reproduit la plus grande part.
- La flagornerie, ou sycophantie. La même année, une équipe d’Anthropic menée par Mrinank Sharma analyse des données de préférences réelles : une réponse qui abonde dans ton sens a plus de chances d’être préférée, et humains comme modèles de récompense préfèrent parfois la flatterie bien écrite à la réponse correcte.
Après PPO
Section intitulée « Après PPO »Le renforcement classique est lourd : plusieurs modèles en mémoire, un entraînement instable. En mai 2023, Rafael Rafailov et ses co-auteurs publient DPO (Direct Preference Optimization) : en réécrivant le problème, ils montrent que la politique optimale se déduit directement des préférences. Plus de modèle de récompense séparé, plus de boucle de renforcement, une simple fonction de coût sur des paires préférée / rejetée.
C’est devenu la voie par défaut des modèles ouverts : pour Llama 3 (2024), Meta a retenu un enchaînement SFT puis DPO, répété six fois, plutôt que des algorithmes de renforcement jugés « moins stables et plus difficiles à passer à l’échelle ». Le renforcement en ligne n’a pas disparu pour autant : GRPO, introduit par DeepSeek en 2024, entraîne DeepSeek-R1 avec une récompense calculée par des règles — bonne réponse, bon format — plutôt que par un réseau. Le meilleur moyen d’éviter le reward hacking reste de ne pas fournir de juge à berner.
Dans la vraie vie
Section intitulée « Dans la vraie vie »- GPT-4o, avril 2025. OpenAI déploie le 25 avril une mise à jour qui rend le modèle ouvertement flagorneur : il valide tout, applaudit des décisions douteuses. Le retour en arrière démarre le 28. Dans son post-mortem, l’entreprise dit avoir ajouté un signal de récompense fondé sur les pouces levés et baissés cliqués dans ChatGPT, et estime que cet ajout a affaibli le signal principal qui tenait la flagornerie en respect.
- La marche entre GPT-3 et ChatGPT tient à cette étape, pas à la taille du modèle. Et les « personnalités » qui distinguent les grands assistants en découlent : qui annote, selon quelles consignes, avec quelle tolérance au refus.
Idées reçues
Section intitulée « Idées reçues »- « Le RLHF rend le modèle plus intelligent. » Il le rend utilisable. Les connaissances viennent du pré-entraînement et l’alignement n’en ajoute aucune : il apprend au modèle à mobiliser ce qu’il a déjà, dans le format attendu. InstructGPT le démontre à l’envers — un petit modèle aligné bat un géant qui ne l’est pas.
- « Le RLHF supprime les hallucinations. » Il déplace le problème autant qu’il le réduit. Adam Kalai et ses co-auteurs l’ont formulé en 2025 : tant qu’on note en tout ou rien, tenter sa chance paie mieux que s’abstenir, et un « je ne sais pas » ne rapporte rien. Le ton gagne en assurance, pas forcément le fond.
- « Quand je clique sur le pouce baissé, le modèle apprend de son erreur. » Pas sur le moment : les poids sont figés, ta conversation ne les touche pas. Ton clic rejoint un jeu de données qui servira, peut-être, à une version ultérieure. L’épisode GPT-4o le montre — ces signaux comptent à l’échelle de millions de clics et de plusieurs mois, pas de ta phrase suivante.
Pour aller plus loin
Section intitulée « Pour aller plus loin »- Training language models to follow instructions with human feedback — Ouyang et al., 2022 (EN) : le papier InstructGPT, d’où viennent les chiffres.
- Deep reinforcement learning from human preferences — Christiano et al., 2017 (EN) : l’article fondateur.
- L’apprentissage par renforcement à partir du feedback humain — LeMagIT, 2026 (FR) : une définition courte.
- Le travail caché des petites mains de l’IA — Luc Chagnon, franceinfo, 2024 (FR) : l’enquête sur les annotateurs.
- Illustrating Reinforcement Learning from Human Feedback — Hugging Face, 2022 (EN) : le pipeline en schémas.
- Direct Preference Optimization — Rafailov et al., 2023 (EN) : l’alignement sans modèle de récompense.
- Towards Understanding Sycophancy in Language Models — Sharma et al., 2023 (EN) : la flagornerie mesurée.
Voir aussi
Section intitulée « Voir aussi »Voir aussi
- FondamentauxLLM (grand modèle de langage)Un modèle d'IA entraîné sur d'immenses quantités de texte, capable de comprendre et de générer du langage.
- FondamentauxPoids (paramètres)Les milliards de nombres qui stockent tout ce qu'un modèle a appris pendant son entraînement.
- EntraînementFine-tuning (réglage fin)Poursuivre l'entraînement d'un modèle déjà entraîné sur tes propres données pour lui apprendre un style, un domaine ou une tâche.
- FondamentauxHallucinationQuand un LLM affirme avec aplomb des choses fausses ou inventées : sources, faits ou références imaginaires.
- ÉthiqueBiais (d'un modèle)Un écart systématique dans les réponses d'un modèle, hérité des textes qui ont fixé ses poids et des choix faits pour l'aligner — pas une erreur au hasard, mais toujours la même, dans le même sens.
- EntraînementPré-entraînementLa première phase de la vie d'un LLM, et de loin la plus chère : des semaines de calcul à deviner le token suivant sur des milliers de milliards de tokens, pour obtenir un modèle de base.
- FondamentauxModèle de raisonnement (reasoning model)Un LLM entraîné à écrire un long brouillon avant de répondre : ce qu'il gagne sur les problèmes difficiles, ce qu'il coûte, et pourquoi son brouillon n'est pas une fenêtre sur sa pensée.
- EntraînementAlignement des modèlesLe processus mathématique et éthique visant à faire respecter par un modèle de langage des consignes de sécurité, d'utilité et de retenue : le triptyque HHH, l'IA constitutionnelle et le refus excessif.
- ÉthiqueAnthropomorphisme et illusion de consciencePourquoi nous prêtons des sentiments et une pensée aux modèles : l'effet ELIZA, la flagornerie du RLHF et la déconstruction du vocabulaire psychologique.
- EntraînementApprentissage par renforcement (RL)Le paradigme d'entraînement où un modèle apprend à prendre des décisions séquentielles par essais-erreurs, guidé par un signal de récompense numérique.