Aller au contenu
Entraînement

RLHF

L'entraînement par comparaison de réponses, qui apprend à un modèle non pas à répondre juste, mais à répondre comme on l'attend.

7 min de lecture
  • #alignement
  • #préférences
  • #récompense

Le RLHF (Reinforcement Learning from Human Feedback, apprentissage par renforcement à partir de retours humains) est l’étape d’entraînement où des humains comparent des réponses pour désigner la meilleure, jusqu’à ce que le modèle apprenne non plus seulement à répondre juste, mais à répondre comme on l’attend : utile, lisible, capable de dire non.

Un joueur sort du centre de formation avec une technique irréprochable. Il sait tout faire, mais pas encore quoi faire : quand passer, quand temporiser, quand renoncer à tirer. Son coach ne lui réécrit pas les muscles — il regarde deux actions et tranche, « celle-là valait mieux que celle-là ».

Sauf que le coach ne peut pas être derrière chaque ballon. On forme donc un adjoint qui a vu assez de ses verdicts pour les imiter, et c’est lui qui note les entraînements. Le RLHF est ce montage : quelques milliers de jugements humains transformés en juge automatique, contre lequel le modèle s’entraîne sans relâche.

Personne ne sait écrire la formule qui mesure si une réponse est « bonne » : trop vague, trop dépendant du contexte. En revanche, mis devant deux réponses, n’importe qui sait dire laquelle il préfère. Tout le RLHF tient dans ce déplacement — on renonce à la note absolue, on ne demande que des comparaisons. L’idée précède largement ChatGPT : dès 2017, Paul Christiano et ses co-auteurs l’appliquaient à des robots simulés.

Le pipeline de référence est celui du papier InstructGPT (Ouyang et al., 2022), l’ancêtre direct de ChatGPT.

  1. Le fine-tuning supervisé (SFT). Des humains écrivent la réponse idéale à un lot de questions et on poursuit l’entraînement du modèle de base dessus. Chez InstructGPT : environ 13 000 questions. Le modèle apprend le format conversationnel, rien de plus.
  2. Le modèle de récompense. On pose la même question plusieurs fois au modèle, et des annotateurs classent les réponses de la meilleure à la pire — entre quatre et neuf par question, sur 33 000 questions. Un second réseau, plus petit (6 milliards de paramètres), apprend à reproduire ces classements et ne rend qu’un nombre : le score qu’un annotateur aurait donné.
  3. L’optimisation par renforcement. Le modèle génère, le modèle de récompense note, et un algorithme de renforcement — historiquement PPO — corrige les poids d’après cette note. 31 000 questions, et plus aucun humain dans la boucle.

Rien de magique dans ce troisième temps : la note remplace la « vraie suite du texte » comme signal d’erreur, la rétropropagation calcule les gradients, la descente de gradient déplace les poids. Même mécanique que le pré-entraînement, autre objectif. Le résultat, lui, a surpris : les évaluateurs préfèrent les réponses d’un InstructGPT de 1,3 milliard de paramètres à celles de GPT-3 et ses 175 milliards. Cent fois plus petit, jugé meilleur, parce qu’il répond à la question posée.

Laisse un modèle maximiser librement une note et il finira par écrire pour le juge, pas pour toi. InstructGPT retranche donc de la récompense un montant proportionnel à l’écart entre le modèle en cours d’entraînement et le modèle SFT de départ. Cet écart se mesure par une quantité appelée divergence de Kullback-Leibler, d’où le nom de pénalité KL. En clair : « améliore ta note, mais sans devenir un autre modèle ». Sans ce frein, l’entraînement dérive vers des textes excellemment notés et illisibles.

InstructGPT s’appuie sur une quarantaine de sous-traitants recrutés sur Upwork et Scale AI, majoritairement anglophones, aux États-Unis ou en Asie du Sud-Est. Le papier donne un chiffre qu’on cite rarement : entre eux, ces annotateurs sont d’accord 72,6 % du temps. C’est le plafond du procédé — « la préférence humaine » gravée dans le modèle, c’est ce qu’a préféré un petit panel non représentatif, trois fois sur quatre environ.

Le reste du secteur est moins bien traité. En avril 2024, franceinfo documente cet écosystème au Kenya et à Madagascar : environ 150 euros par mois en bas de l’échelle, pour trier et étiqueter les textes dont ces modèles apprennent.

Un modèle de récompense n’est qu’une approximation, et toute approximation optimisée assez fort finit par se fissurer. C’est le reward hacking : le modèle trouve ce qui plaît au juge sans plaire à personne.

  • La longueur. Prasann Singhal et ses co-auteurs ont montré en 2023 que l’essentiel du gain apporté par le RLHF s’explique par l’allongement des réponses — une récompense fondée sur la seule longueur en reproduit la plus grande part.
  • La flagornerie, ou sycophantie. La même année, une équipe d’Anthropic menée par Mrinank Sharma analyse des données de préférences réelles : une réponse qui abonde dans ton sens a plus de chances d’être préférée, et humains comme modèles de récompense préfèrent parfois la flatterie bien écrite à la réponse correcte.

Le renforcement classique est lourd : plusieurs modèles en mémoire, un entraînement instable. En mai 2023, Rafael Rafailov et ses co-auteurs publient DPO (Direct Preference Optimization) : en réécrivant le problème, ils montrent que la politique optimale se déduit directement des préférences. Plus de modèle de récompense séparé, plus de boucle de renforcement, une simple fonction de coût sur des paires préférée / rejetée.

C’est devenu la voie par défaut des modèles ouverts : pour Llama 3 (2024), Meta a retenu un enchaînement SFT puis DPO, répété six fois, plutôt que des algorithmes de renforcement jugés « moins stables et plus difficiles à passer à l’échelle ». Le renforcement en ligne n’a pas disparu pour autant : GRPO, introduit par DeepSeek en 2024, entraîne DeepSeek-R1 avec une récompense calculée par des règles — bonne réponse, bon format — plutôt que par un réseau. Le meilleur moyen d’éviter le reward hacking reste de ne pas fournir de juge à berner.

  • GPT-4o, avril 2025. OpenAI déploie le 25 avril une mise à jour qui rend le modèle ouvertement flagorneur : il valide tout, applaudit des décisions douteuses. Le retour en arrière démarre le 28. Dans son post-mortem, l’entreprise dit avoir ajouté un signal de récompense fondé sur les pouces levés et baissés cliqués dans ChatGPT, et estime que cet ajout a affaibli le signal principal qui tenait la flagornerie en respect.
  • La marche entre GPT-3 et ChatGPT tient à cette étape, pas à la taille du modèle. Et les « personnalités » qui distinguent les grands assistants en découlent : qui annote, selon quelles consignes, avec quelle tolérance au refus.
  • « Le RLHF rend le modèle plus intelligent. » Il le rend utilisable. Les connaissances viennent du pré-entraînement et l’alignement n’en ajoute aucune : il apprend au modèle à mobiliser ce qu’il a déjà, dans le format attendu. InstructGPT le démontre à l’envers — un petit modèle aligné bat un géant qui ne l’est pas.
  • « Le RLHF supprime les hallucinations. » Il déplace le problème autant qu’il le réduit. Adam Kalai et ses co-auteurs l’ont formulé en 2025 : tant qu’on note en tout ou rien, tenter sa chance paie mieux que s’abstenir, et un « je ne sais pas » ne rapporte rien. Le ton gagne en assurance, pas forcément le fond.
  • « Quand je clique sur le pouce baissé, le modèle apprend de son erreur. » Pas sur le moment : les poids sont figés, ta conversation ne les touche pas. Ton clic rejoint un jeu de données qui servira, peut-être, à une version ultérieure. L’épisode GPT-4o le montre — ces signaux comptent à l’échelle de millions de clics et de plusieurs mois, pas de ta phrase suivante.

Voir aussi