Aller au contenu

Ce parcours suppose que tu sais déjà ce qu’est un modèle et ce que sont ses poids : si ce n’est pas le cas, commence par « C’est quoi un LLM ? ».

Les étapes

11 étapes · environ 73 min de lecture

Commencer par « Données d'entraînement »

  1. Avant de voir comment les poids s'ajustent, il faut savoir sur quoi. Ce que le modèle saura, ses langues et sa date de coupure se décident ici, avant le premier calcul.

    7 min de lecture

  2. Quand les textes du Web ne suffisent plus ou sont trop pollués : comment les laboratoires fabriquent des exercices artificiels sur mesure pour instruire leurs modèles.

    6 min de lecture

  3. Pré-entraînementEntraînement

    Les textes sont prêts. Avant de voir comment les poids bougent, il faut savoir ce qu'on demande au modèle d'en faire, et tout le reste du parcours retouche ce qui sort de cette phase.

    7 min de lecture

  4. EntraînementEntraînement

    On sait quelle tâche le modèle répète ; il est temps d'ouvrir le capot. La boucle vue ici resservira telle quelle au fine-tuning, au RLHF et à LoRA : mieux vaut la tenir avant d'y arriver.

    7 min de lecture

  5. La boucle s'arrête, il reste des milliards de nombres figés. On revient aux poids, croisés dans le parcours précédent, pour voir ce qu'elle y a laissé, et pourquoi les faire bouger à nouveau oblige à la relancer.

    7 min de lecture

  6. Réentraîner un modèle depuis zéro coûte des millions. Le fine-tuning part d'un modèle déjà entraîné et le spécialise.

    7 min de lecture

  7. Le socle mathématique de l'apprentissage par récompense : comment le modèle explore des réponses par essais-erreurs avant d'être orienté vers les préférences humaines.

    5 min de lecture

  8. RLHFEntraînement

    Un modèle spécialisé répond juste, pas forcément utilement. Le RLHF est l'étape qui lui apprend ce qu'on attend d'une bonne réponse.

    7 min de lecture

  9. LoRAEntraînement

    Même un fine-tuning complet reste lourd. LoRA ne retouche qu'une petite fraction des poids, et c'est ce qui met l'entraînement à portée.

    7 min de lecture

  10. DistillationEntraînement

    LoRA retouche un grand modèle à moindre coût ; reste le cas où c'est le modèle lui-même qu'on veut plus petit. La boucle d'entraînement sert une dernière fois, avec un grand modèle pour professeur.

    7 min de lecture

  11. Dernière étape, et la moins technique : toutes ces façons d'entraîner héritent de ce qui était écrit dans les données, et le répètent toujours dans le même sens.

    6 min de lecture