Comment il apprend
Ce parcours suppose que tu sais déjà ce qu’est un modèle et ce que sont ses poids : si ce n’est pas le cas, commence par « C’est quoi un LLM ? ».
Les étapes
11 étapes · environ 73 min de lecture
Commencer par « Données d'entraînement »
- Données d'entraînementEntraînement
Avant de voir comment les poids s'ajustent, il faut savoir sur quoi. Ce que le modèle saura, ses langues et sa date de coupure se décident ici, avant le premier calcul.
- Données synthétiquesEntraînement
Quand les textes du Web ne suffisent plus ou sont trop pollués : comment les laboratoires fabriquent des exercices artificiels sur mesure pour instruire leurs modèles.
- Pré-entraînementEntraînement
Les textes sont prêts. Avant de voir comment les poids bougent, il faut savoir ce qu'on demande au modèle d'en faire, et tout le reste du parcours retouche ce qui sort de cette phase.
- EntraînementEntraînement
On sait quelle tâche le modèle répète ; il est temps d'ouvrir le capot. La boucle vue ici resservira telle quelle au fine-tuning, au RLHF et à LoRA : mieux vaut la tenir avant d'y arriver.
- Poids (paramètres)Fondamentaux
La boucle s'arrête, il reste des milliards de nombres figés. On revient aux poids, croisés dans le parcours précédent, pour voir ce qu'elle y a laissé, et pourquoi les faire bouger à nouveau oblige à la relancer.
- Fine-tuning (réglage fin)Entraînement
Réentraîner un modèle depuis zéro coûte des millions. Le fine-tuning part d'un modèle déjà entraîné et le spécialise.
- Apprentissage par renforcement (RL)Entraînement
Le socle mathématique de l'apprentissage par récompense : comment le modèle explore des réponses par essais-erreurs avant d'être orienté vers les préférences humaines.
- RLHFEntraînement
Un modèle spécialisé répond juste, pas forcément utilement. Le RLHF est l'étape qui lui apprend ce qu'on attend d'une bonne réponse.
- LoRAEntraînement
Même un fine-tuning complet reste lourd. LoRA ne retouche qu'une petite fraction des poids, et c'est ce qui met l'entraînement à portée.
- DistillationEntraînement
LoRA retouche un grand modèle à moindre coût ; reste le cas où c'est le modèle lui-même qu'on veut plus petit. La boucle d'entraînement sert une dernière fois, avec un grand modèle pour professeur.
- Biais (d'un modèle)Éthique
Dernière étape, et la moins technique : toutes ces façons d'entraîner héritent de ce qui était écrit dans les données, et le répètent toujours dans le même sens.