<- Tous les termes

Alignement par préférence (RLHF, DPO)

Une seconde étape d'entraînement qui apprend au modèle laquelle de deux réponses les gens préfèrent, plutôt qu'une seule réponse cible. RLHF utilise un modèle de récompense + de l'apprentissage par renforcement ; DPO le fait directement et à bas coût.

Ce que c'est

Après un fine tuning supervisé, tu collectes des paires de sorties étiquetées « meilleure / moins bonne ». RLHF entraîne un modèle de récompense séparé sur ces étiquettes, puis utilise du RL (PPO) pour pousser le modèle vers les sorties à forte récompense - puissant mais délicat et gourmand en calcul. DPO saute le modèle de récompense et la boucle RL : une seule fonction de perte déplace la probabilité vers la réponse préférée et l'éloigne de la rejetée. Résultats comparables, une fraction du coût et de la complexité.

Pourquoi c'est important

C'est l'étape qui rend un modèle « utile » plutôt que simplement fluide. Pour un modèle self-hébergé, DPO sur un adaptateur lora est désormais dans un budget de hobbyiste ; RLHF l'est rarement.

Concepts liés

Sur Obolith

Dernière revue : 2026-09-04 · concept stable