<- Todos los términos

Ajuste por preferencias (RLHF, DPO)

Una segunda etapa de entrenamiento que enseña al modelo cuál de dos respuestas prefiere la gente, en lugar de una única respuesta objetivo. RLHF usa un modelo de recompensa + aprendizaje por refuerzo; DPO lo hace de forma directa y barata.

Qué es

Tras un fine tuning supervisado, recoges pares de salidas del modelo etiquetadas «mejor / peor». RLHF entrena un modelo de recompensa aparte con esas etiquetas y luego usa RL (PPO) para empujar el modelo hacia salidas de alta recompensa: potente, pero delicado y muy exigente en cómputo. DPO se salta el modelo de recompensa y el bucle de RL: una sola función de pérdida mueve la probabilidad hacia la respuesta preferida y la aleja de la rechazada. Resultados similares, una fracción del costo y la complejidad.

Por qué importa

Es la etapa que hace que un modelo resulte «útil» y no solo fluido. Para un modelo autoalojado, DPO sobre un adaptador lora ya cabe en un presupuesto de aficionado; RLHF rara vez.

Conceptos relacionados

Úsalo en Obolith

Última revisión: 2026-09-04 · concepto atemporal