<- Todos os termos

Ajuste por preferência (RLHF, DPO)

Uma segunda etapa de treinamento que ensina o modelo qual de duas respostas as pessoas preferem, em vez de uma única resposta-alvo. RLHF usa um modelo de recompensa + aprendizado por reforço; DPO faz isso de forma direta e barata.

O que é

Depois de um fine tuning supervisionado, você coleta pares de saídas do modelo rotuladas "melhor / pior". O RLHF treina um modelo de recompensa separado com esses rótulos e depois usa RL (PPO) para empurrar o modelo na direção de saídas de alta recompensa — poderoso, mas delicado e pesado em computação. O DPO pula o modelo de recompensa e o laço de RL: uma única função de perda move a probabilidade na direção da resposta preferida e para longe da rejeitada. Resultados parecidos, uma fração do custo e da complexidade.

Por que importa

É a etapa que faz um modelo parecer "útil" e não só fluente. Para um modelo auto-hospedado, DPO num adaptador lora já cabe num orçamento de hobbista; RLHF raramente cabe.

Conceitos relacionados

Use no Obolith

Última revisão: 2026-09-04 · conceito atemporal