Ajuste por preferência (RLHF, DPO)
Uma segunda etapa de treinamento que ensina o modelo qual de duas respostas as pessoas preferem, em vez de uma única resposta-alvo. RLHF usa um modelo de recompensa + aprendizado por reforço; DPO faz isso de forma direta e barata.
O que é
Depois de um fine tuning supervisionado, você coleta pares de saídas do modelo rotuladas "melhor / pior". O RLHF treina um modelo de recompensa separado com esses rótulos e depois usa RL (PPO) para empurrar o modelo na direção de saídas de alta recompensa — poderoso, mas delicado e pesado em computação. O DPO pula o modelo de recompensa e o laço de RL: uma única função de perda move a probabilidade na direção da resposta preferida e para longe da rejeitada. Resultados parecidos, uma fração do custo e da complexidade.
Por que importa
É a etapa que faz um modelo parecer "útil" e não só fluente. Para um modelo auto-hospedado, DPO num adaptador lora já cabe num orçamento de hobbista; RLHF raramente cabe.