LoRA
Low-Rank Adaptation: um fine-tuning que congela o modelo base e, no lugar, treina um pequeno par de matrizes por camada. ~0,1-1% de parâmetros treináveis, então cabe numa GPU e roda em minutos a horas.
O que é
Em vez de atualizar uma matriz de pesos W diretamente, o LoRA aprende duas matrizes pequenas A e B cujo produto é somado a W na inferência: W + BA. A e B têm um "posto" baixo (muitas vezes 8-64), então juntas contêm uma fração minúscula dos parâmetros. O modelo base permanece congelado.
A saída é um pequeno arquivo "adaptador" (megabytes, não gigabytes). Você pode manter vários adaptadores para um mesmo modelo base e trocá-los por requisição.
Por que importa
O LoRA é a razão de o fine-tuning ter saído de um orçamento de laboratório de pesquisa para um de hobbista. Um modelo de 8B ajustado a uma tarefa, numa GPU alugada por alguns dólares, pode superar uma API de fronteira nessa tarefa — e então você o serve por conta própria a tarifas de GPU-hora em vez de tarifas por token.
Impacto em custo e infraestrutura
VRAM necessária ≈ pesos do modelo (na precisão escolhida) + um pequeno adicional para o adaptador e os estados do otimizador — bem menos que um fine-tuning completo. Um modelo de 8B em fp16 faz LoRA numa única placa de 24 GB; o qlora baixa ainda mais.