QLoRA
LoRA em cima de um modelo base que foi quantizado para 4 bits. Corta a VRAM necessária para o fine-tuning em ~3-4×, então um modelo de 70B é ajustado numa única GPU de 48 GB em vez de um nó multi-GPU.
O que é
Os pesos base congelados são guardados em 4 bits (estilo int4, normalmente NF4). São desquantizados para 16 bits na hora, camada por camada, só durante o cálculo — então o modelo completo nunca fica na memória em precisão total. O adaptador lora em si treina em 16 bits. A perda de qualidade em relação ao LoRA comum é pequena para a maioria das tarefas.
Por que importa
O QLoRA derruba a barreira de hardware para fazer fine-tuning de um modelo grande. Isso muda diretamente qual GPU você aluga (uma placa, não um nó) e portanto o custo de uma execução — muitas vezes em mais da metade.