<- Todos os termos

QLoRA

LoRA em cima de um modelo base que foi quantizado para 4 bits. Corta a VRAM necessária para o fine-tuning em ~3-4×, então um modelo de 70B é ajustado numa única GPU de 48 GB em vez de um nó multi-GPU.

O que é

Os pesos base congelados são guardados em 4 bits (estilo int4, normalmente NF4). São desquantizados para 16 bits na hora, camada por camada, só durante o cálculo — então o modelo completo nunca fica na memória em precisão total. O adaptador lora em si treina em 16 bits. A perda de qualidade em relação ao LoRA comum é pequena para a maioria das tarefas.

Por que importa

O QLoRA derruba a barreira de hardware para fazer fine-tuning de um modelo grande. Isso muda diretamente qual GPU você aluga (uma placa, não um nó) e portanto o custo de uma execução — muitas vezes em mais da metade.

Conceitos relacionados

Use no Obolith

Última revisão: 2026-09-04 · conceito atemporal