<- Todos os termos

Quantização

Guardar os pesos do modelo (e às vezes as ativações ou o KV cache) em menor precisão numérica — 8 bits, 4 bits — para reduzir o uso de memória e acelerar a geração, normalmente com um pequeno custo de qualidade.

O que é

Os modelos são treinados em 16 bits (fp16 / bf16). A quantização comprime os pesos guardados para 8 bits (~metade) ou 4 bits (~um quarto). Como a geração em inferência é limitada pela memória, pesos menores também significam tokens per second mais rápidos.

Os esquemas modernos (AWQ, GPTQ, k-quants do GGUF, fp8) mantêm pequena a perda de qualidade para muitos modelos, mas depende do modelo e da tarefa — raciocínio e código são mais sensíveis que chat.

Por que importa

A quantização é a maior alavanca para um self hosting barato: um modelo de 70B em 4 bits pode rodar numa GPU de 48 GB em vez de duas de 80 GB. Isso pode transformar um caso de self-host perdedor num vencedor.

Impacto em custo e infraestrutura

Não há um nível universalmente ótimo. Menos precisão reduz memória e custo mas pode prejudicar a qualidade conforme o modelo e a carga — teste no seu próprio conjunto de avaliação antes de se comprometer.

Conceitos relacionados

Use no Obolith

Última revisão: 2026-09-01