INT4
Quantização inteira de 4 bits. Reduz o tamanho do modelo para cerca de um quarto do de 16 bits. Grande economia de custo, mas a perda de qualidade é mais perceptível e depende do modelo — teste antes de confiar nela.
O que é
Esquemas como AWQ, GPTQ e GGUF Q4 empacotam os pesos em 4 bits com escalas por grupo. Um modelo de 70B vira ~35 GB: roda numa única GPU de 48 GB, ou até numa placa de consumo de 24 GB com contexto curto.
Por que importa
O INT4 é o que torna possível rodar modelos grandes em hardware barato, e é a base do fine-tuning QLoRA. O trade-off é real: espere alguma regressão em raciocínio difícil e em tarefas de formato exato.