<- Todos os termos

INT8

Quantização inteira de 8 bits. Reduz aproximadamente pela metade o tamanho do modelo frente a 16 bits, com uma perda de qualidade pequena, muitas vezes desprezível para cargas do tipo chat. Amplamente suportada.

O que é

Os pesos são mapeados para 256 níveis inteiros com um fator de escala. Um modelo de 70B cai de ~140 GB para ~70 GB — a diferença entre precisar de duas GPUs de 80 GB e uma.

Por que importa

Muitas vezes o primeiro passo mais seguro da quantização: economia real, risco baixo. Desça para int4 só se ainda precisar e depois de testar a qualidade.

Conceitos relacionados

Use no Obolith

Última revisão: 2026-09-01 · conceito atemporal