<- Todos los términos

Cuantización

Guardar los pesos del modelo (y a veces las activaciones o el KV cache) a menor precisión numérica (8 bits, 4 bits) para reducir el uso de memoria y acelerar la generación, normalmente con un pequeño costo de calidad.

Qué es

Los modelos se entrenan en 16 bits (fp16 / bf16). La cuantización comprime los pesos guardados a 8 bits (~la mitad) o 4 bits (~un cuarto). Como la generación en inferencia está limitada por la memoria, pesos más pequeños también significan tokens per second más rápidos.

Los esquemas modernos (AWQ, GPTQ, k-quants de GGUF, fp8) mantienen pequeña la pérdida de calidad para muchos modelos, pero depende del modelo y de la tarea: el razonamiento y el código son más sensibles que el chat.

Por qué importa

La cuantización es la mayor palanca para un self hosting barato: un modelo de 70B en 4 bits puede correr en una GPU de 48 GB en lugar de dos de 80 GB. Eso puede convertir un caso de self-host perdedor en ganador.

Impacto en costo e infraestructura

No hay un nivel óptimo universal. Menos precisión reduce memoria y costo pero puede dañar la calidad según el modelo y la carga: pruébalo en tu propio conjunto de evals antes de comprometerte.

Conceptos relacionados

Úsalo en Obolith

Última revisión: 2026-09-01