<- Todos los términos

INT4

Cuantización entera de 4 bits. Reduce el tamaño del modelo a aproximadamente un cuarto del de 16 bits. Gran ahorro de costo, pero la pérdida de calidad es más notable y depende del modelo: pruébalo antes de confiar en ella.

Qué es

Esquemas como AWQ, GPTQ y GGUF Q4 empaquetan los pesos en 4 bits con escalas por grupo. Un modelo de 70B pasa a ~35 GB: corre en una sola GPU de 48 GB, o incluso en una tarjeta de consumo de 24 GB con contexto corto.

Por qué importa

INT4 es lo que hace posible ejecutar modelos grandes en hardware barato, y es la base del fine-tuning QLoRA. El compromiso es real: espera cierta regresión en razonamiento difícil y en tareas de formato exacto.

Conceptos relacionados

Úsalo en Obolith

Última revisión: 2026-09-01 · concepto atemporal