INT4
Cuantización entera de 4 bits. Reduce el tamaño del modelo a aproximadamente un cuarto del de 16 bits. Gran ahorro de costo, pero la pérdida de calidad es más notable y depende del modelo: pruébalo antes de confiar en ella.
Qué es
Esquemas como AWQ, GPTQ y GGUF Q4 empaquetan los pesos en 4 bits con escalas por grupo. Un modelo de 70B pasa a ~35 GB: corre en una sola GPU de 48 GB, o incluso en una tarjeta de consumo de 24 GB con contexto corto.
Por qué importa
INT4 es lo que hace posible ejecutar modelos grandes en hardware barato, y es la base del fine-tuning QLoRA. El compromiso es real: espera cierta regresión en razonamiento difícil y en tareas de formato exacto.