INT8
Cuantización entera de 8 bits. Reduce aproximadamente a la mitad el tamaño del modelo frente a 16 bits, con una pérdida de calidad pequeña, a menudo despreciable para cargas de tipo chat. Muy soportada.
Qué es
Los pesos se mapean a 256 niveles enteros con un factor de escala. Un modelo de 70B baja de ~140 GB a ~70 GB: la diferencia entre necesitar dos GPU de 80 GB y una.
Por qué importa
A menudo el primer paso más seguro de la cuantización: ahorro real, riesgo bajo. Baja a int4 solo si aún lo necesitas y has probado la calidad.