INT8
Quantization entière 8 bits. Divise ~par deux la taille du modèle face au 16 bits avec une perte de qualité faible, souvent négligeable pour du chat. Largement supporté.
Ce que c'est
Les poids sont mappés sur 256 niveaux entiers avec un facteur d'échelle. Un modèle 70B passe de ~140 Go à ~70 Go - la différence entre deux GPU 80 Go et un seul.
Pourquoi c'est important
Souvent le premier pas le plus sûr en quantization : gains réels, faible risque. Ne descends en int4 que si nécessaire et après avoir testé la qualité.