<- Tous les termes

INT8

Quantization entière 8 bits. Divise ~par deux la taille du modèle face au 16 bits avec une perte de qualité faible, souvent négligeable pour du chat. Largement supporté.

Ce que c'est

Les poids sont mappés sur 256 niveaux entiers avec un facteur d'échelle. Un modèle 70B passe de ~140 Go à ~70 Go - la différence entre deux GPU 80 Go et un seul.

Pourquoi c'est important

Souvent le premier pas le plus sûr en quantization : gains réels, faible risque. Ne descends en int4 que si nécessaire et après avoir testé la qualité.

Concepts liés

Sur Obolith

Dernière revue : 2026-09-01 · concept stable