<- Tous les termes

Quantization

Stocker les poids d'un modèle (et parfois les activations ou le cache KV) à plus basse précision - 8 bits, 4 bits - pour réduire la mémoire et accélérer la génération, en général avec un léger coût en qualité.

Ce que c'est

Les modèles sont entraînés en 16 bits (fp16 / bf16). La quantization compresse les poids stockés en 8 bits (~moitié) ou 4 bits (~quart). Comme la génération en inférence est limitée par la mémoire, des poids plus petits = des tokens per second plus rapides.

Les schémas récents (AWQ, GPTQ, k-quants GGUF, fp8) gardent une faible perte de qualité pour beaucoup de modèles, mais ça dépend du modèle et de la tâche - le raisonnement et le code sont plus sensibles que le chat.

Pourquoi c'est important

La quantization est le plus gros levier pour un self hosting pas cher : un 70B en 4 bits tient sur un GPU 48 Go au lieu de deux 80 Go. Ça peut transformer un cas self-host perdant en gagnant.

Impact coût & infrastructure

Il n'y a pas de niveau universellement optimal. Plus basse précision = moins de mémoire et de coût, mais possible perte de qualité selon le modèle et l'usage - teste sur ton propre jeu d'éval avant de trancher.

Concepts liés

Sur Obolith

Dernière revue : 2026-09-01