Quantization
Stocker les poids d'un modèle (et parfois les activations ou le cache KV) à plus basse précision - 8 bits, 4 bits - pour réduire la mémoire et accélérer la génération, en général avec un léger coût en qualité.
Ce que c'est
Les modèles sont entraînés en 16 bits (fp16 / bf16). La quantization compresse les poids stockés en 8 bits (~moitié) ou 4 bits (~quart). Comme la génération en inférence est limitée par la mémoire, des poids plus petits = des tokens per second plus rapides.
Les schémas récents (AWQ, GPTQ, k-quants GGUF, fp8) gardent une faible perte de qualité pour beaucoup de modèles, mais ça dépend du modèle et de la tâche - le raisonnement et le code sont plus sensibles que le chat.
Pourquoi c'est important
La quantization est le plus gros levier pour un self hosting pas cher : un 70B en 4 bits tient sur un GPU 48 Go au lieu de deux 80 Go. Ça peut transformer un cas self-host perdant en gagnant.
Impact coût & infrastructure
Il n'y a pas de niveau universellement optimal. Plus basse précision = moins de mémoire et de coût, mais possible perte de qualité selon le modèle et l'usage - teste sur ton propre jeu d'éval avant de trancher.