<- Tous les termes

INT4

Quantization entière 4 bits. Réduit la taille du modèle à ~un quart du 16 bits. Gros gain de coût, mais perte de qualité plus perceptible et variable selon le modèle - à tester avant de s'y fier.

Ce que c'est

Des schémas comme AWQ, GPTQ et GGUF Q4 empaquettent les poids en 4 bits avec des échelles par groupe. Un 70B devient ~35 Go - il tourne sur un seul GPU 48 Go, voire une carte grand public 24 Go à contexte court.

Pourquoi c'est important

L'INT4 rend possible de faire tourner de gros modèles sur du matériel pas cher, et c'est la base du fine-tuning QLoRA. L'arbitrage est réel : attends-toi à une régression sur le raisonnement difficile et les formats exacts.

Concepts liés

Sur Obolith

Dernière revue : 2026-09-01 · concept stable