VRAM
La mémoire dédiée d'un GPU. Elle doit contenir les poids du modèle, le cache KV de chaque requête en cours, et les activations. Quand elle est pleine, il faut un GPU plus gros, plus de GPU, ou un modèle plus petit.
Ce que c'est
Budget approximatif des poids : ~2 octets par paramètre en précision 16 bits. Un modèle 70B fait ~140 Go en fp16, ~70 Go en int8, ~35 Go en int4 - voir quantization. Par-dessus s'ajoute le cache KV, qui grossit avec le contexte et la concurrence.
Pourquoi c'est important
La VRAM, pas le calcul, est en général le premier mur en self-hosting. Elle décide quel GPU seul peut faire tourner un modèle, et combien d'utilisateurs il sert avant de devoir passer au multi gpu.
Impact coût & infrastructure
Chaque palier de VRAM double ~le prix horaire (24 Go -> 48 Go -> 80 Go -> 141 Go). La quantization est le principal moyen de faire rentrer un modèle dans un palier moins cher, avec un coût en qualité.
Exemple
| Modèle, précision | Poids (approx) |
| 8B, fp16 | ~16 Go |
| 70B, fp16 | ~140 Go |
| 70B, int4 | ~35 Go |
Concepts liés
Sur Obolith
FAQ
Combien de VRAM pour un modèle 7B ?
~16 Go en fp16 pour les poids plus une marge pour le cache KV - une carte 24 Go est à l'aise. En 4 bits, ~6-8 Go suffisent.