<- Tous les termes

VRAM

La mémoire dédiée d'un GPU. Elle doit contenir les poids du modèle, le cache KV de chaque requête en cours, et les activations. Quand elle est pleine, il faut un GPU plus gros, plus de GPU, ou un modèle plus petit.

Ce que c'est

Budget approximatif des poids : ~2 octets par paramètre en précision 16 bits. Un modèle 70B fait ~140 Go en fp16, ~70 Go en int8, ~35 Go en int4 - voir quantization. Par-dessus s'ajoute le cache KV, qui grossit avec le contexte et la concurrence.

Pourquoi c'est important

La VRAM, pas le calcul, est en général le premier mur en self-hosting. Elle décide quel GPU seul peut faire tourner un modèle, et combien d'utilisateurs il sert avant de devoir passer au multi gpu.

Impact coût & infrastructure

Chaque palier de VRAM double ~le prix horaire (24 Go -> 48 Go -> 80 Go -> 141 Go). La quantization est le principal moyen de faire rentrer un modèle dans un palier moins cher, avec un coût en qualité.

Exemple

Modèle, précisionPoids (approx)
8B, fp16~16 Go
70B, fp16~140 Go
70B, int4~35 Go

Concepts liés

Sur Obolith

FAQ

Combien de VRAM pour un modèle 7B ?

~16 Go en fp16 pour les poids plus une marge pour le cache KV - une carte 24 Go est à l'aise. En 4 bits, ~6-8 Go suffisent.

Dernière revue : 2026-09-01