<- Tous les termes

HBM

High Bandwidth Memory - la mémoire empilée utilisée comme VRAM sur les GPU data-center. C'est sa bande passante (To/s), pas sa capacité, qui fixe la vitesse de génération d'un LLM.

Ce que c'est

Générer chaque token de sortie = lire tout le modèle (ou sa copie quantizée) plus le cache KV une fois en mémoire. Donc tokens/s ~= bande passante / octets lus par token. Un H200 (~4,8 To/s) génère plus vite qu'un H100 (~3,35 To/s) sur le même modèle, malgré un calcul similaire.

Pourquoi c'est important

Pour comparer des GPU en inférence, la bande passante prédit mieux les tokens per second que les TFLOPS. Les cartes grand public en ont bien moins, ce qui explique en partie leur génération lente.

Concepts liés

Sur Obolith

Dernière revue : 2026-09-01 · concept stable