HBM
High Bandwidth Memory: la memoria apilada que se usa como VRAM en las GPU de centro de datos. Lo que fija la velocidad de generación de un LLM es su ancho de banda (TB/s), no su capacidad.
Qué es
Generar cada token de salida significa leer de memoria el modelo entero (o una copia cuantizada) más el kv cache una vez. Así que tokens/s ~= ancho de banda / bytes leídos por token. Una H200 (~4,8 TB/s) genera más rápido que una H100 (~3,35 TB/s) con el mismo modelo, aunque el cómputo sea similar.
Por qué importa
Al comparar GPU para inferencia, el ancho de banda predice los tokens per second mejor que los TFLOPS. Las tarjetas de consumo tienen mucho menos ancho de banda, y eso explica en gran parte por qué generan despacio.