<- Todos los términos

HBM

High Bandwidth Memory: la memoria apilada que se usa como VRAM en las GPU de centro de datos. Lo que fija la velocidad de generación de un LLM es su ancho de banda (TB/s), no su capacidad.

Qué es

Generar cada token de salida significa leer de memoria el modelo entero (o una copia cuantizada) más el kv cache una vez. Así que tokens/s ~= ancho de banda / bytes leídos por token. Una H200 (~4,8 TB/s) genera más rápido que una H100 (~3,35 TB/s) con el mismo modelo, aunque el cómputo sea similar.

Por qué importa

Al comparar GPU para inferencia, el ancho de banda predice los tokens per second mejor que los TFLOPS. Las tarjetas de consumo tienen mucho menos ancho de banda, y eso explica en gran parte por qué generan despacio.

Conceptos relacionados

Úsalo en Obolith

Última revisión: 2026-09-01 · concepto atemporal