<- Todos os termos

HBM

High Bandwidth Memory — a memória empilhada usada como VRAM nas GPUs de data center. O que fixa a velocidade de geração de um LLM é a sua largura de banda (TB/s), não a sua capacidade.

O que é

Gerar cada token de saída significa ler da memória o modelo inteiro (ou uma cópia quantizada) mais o kv cache uma vez. Então tokens/s ~= largura de banda / bytes lidos por token. Uma H200 (~4,8 TB/s) gera mais rápido que uma H100 (~3,35 TB/s) com o mesmo modelo, mesmo que o cômputo seja parecido.

Por que importa

Ao comparar GPUs para inferência, a largura de banda prevê os tokens per second melhor que os TFLOPS. As placas de consumo têm bem menos largura de banda, e isso explica em boa parte por que geram devagar.

Conceitos relacionados

Use no Obolith

Última revisão: 2026-09-01 · conceito atemporal