Tokens por segundo
A velocidade com que um modelo gera saída depois de ter começado. Fixa quanto tempo leva uma resposta completa e, numa GPU auto-hospedada, determina o custo por token.
O que é
Um número por requisição para a fase de decodificação. Cada token de saída precisa de uma passada que lê os pesos do modelo e o kv cache da VRAM, então a velocidade é fixada pela largura de banda de memória, não pelo cômputo bruto.
Quase não depende do comprimento do prompt: esse custo cai no ttft.
Por que importa
Uma resposta de 300 tokens a 20 tok/s leva 15 segundos; a 120 tok/s, 2,5 segundos. Para agentes que encadeiam muitas chamadas ao modelo, a geração lenta se acumula em minutos.
Impacto em custo e infraestrutura
Numa GPU alugada, custo por 1M de tokens = (GPU $/h / tok/s) × 278. Dobrar os tok/s (com uma GPU mais rápida, quantização ou melhor batching) reduz o custo por token pela metade. É o núcleo da aritmética do self hosting.
Conceitos relacionados
Use no Obolith
Perguntas frequentes
Por que o meu modelo auto-hospedado é mais lento que a API?
Os provedores rodam stacks de inferência afinados, fazem batching agressivo entre muitos usuários e muitas vezes servem pesos quantizados em hardware de ponta. Uma única requisição sem batching numa GPU raramente iguala isso.