<- Todos os termos

Tokens por segundo

A velocidade com que um modelo gera saída depois de ter começado. Fixa quanto tempo leva uma resposta completa e, numa GPU auto-hospedada, determina o custo por token.

O que é

Um número por requisição para a fase de decodificação. Cada token de saída precisa de uma passada que lê os pesos do modelo e o kv cache da VRAM, então a velocidade é fixada pela largura de banda de memória, não pelo cômputo bruto.

Quase não depende do comprimento do prompt: esse custo cai no ttft.

Por que importa

Uma resposta de 300 tokens a 20 tok/s leva 15 segundos; a 120 tok/s, 2,5 segundos. Para agentes que encadeiam muitas chamadas ao modelo, a geração lenta se acumula em minutos.

Impacto em custo e infraestrutura

Numa GPU alugada, custo por 1M de tokens = (GPU $/h / tok/s) × 278. Dobrar os tok/s (com uma GPU mais rápida, quantização ou melhor batching) reduz o custo por token pela metade. É o núcleo da aritmética do self hosting.

Conceitos relacionados

Use no Obolith

Perguntas frequentes

Por que o meu modelo auto-hospedado é mais lento que a API?

Os provedores rodam stacks de inferência afinados, fazem batching agressivo entre muitos usuários e muitas vezes servem pesos quantizados em hardware de ponta. Uma única requisição sem batching numa GPU raramente iguala isso.

Última revisão: 2026-09-01 · conceito atemporal