<- Todos os termos

Vazão (throughput)

Quanto trabalho um sistema faz por unidade de tempo — requisições por segundo, ou tokens totais por segundo entre todos os usuários concorrentes. O número que decide a eficiência de custo ao fazer self-hosting.

O que é

Os tokens per second por usuário podem parecer modestos enquanto a vazão agregada é alta, porque os servidores de inferência modernos processam muitas requisições no mesmo batch. Uma GPU servindo 30 usuários a 25 tok/s cada um faz 750 tok/s de trabalho útil.

Por que importa

O custo por token numa GPU de preço fixo é GPU $/h / (tokens agregados por hora). Uma vazão baixa (poucos usuários, batches pequenos, uma GPU ociosa) é o que faz o self hosting perder para uma API.

Conceitos relacionados

Use no Obolith

Última revisão: 2026-09-01 · conceito atemporal