<- Todos os termos

Batching contínuo

Uma técnica de servidor de inferência que adiciona e remove requisições do batch em andamento token a token, em vez de esperar um batch inteiro terminar. Multiplica várias vezes o throughput da GPU com a mesma latência.

O que é

O batching ingênuo ("estático") agrupa N requisições, executa todas juntas até a mais lenta terminar e só então começa o próximo grupo: as requisições curtas esperam pelas longas e a GPU fica ociosa. O batching contínuo (vLLM, TGI, TensorRT-LLM) agenda a cada passo de decodificação: assim que uma requisição emite o último token, o lugar dela é liberado e uma requisição na fila entra no lugar.

Depende de um kv cache bem gerenciado para manter muitas requisições pela metade ao mesmo tempo.

Por que importa

O batching contínuo é a maior razão de uma GPU auto-hospedada conseguir servir 10-40 usuários simultâneos em vez de 2-3. É a diferença entre um self-host que atinge o ponto de equilíbrio e um que nunca atinge. Hoje todo servidor de inferência sério faz isso por padrão.

Impacto em custo e infraestrutura

Não baixa a sua tarifa de GPU-hora: aumenta a taxa de utilização que você consegue atingir de verdade, que é o que as calculadoras de self-host usam para calcular o custo por requisição.

Conceitos relacionados

Use no Obolith

Última revisão: 2026-09-04 · conceito atemporal