<- Todos os termos

Concorrência

Quantas requisições um modelo atende ao mesmo tempo. Mais concorrência sobe a vazão e a eficiência de custo, mas é limitada pela VRAM porque cada requisição em curso precisa do seu próprio cache KV.

O que é

Os servidores de inferência agrupam as requisições concorrentes para que uma única passada pelos pesos do modelo sirva muitos usuários. Mas cada requisição concorrente mantém um kv cache na VRAM durante todo o comprimento do seu contexto, então há um teto duro sobre quantas cabem.

Por que importa

O custo por token cai conforme a concorrência sobe — a GPU é amortizada sobre mais trabalho. É a razão principal de uma API compartilhada ser mais barata por token que uma GPU auto-hospedada pouco usada.

Conceitos relacionados

Use no Obolith

Última revisão: 2026-09-01 · conceito atemporal