<- Todos os termos

Latência

Tempo total da requisição até a resposta completa. Para um LLM é aproximadamente TTFT mais (tokens de saída / tokens por segundo), mais a sobrecarga de rede.

O que é

A latência é o que um usuário vivencia numa requisição. É um eixo diferente da vazão, que é quantas requisições o sistema atende por segundo entre todos os usuários.

Por que importa

Agrupar mais requisições num batch sobe a vazão mas pode subir a latência por requisição — o trade-off clássico. Endpoints serverless adicionam latência de partida a frio quando escalam a partir do zero.

Conceitos relacionados

Use no Obolith

Última revisão: 2026-09-01 · conceito atemporal