Latência
Tempo total da requisição até a resposta completa. Para um LLM é aproximadamente TTFT mais (tokens de saída / tokens por segundo), mais a sobrecarga de rede.
O que é
A latência é o que um usuário vivencia numa requisição. É um eixo diferente da vazão, que é quantas requisições o sistema atende por segundo entre todos os usuários.
Por que importa
Agrupar mais requisições num batch sobe a vazão mas pode subir a latência por requisição — o trade-off clássico. Endpoints serverless adicionam latência de partida a frio quando escalam a partir do zero.