Latencia
Tiempo total desde la petición hasta la respuesta completa. Para un LLM es aproximadamente TTFT más (tokens de salida / tokens por segundo), más la sobrecarga de red.
Qué es
La latencia es lo que experimenta un usuario en una petición. Es un eje distinto del rendimiento, que es cuántas peticiones maneja el sistema por segundo entre todos los usuarios.
Por qué importa
Agrupar más peticiones en un batch sube el rendimiento pero puede subir la latencia por petición: el compromiso clásico. Los endpoints serverless añaden latencia de arranque en frío cuando escalan desde cero.