<- Todos los términos

Latencia

Tiempo total desde la petición hasta la respuesta completa. Para un LLM es aproximadamente TTFT más (tokens de salida / tokens por segundo), más la sobrecarga de red.

Qué es

La latencia es lo que experimenta un usuario en una petición. Es un eje distinto del rendimiento, que es cuántas peticiones maneja el sistema por segundo entre todos los usuarios.

Por qué importa

Agrupar más peticiones en un batch sube el rendimiento pero puede subir la latencia por petición: el compromiso clásico. Los endpoints serverless añaden latencia de arranque en frío cuando escalan desde cero.

Conceptos relacionados

Úsalo en Obolith

Última revisión: 2026-09-01 · concepto atemporal