Latence
Le temps total entre la requête et la réponse complète. Pour un LLM, c'est ~TTFT + (tokens de sortie / tokens par seconde), plus le réseau.
Ce que c'est
La latence est ce qu'un utilisateur vit pour une requête. C'est un axe différent du débit, qui est le nombre de requêtes traitées par seconde tous utilisateurs confondus.
Pourquoi c'est important
Regrouper plus de requêtes augmente le débit mais peut augmenter la latence par requête - l'arbitrage classique. Les endpoints serverless ajoutent une latence de démarrage à froid quand ils partent de zéro.