<- Tous les termes

Latence

Le temps total entre la requête et la réponse complète. Pour un LLM, c'est ~TTFT + (tokens de sortie / tokens par seconde), plus le réseau.

Ce que c'est

La latence est ce qu'un utilisateur vit pour une requête. C'est un axe différent du débit, qui est le nombre de requêtes traitées par seconde tous utilisateurs confondus.

Pourquoi c'est important

Regrouper plus de requêtes augmente le débit mais peut augmenter la latence par requête - l'arbitrage classique. Les endpoints serverless ajoutent une latence de démarrage à froid quand ils partent de zéro.

Concepts liés

Sur Obolith

Dernière revue : 2026-09-01 · concept stable