Concurrence
Le nombre de requêtes qu'un modèle traite en même temps. Plus de concurrence augmente le débit et l'efficacité économique, mais c'est plafonné par la VRAM car chaque requête en cours a besoin de son propre cache KV.
Ce que c'est
Les serveurs d'inférence batchent les requêtes simultanées pour qu'une passe sur les poids serve plusieurs utilisateurs. Mais chaque requête garde un cache KV en VRAM pendant toute la durée de son contexte, d'où un plafond dur.
Pourquoi c'est important
Le coût au token baisse quand la concurrence monte - le GPU est amorti sur plus de travail. C'est la raison principale pour laquelle une API partagée est moins chère au token qu'un GPU self-hosté peu utilisé.