<- Tous les termes

Concurrence

Le nombre de requêtes qu'un modèle traite en même temps. Plus de concurrence augmente le débit et l'efficacité économique, mais c'est plafonné par la VRAM car chaque requête en cours a besoin de son propre cache KV.

Ce que c'est

Les serveurs d'inférence batchent les requêtes simultanées pour qu'une passe sur les poids serve plusieurs utilisateurs. Mais chaque requête garde un cache KV en VRAM pendant toute la durée de son contexte, d'où un plafond dur.

Pourquoi c'est important

Le coût au token baisse quand la concurrence monte - le GPU est amorti sur plus de travail. C'est la raison principale pour laquelle une API partagée est moins chère au token qu'un GPU self-hosté peu utilisé.

Concepts liés

Sur Obolith

Dernière revue : 2026-09-01 · concept stable