Batching continu
Une technique de serveur d'inférence qui ajoute et retire des requêtes du batch en cours token par token, au lieu d'attendre qu'un batch entier finisse. Multiplie le débit GPU par plusieurs à latence égale.
Ce que c'est
Le batching naïf (« statique ») groupe N requêtes, les exécute ensemble jusqu'à ce que la plus lente finisse, puis lance le groupe suivant - les requêtes courtes attendent les longues et le GPU tourne à vide. Le batching continu (vLLM, TGI, TensorRT-LLM) ordonnance à chaque étape de décodage : dès qu'une requête émet son dernier token, son emplacement est libéré et une requête en file prend sa place.
Ça repose sur un kv cache bien géré pour tenir beaucoup de requêtes à moitié terminées en même temps.
Pourquoi c'est important
Le batching continu est la principale raison pour laquelle un GPU self-hébergé sert 10-40 utilisateurs simultanés au lieu de 2-3. C'est la différence entre un self-host rentable et un qui ne l'est jamais. Tout serveur d'inférence sérieux le fait par défaut aujourd'hui.
Impact coût & infrastructure
Ça ne baisse pas ton tarif GPU-heure - ça augmente le taux d'utilisation que tu peux réellement atteindre, ce que les calculateurs self-host utilisent pour établir le coût par requête.