<- Tous les termes

Inférence serverless

Un endpoint GPU hébergé qui s'adapte à ton trafic, jusqu'à zéro. Tu paies à la requête ou à la seconde de calcul, pas une machine allumée en permanence - au prix de démarrages à froid.

Ce que c'est

La plateforme charge ton modèle sur un GPU à l'arrivée d'une requête, le garde chaud un moment, et le libère pendant les creux. Facturation à l'usage (GPU-secondes ou à la requête). Fournisseurs : Modal, Baseten, RunPod Serverless, Replicate, Together.

Pourquoi c'est important

Ça comble l'écart entre une API au token et un GPU dédié : moins cher que l'always-on pour un trafic irrégulier, plus prévisible qu'une API brute pour des modèles custom. L'arbitrage : la latence de démarrage à froid et un tarif à la seconde plus élevé que l'on-demand simple.

Concepts liés

Sur Obolith

Dernière revue : 2026-09-01