Inférence serverless
Un endpoint GPU hébergé qui s'adapte à ton trafic, jusqu'à zéro. Tu paies à la requête ou à la seconde de calcul, pas une machine allumée en permanence - au prix de démarrages à froid.
Ce que c'est
La plateforme charge ton modèle sur un GPU à l'arrivée d'une requête, le garde chaud un moment, et le libère pendant les creux. Facturation à l'usage (GPU-secondes ou à la requête). Fournisseurs : Modal, Baseten, RunPod Serverless, Replicate, Together.
Pourquoi c'est important
Ça comble l'écart entre une API au token et un GPU dédié : moins cher que l'always-on pour un trafic irrégulier, plus prévisible qu'une API brute pour des modèles custom. L'arbitrage : la latence de démarrage à froid et un tarif à la seconde plus élevé que l'on-demand simple.