Démarrage à froid
Le délai quand un endpoint serverless ou scalé à zéro doit charger un modèle en mémoire GPU avant de répondre à la première requête. De quelques secondes à quelques minutes pour les gros modèles.
Ce que c'est
Une instance chaude a déjà les poids en VRAM et répond tout de suite. Une froide doit être placée sur un GPU et lire des dizaines de Go de poids depuis le stockage. Garder une instance chaude coûte de l'argent même au repos - l'arbitrage central de l'inférence serverless.
Pourquoi c'est important
Pour un trafic irrégulier et faible, le scale-to-zero économise le coût horaire mais ajoute un démarrage à froid à la première requête après un creux. Pour un trafic régulier, une instance dédiée toujours chaude est souvent plus rapide ET moins chère.