Arranque en frío
El retraso cuando un endpoint serverless o escalado a cero tiene que cargar un modelo en la memoria de la GPU antes de poder responder a la primera petición. Puede ser de segundos a minutos para modelos grandes.
Qué es
Una instancia caliente ya tiene los pesos residentes en la VRAM y responde de inmediato. Una fría tiene que programarse en una GPU y leer primero decenas de gigabytes de pesos desde el almacenamiento. Mantener una instancia caliente cuesta dinero aunque esté parada: el compromiso central de la inferencia serverless.
Por qué importa
Para cargas a ráfagas y de bajo volumen, el escalado a cero ahorra el costo por hora pero añade un arranque en frío a la primera petición tras una pausa. Para tráfico constante, una instancia dedicada siempre caliente suele ser a la vez más rápida y más barata.