Partida a frio
O atraso quando um endpoint serverless ou escalado a zero precisa carregar um modelo na memória da GPU antes de poder responder à primeira requisição. Pode ser de segundos a minutos para modelos grandes.
O que é
Uma instância quente já tem os pesos residentes na VRAM e responde de imediato. Uma fria precisa ser agendada numa GPU e ler primeiro dezenas de gigabytes de pesos do armazenamento. Manter uma instância quente custa dinheiro mesmo ociosa — o trade-off central da inferência serverless.
Por que importa
Para cargas em rajadas e de baixo volume, o escalonamento a zero economiza o custo por hora mas adiciona uma partida a frio à primeira requisição após uma pausa. Para tráfego constante, uma instância dedicada sempre quente costuma ser ao mesmo tempo mais rápida e mais barata.