<- Todos os termos

Partida a frio

O atraso quando um endpoint serverless ou escalado a zero precisa carregar um modelo na memória da GPU antes de poder responder à primeira requisição. Pode ser de segundos a minutos para modelos grandes.

O que é

Uma instância quente já tem os pesos residentes na VRAM e responde de imediato. Uma fria precisa ser agendada numa GPU e ler primeiro dezenas de gigabytes de pesos do armazenamento. Manter uma instância quente custa dinheiro mesmo ociosa — o trade-off central da inferência serverless.

Por que importa

Para cargas em rajadas e de baixo volume, o escalonamento a zero economiza o custo por hora mas adiciona uma partida a frio à primeira requisição após uma pausa. Para tráfego constante, uma instância dedicada sempre quente costuma ser ao mesmo tempo mais rápida e mais barata.

Conceitos relacionados

Use no Obolith

Última revisão: 2026-09-01 · conceito atemporal