Inferência serverless
Um endpoint de GPU hospedado que escala com o seu tráfego, inclusive até zero. Você paga por requisição ou por segundo de computação, não por uma máquina sempre ligada — ao custo de partidas a frio.
O que é
A plataforma carrega o seu modelo numa GPU quando chega uma requisição, mantém quente por pouco tempo e libera nos períodos ociosos. A cobrança é por uso (GPU-segundos ou por requisição). Provedores: Modal, Baseten, RunPod Serverless, Replicate, Together.
Por que importa
Preenche o vão entre uma API por token e uma GPU dedicada: mais barato que deixar sempre ligada para tráfego em rajadas, mais previsível que uma API crua para modelos próprios. O trade-off é a latência de partida a frio e uma tarifa por segundo mais alta que o on-demand comum.