Inferencia serverless
Un endpoint de GPU alojado que escala con tu tráfico, incluso hasta cero. Pagas por petición o por segundo de cómputo, no por una máquina siempre encendida, a cambio de arranques en frío.
Qué es
La plataforma carga tu modelo en una GPU cuando llega una petición, lo mantiene caliente un rato y lo libera en los periodos de inactividad. La facturación es según uso (GPU-segundos o por petición). Proveedores: Modal, Baseten, RunPod Serverless, Replicate, Together.
Por qué importa
Cubre el hueco entre una API por token y una GPU dedicada: más barata que tenerla siempre encendida para tráfico a ráfagas, más predecible que una API en crudo para modelos propios. El compromiso es la latencia de arranque en frío y una tarifa por segundo más alta que el on-demand normal.