<- Todos los términos

Inferencia serverless

Un endpoint de GPU alojado que escala con tu tráfico, incluso hasta cero. Pagas por petición o por segundo de cómputo, no por una máquina siempre encendida, a cambio de arranques en frío.

Qué es

La plataforma carga tu modelo en una GPU cuando llega una petición, lo mantiene caliente un rato y lo libera en los periodos de inactividad. La facturación es según uso (GPU-segundos o por petición). Proveedores: Modal, Baseten, RunPod Serverless, Replicate, Together.

Por qué importa

Cubre el hueco entre una API por token y una GPU dedicada: más barata que tenerla siempre encendida para tráfico a ráfagas, más predecible que una API en crudo para modelos propios. El compromiso es la latencia de arranque en frío y una tarifa por segundo más alta que el on-demand normal.

Conceptos relacionados

Úsalo en Obolith

Última revisión: 2026-09-01