<- Todos los términos

Batching continuo

Una técnica de servidor de inferencia que añade y quita peticiones del batch en curso token a token, en lugar de esperar a que termine un batch entero. Multiplica varias veces el rendimiento de la GPU con la misma latencia.

Qué es

El batching ingenuo («estático») agrupa N peticiones, las ejecuta juntas hasta que termina la más lenta y luego lanza el siguiente grupo: las peticiones cortas esperan a las largas y la GPU se queda parada. El batching continuo (vLLM, TGI, TensorRT-LLM) planifica en cada paso de decodificación: en cuanto una petición emite su último token, se libera su hueco y una petición en cola ocupa su lugar.

Depende de un kv cache bien gestionado para mantener muchas peticiones a medio terminar a la vez.

Por qué importa

El batching continuo es la razón principal de que una GPU autoalojada pueda servir a 10-40 usuarios simultáneos en lugar de 2-3. Es la diferencia entre un self-host que alcanza el punto de equilibrio y uno que nunca lo hace. Hoy todo servidor de inferencia serio lo hace por defecto.

Impacto en costo e infraestructura

No baja tu tarifa de GPU-hora: sube la tasa de utilización que puedes alcanzar de verdad, que es lo que las calculadoras de self-host usan para calcular el costo por petición.

Conceptos relacionados

Úsalo en Obolith

Última revisión: 2026-09-04 · concepto atemporal