<- Todos los términos

Concurrencia

Cuántas peticiones maneja un modelo a la vez. Más concurrencia sube el rendimiento y la eficiencia de costo, pero está topada por la VRAM porque cada petición en curso necesita su propio KV cache.

Qué es

Los servidores de inferencia agrupan las peticiones concurrentes para que una sola pasada por los pesos del modelo sirva a muchos usuarios. Pero cada petición concurrente mantiene un kv cache en la VRAM durante toda la longitud de su contexto, así que hay un techo duro sobre cuántas caben.

Por qué importa

El costo por token baja según sube la concurrencia: la GPU se amortiza sobre más trabajo. Es la razón principal de que una API compartida sea más barata por token que una GPU autoalojada poco usada.

Conceptos relacionados

Úsalo en Obolith

Última revisión: 2026-09-01 · concepto atemporal