Concurrencia
Cuántas peticiones maneja un modelo a la vez. Más concurrencia sube el rendimiento y la eficiencia de costo, pero está topada por la VRAM porque cada petición en curso necesita su propio KV cache.
Qué es
Los servidores de inferencia agrupan las peticiones concurrentes para que una sola pasada por los pesos del modelo sirva a muchos usuarios. Pero cada petición concurrente mantiene un kv cache en la VRAM durante toda la longitud de su contexto, así que hay un techo duro sobre cuántas caben.
Por qué importa
El costo por token baja según sube la concurrencia: la GPU se amortiza sobre más trabajo. Es la razón principal de que una API compartida sea más barata por token que una GPU autoalojada poco usada.