Tokens por segundo
La velocidad a la que un modelo genera salida una vez ha empezado. Fija cuánto tarda una respuesta completa y, en una GPU autoalojada, determina el costo por token.
Qué es
Una cifra por petición para la fase de decodificación. Cada token de salida necesita una pasada que lee los pesos del modelo y el kv cache desde la VRAM, así que la velocidad la fija el ancho de banda de memoria, no el cómputo bruto.
Apenas depende de la longitud del prompt: ese costo cae en el ttft.
Por qué importa
Una respuesta de 300 tokens a 20 tok/s tarda 15 segundos; a 120 tok/s, 2,5 segundos. Para agentes que encadenan muchas llamadas al modelo, la generación lenta se acumula en minutos.
Impacto en costo e infraestructura
En una GPU alquilada, costo por 1M de tokens = (GPU $/h / tok/s) × 278. Duplicar los tok/s (con una GPU más rápida, cuantización o mejor batching) reduce a la mitad el costo por token. Es el núcleo de la aritmética del self hosting.
Conceptos relacionados
Úsalo en Obolith
Preguntas frecuentes
¿Por qué mi modelo autoalojado es más lento que la API?
Los proveedores ejecutan stacks de inferencia afinados, hacen batching agresivo entre muchos usuarios y a menudo sirven pesos cuantizados en hardware de gama alta. Una sola petición sin batching en una GPU rara vez iguala eso.