<- Todos los términos

Rendimiento (throughput)

Cuánto trabajo hace un sistema por unidad de tiempo: peticiones por segundo, o tokens totales por segundo entre todos los usuarios concurrentes. La cifra que decide la eficiencia de costo al hacer self-hosting.

Qué es

Los tokens per second por usuario pueden parecer modestos mientras el rendimiento agregado es alto, porque los servidores de inferencia modernos procesan muchas peticiones en el mismo batch. Una GPU que sirve a 30 usuarios a 25 tok/s cada uno hace 750 tok/s de trabajo útil.

Por qué importa

El costo por token en una GPU de precio fijo es GPU $/h / (tokens agregados por hora). Un rendimiento bajo (pocos usuarios, batches pequeños, una GPU parada) es lo que hace que el self hosting pierda frente a una API.

Conceptos relacionados

Úsalo en Obolith

Última revisión: 2026-09-01 · concepto atemporal