Tokens de salida
Los tokens que un modelo genera en su respuesta. Normalmente la mitad cara de la factura (2 a 5 veces el precio de entrada) porque cada uno requiere una pasada hacia delante completa.
Qué es
El modelo produce su respuesta un token cada vez, cada uno condicionado por todo lo anterior. Esta generación paso a paso es la fase de decodificación, y por eso la salida es lenta y cara frente a leer el prompt.
Por qué importa
El precio de salida domina cualquier carga que escribe mucho: generación de código, redacción de textos largos, agentes que razonan paso a paso. La velocidad de salida (tokens por segundo) fija cuánto espera el usuario.
Impacto en costo e infraestructura
Limitar max_tokens y pedir respuestas concisas es la palanca más directa sobre una factura con mucha salida. El prompting de «piensa paso a paso» mejora la calidad pero multiplica el costo de salida.