Tokens de saída
Os tokens que um modelo gera na resposta. Normalmente a metade cara da conta — 2 a 5 vezes o preço da entrada — porque cada um exige uma passada para a frente completa.
O que é
O modelo produz a resposta um token por vez, cada token condicionado a tudo o que veio antes. Essa geração passo a passo é a fase de decodificação, e é por isso que a saída é lenta e cara comparada com ler o prompt.
Por que importa
O preço de saída domina qualquer carga que escreve muito: geração de código, redação de textos longos, agentes que raciocinam passo a passo. A velocidade de saída (tokens por segundo) define quanto o usuário espera.
Impacto em custo e infraestrutura
Limitar max_tokens e pedir respostas concisas é a alavanca mais direta numa conta com muita saída. O prompting de "pense passo a passo" melhora a qualidade mas multiplica o custo de saída.