Tokens de sortie
Les tokens qu'un modèle génère dans sa réponse. En général la moitié chère de la facture - 2 à 5 fois le prix d'entrée - car chacun demande une passe complète du modèle.
Ce que c'est
Le modèle produit sa réponse un token à la fois, chacun conditionné par tout ce qui précède. Cette génération pas à pas est la phase decode, et c'est pourquoi la sortie est lente et coûteuse face à la lecture du prompt.
Pourquoi c'est important
Le prix de sortie domine tout usage qui écrit beaucoup : génération de code, rédaction longue, agents qui raisonnent étape par étape. La vitesse de sortie - tokens par seconde - fixe le temps d'attente.
Impact coût & infrastructure
Plafonner max_tokens et demander des réponses concises est le levier le plus direct sur une facture intensive en sortie. Le prompting « réfléchis étape par étape » améliore la qualité mais multiplie le coût de sortie.