<- Tous les termes

Tokens de sortie

Les tokens qu'un modèle génère dans sa réponse. En général la moitié chère de la facture - 2 à 5 fois le prix d'entrée - car chacun demande une passe complète du modèle.

Ce que c'est

Le modèle produit sa réponse un token à la fois, chacun conditionné par tout ce qui précède. Cette génération pas à pas est la phase decode, et c'est pourquoi la sortie est lente et coûteuse face à la lecture du prompt.

Pourquoi c'est important

Le prix de sortie domine tout usage qui écrit beaucoup : génération de code, rédaction longue, agents qui raisonnent étape par étape. La vitesse de sortie - tokens par seconde - fixe le temps d'attente.

Impact coût & infrastructure

Plafonner max_tokens et demander des réponses concises est le levier le plus direct sur une facture intensive en sortie. Le prompting « réfléchis étape par étape » améliore la qualité mais multiplie le coût de sortie.

Concepts liés

Sur Obolith

Dernière revue : 2026-09-01 · concept stable