<- Tous les termes

Token

L'unité que lit et écrit un LLM. Environ 3-4 caractères d'anglais, soit ~0,75 mot. Toute facture d'API se compte en tokens.

Ce que c'est

Un modèle ne voit ni lettres ni mots. Le texte est d'abord découpé en tokens - de courts fragments issus d'un vocabulaire figé appris à l'entraînement. Les mots courants font un token ; les mots rares en font plusieurs. La ponctuation, les espaces et les symboles de code sont aussi des tokens.

Règle approximative pour l'anglais : 1 token ~= 4 caractères ~= 0,75 mot, donc 1 000 tokens ~= 750 mots. Les autres langues, le code et les chiffres se tokenisent moins efficacement.

Pourquoi c'est important

Le token est le compteur. Les API facturent par million de tokens, répartis entre tokens d'entrée (ton prompt) et tokens de sortie (la réponse). Les limites des modèles - la fenêtre de contexte - sont en tokens. Le débit se mesure en tokens par seconde.

Impact coût & infrastructure

Comme les tokens de sortie coûtent en général 2 à 5 fois plus que ceux d'entrée, la forme de ton usage compte autant que sa taille. Un chatbot à long contexte et réponses courtes est intensif en entrée ; un agent qui écrit du code est intensif en sortie. Le prix blended tente de réunir les deux en un seul nombre.

Exemple

Un bot de support gérant 100 000 conversations/mois, ~700 tokens d'entrée + 350 de sortie chacune, consomme ~70M d'entrée et ~35M de sortie/mois. À 0,15 $ / 0,60 $ par 1M : ~32 $/mois ; à 3 $ / 15 $ : ~735 $.

Concepts liés

Sur Obolith

FAQ

Combien de tokens pour une page de texte ?

Une page A4 dense fait ~500-700 mots, soit ~700-950 tokens.

Tous les fournisseurs tokenisent-ils pareil ?

Non. Chaque famille de modèles a son tokeniseur, donc le même texte peut donner un nombre de tokens différent selon OpenAI, Anthropic ou Google. Les écarts sont faibles mais réels.

Dernière revue : 2026-09-01 · concept stable