<- Tous les termes

Tokens d'entrée

Les tokens que tu envoies au modèle : prompt système, historique, contexte récupéré, message utilisateur. En général la moitié la moins chère de la facture.

Ce que c'est

Tout ce que le modèle lit avant de répondre, compté en tokens : le prompt système, l'historique complet renvoyé à chaque tour, les documents collés pour le RAG, et le dernier message. Dans les longues conversations, l'historique domine.

Pourquoi c'est important

L'entrée est facturée séparément de la sortie et coûte normalement 3 à 5 fois moins cher. Elle a aussi un plafond : le modèle refuse si entrée + sortie dépassent sa fenêtre de contexte.

Impact coût & infrastructure

Le volume d'entrée grossit à chaque tour de conversation et à chaque document dans un prompt RAG - c'est la partie qui gonfle en silence. Le cache de prompt peut réduire le coût du préfixe répété (prompt système, exemples) jusqu'à ~90 %.

Concepts liés

Sur Obolith

Dernière revue : 2026-09-01 · concept stable