<- Tous les termes

Tarif entrée en cache

Une remise sur les tokens d'entrée qui se répètent entre appels - prompt système stable, exemples, long document. Le préfixe en cache est facturé à ~10-25 % du tarif d'entrée normal.

Ce que c'est

Quand des requêtes consécutives partagent un préfixe identique, le fournisseur peut en réutiliser le calcul. Tu paies un petit « cache write » unique, puis un tarif « cache read » fortement réduit à chaque appel suivant qui touche le même préfixe (dans un court TTL).

C'est une fonction de facturation, distincte du cache KV en GPU.

Pourquoi c'est important

Pour toute app avec un gros prompt fixe - instructions d'agent, schéma, base de connaissances - le cache peut réduire la facture d'entrée de 50 à 90 %. Ça ne marche que si le préfixe est identique octet pour octet et les requêtes assez fréquentes pour rester chaudes.

Exemple

Un agent de code avec un prompt système de 12K tokens, 100K appels/mois : entrée non cachée ~1,2 Md tokens. À 3 $/1M = 3 600 $. Avec des cache reads à 0,30 $/1M, le même préfixe coûte ~360 $ - 3 240 $ d'économie.

Concepts liés

Sur Obolith

Dernière revue : 2026-09-01 · concept stable