Tarif entrée en cache
Une remise sur les tokens d'entrée qui se répètent entre appels - prompt système stable, exemples, long document. Le préfixe en cache est facturé à ~10-25 % du tarif d'entrée normal.
Ce que c'est
Quand des requêtes consécutives partagent un préfixe identique, le fournisseur peut en réutiliser le calcul. Tu paies un petit « cache write » unique, puis un tarif « cache read » fortement réduit à chaque appel suivant qui touche le même préfixe (dans un court TTL).
C'est une fonction de facturation, distincte du cache KV en GPU.
Pourquoi c'est important
Pour toute app avec un gros prompt fixe - instructions d'agent, schéma, base de connaissances - le cache peut réduire la facture d'entrée de 50 à 90 %. Ça ne marche que si le préfixe est identique octet pour octet et les requêtes assez fréquentes pour rester chaudes.
Exemple
Un agent de code avec un prompt système de 12K tokens, 100K appels/mois : entrée non cachée ~1,2 Md tokens. À 3 $/1M = 3 600 $. Avec des cache reads à 0,30 $/1M, le même préfixe coûte ~360 $ - 3 240 $ d'économie.