← Guides
how-to · 4 min

Mise en cache du prompt : le premier levier sur une facture RAG

Si tes requêtes partagent un long bloc d’ouverture - prompt système, document, schéma d’outil - tu paies plein tarif pour le recalculer à chaque appel. Combien ça économise et comment l’activer.

Obolith · Dernière mise à jour : 2026-09-10

La plupart des équipes cherchent d’abord un modèle moins cher. Pour le rag et les agents c’est le mauvais premier réflexe. Le gain plus gros et plus facile, c’est la mise en cache du prompt : arrêter de payer pour recalculer la partie du prompt qui ne change jamais.

Pourquoi ça marche

Quand requête après requête commence par le même bloc - prompt système, charte de style, document récupéré, définitions d’outils - le modèle fait exactement le même travail dessus à chaque fois. Si le fournisseur stocke l’état déjà calculé de ce préfixe, une requête suivante qui correspond passe directement à la partie nouvelle.

Tu paies un petit « cache write » unique, puis un tarif cache read d’environ 10-25 % du prix d’entrée normal à chaque appel qui touche le préfixe, dans une courte fenêtre (souvent 5 minutes à une heure).

Combien ça économise

Pour un appel RAG type, le préfixe répété - prompt système plus contexte récupéré - fait 80-95 % des tokens d’entrée. La réponse elle-même est petite. Mettre ce préfixe en cache ramène donc l’essentiel du coût d’entrée près de zéro.

exemple chiffré

4 000 tokens d’entrée/appel, dont 3 600 de préfixe stable

sans cache : 4 000 × 0,50 $/1M ........ 0,0020 $ / appel

avec cache : 400 × 0,50 + 3 600 × 0,075 0,0005 $ / appel

-> la ligne entrée baisse de ~75 %

Pour les agents c’est encore plus fort : l’historique de conversation qui grossit est renvoyé à chaque étape et la majeure partie n’a pas changé depuis la précédente.

Comment l’activer

  • Anthropic - ajoute des points cache_control dans la requête ; jusqu’à 4 segments en cache.
  • OpenAI - automatique pour les prompts au-delà de 1 024 tokens, sans changement de code ; la remise s’applique au préfixe correspondant.
  • Google (Gemini) - context caching explicite via l’API, ou implicite sur les modèles récents.
  • Serveurs open source (vLLM, TGI, SGLang) - le prefix caching est activé par défaut en self-host.

La seule règle : mets le contenu stable en premier (prompt système, documents, schémas d’outils) et le contenu variable en dernier (le tour utilisateur). Un cache ne correspond qu’à partir du début du prompt - un token qui change en haut invalide tout ce qui suit.

Quand ça n’aide pas

Les prompts courts (un simple chatbot avec un prompt système d’une ligne), ou les charges où chaque requête est vraiment unique sans préfixe partagé. Et un modèle sans tarif de cache du tout - le tableau de prix d’Obolith affiche le tarif cache read quand le fournisseur en propose un.

Voir quels modèles ont un tarif entrée en cache →Chiffre l’économie pour ta charge →

Les chiffres sont indicatifs. Vérifie les prix en vigueur sur le site du fournisseur avant de décider.