<- Tous les termes

Mise en cache du prompt

Réutiliser l'état déjà calculé d'un préfixe de prompt répété au lieu de le recalculer à chaque appel. Sur les API ça se traduit par un tarif « cache read » réduit ; en self-host c'est une fonction du serveur (prefix caching).

Ce que c'est

Quand beaucoup de requêtes commencent par le même long bloc - prompt système, charte de style, document récupéré, schéma d'outil - le modèle refait le même travail dessus à chaque fois. La mise en cache du prompt stocke le kv cache de ce préfixe (en mémoire GPU, brièvement) pour qu'une requête suivante qui correspond passe directement à la partie nouvelle.

Sur les API tu l'actives (ou c'est automatique) et tu paies le tarif entrée en cache : un petit coût d'écriture, puis ~10-25 % du tarif d'entrée sur les hits. Les serveurs self-host font le prefix caching tout seuls.

Pourquoi c'est important

Pour le rag, les agents et les chatbots à long prompt système, le préfixe répété représente souvent 80-95 % des tokens d'entrée. Le mettre en cache peut réduire de moitié ou plus la ligne LLM de ta facture - c'est en général le premier levier à activer. Ça baisse aussi le ttft.

Concepts liés

Sur Obolith

FAQ

Prompt caching = KV cache ?

Le prompt caching est une façon de réutiliser le KV cache entre requêtes. Le KV cache lui-même existe au sein d’une seule génération.

Dernière revue : 2026-09-04 · concept stable