Mise en cache du prompt
Réutiliser l'état déjà calculé d'un préfixe de prompt répété au lieu de le recalculer à chaque appel. Sur les API ça se traduit par un tarif « cache read » réduit ; en self-host c'est une fonction du serveur (prefix caching).
Ce que c'est
Quand beaucoup de requêtes commencent par le même long bloc - prompt système, charte de style, document récupéré, schéma d'outil - le modèle refait le même travail dessus à chaque fois. La mise en cache du prompt stocke le kv cache de ce préfixe (en mémoire GPU, brièvement) pour qu'une requête suivante qui correspond passe directement à la partie nouvelle.
Sur les API tu l'actives (ou c'est automatique) et tu paies le tarif entrée en cache : un petit coût d'écriture, puis ~10-25 % du tarif d'entrée sur les hits. Les serveurs self-host font le prefix caching tout seuls.
Pourquoi c'est important
Pour le rag, les agents et les chatbots à long prompt système, le préfixe répété représente souvent 80-95 % des tokens d'entrée. Le mettre en cache peut réduire de moitié ou plus la ligne LLM de ta facture - c'est en général le premier levier à activer. Ça baisse aussi le ttft.
Concepts liés
Sur Obolith
FAQ
Prompt caching = KV cache ?
Le prompt caching est une façon de réutiliser le KV cache entre requêtes. Le KV cache lui-même existe au sein d’une seule génération.