Cache de prompt: a primeira alavanca de uma conta RAG
Se as suas requisições compartilham um bloco de abertura longo — prompt de sistema, documento, esquema de ferramenta — você paga preço cheio para recalculá-lo a cada chamada. Quanto isso economiza e como ativar.
A maioria dos times busca primeiro um modelo mais barato. Para o rag e os agentes esse é o primeiro reflexo errado. O ganho maior e mais fácil é o cache do prompt: parar de pagar para recalcular a parte do prompt que nunca muda.
Por que funciona
Quando requisição após requisição começa pelo mesmo bloco — prompt de sistema, guia de estilo, documento recuperado, definições de ferramentas — o modelo faz exatamente o mesmo trabalho sobre ele toda vez. Se o provedor guarda o estado já calculado desse prefixo, uma requisição posterior que corresponda pula direto para a parte nova.
Você paga uma pequena "escrita de cache" única e depois uma tarifa de leitura de cache de cerca de 10-25% do preço de entrada normal em cada chamada que acerta o prefixo, dentro de uma janela curta (muitas vezes de 5 minutos a uma hora).
Quanto economiza
Para uma chamada RAG típica, o prefixo repetido — prompt de sistema mais contexto recuperado — é 80-95% dos tokens de entrada. A resposta em si é pequena. Colocar esse prefixo em cache leva, portanto, quase todo o custo de entrada para perto de zero.
4.000 tokens de entrada/chamada, dos quais 3.600 de prefixo estável
sem cache: 4.000 × 0,50 $/1M ......... 0,0020 $ / chamada
com cache: 400 × 0,50 + 3.600 × 0,075 0,0005 $ / chamada
-> a linha de entrada cai ~75 %
Para os agentes é ainda mais forte: o histórico de conversa que cresce é reenviado a cada passo e a maior parte não mudou desde o anterior.
Como ativar
- Anthropic - adicione pontos
cache_controlna requisição; até 4 segmentos em cache. - OpenAI - automático para prompts acima de 1.024 tokens, sem mudança de código; o desconto se aplica ao prefixo correspondente.
- Google (Gemini) - context caching explícito via API, ou implícito nos modelos recentes.
- Servidores de código aberto (vLLM, TGI, SGLang) - o prefix caching vem ativado por padrão no self-host.
A única regra: ponha o conteúdo estável primeiro (prompt de sistema, documentos, esquemas de ferramentas) e o conteúdo variável por último (a vez do usuário). Um cache só corresponde a partir do início do prompt: um token que muda no topo invalida tudo o que vem depois.
Quando não ajuda
Prompts curtos (um chatbot simples com um prompt de sistema de uma linha), ou cargas em que cada requisição é realmente única sem prefixo compartilhado. E um modelo sem tarifa de cache nenhuma — a tabela de preços do Obolith mostra a tarifa de leitura de cache quando o provedor oferece uma.
Ver quais modelos têm tarifa de entrada em cache →Calcule a economia para a sua carga →Os números são ilustrativos. Confirme os preços atuais no próprio site do provedor antes de decidir.