← Guias
how-to · 4 min

Cache de prompt: a primeira alavanca de uma conta RAG

Se as suas requisições compartilham um bloco de abertura longo — prompt de sistema, documento, esquema de ferramenta — você paga preço cheio para recalculá-lo a cada chamada. Quanto isso economiza e como ativar.

Obolith · Última atualização: 2026-09-10

A maioria dos times busca primeiro um modelo mais barato. Para o rag e os agentes esse é o primeiro reflexo errado. O ganho maior e mais fácil é o cache do prompt: parar de pagar para recalcular a parte do prompt que nunca muda.

Por que funciona

Quando requisição após requisição começa pelo mesmo bloco — prompt de sistema, guia de estilo, documento recuperado, definições de ferramentas — o modelo faz exatamente o mesmo trabalho sobre ele toda vez. Se o provedor guarda o estado já calculado desse prefixo, uma requisição posterior que corresponda pula direto para a parte nova.

Você paga uma pequena "escrita de cache" única e depois uma tarifa de leitura de cache de cerca de 10-25% do preço de entrada normal em cada chamada que acerta o prefixo, dentro de uma janela curta (muitas vezes de 5 minutos a uma hora).

Quanto economiza

Para uma chamada RAG típica, o prefixo repetido — prompt de sistema mais contexto recuperado — é 80-95% dos tokens de entrada. A resposta em si é pequena. Colocar esse prefixo em cache leva, portanto, quase todo o custo de entrada para perto de zero.

exemplo com números

4.000 tokens de entrada/chamada, dos quais 3.600 de prefixo estável

sem cache: 4.000 × 0,50 $/1M ......... 0,0020 $ / chamada

com cache: 400 × 0,50 + 3.600 × 0,075 0,0005 $ / chamada

-> a linha de entrada cai ~75 %

Para os agentes é ainda mais forte: o histórico de conversa que cresce é reenviado a cada passo e a maior parte não mudou desde o anterior.

Como ativar

  • Anthropic - adicione pontos cache_control na requisição; até 4 segmentos em cache.
  • OpenAI - automático para prompts acima de 1.024 tokens, sem mudança de código; o desconto se aplica ao prefixo correspondente.
  • Google (Gemini) - context caching explícito via API, ou implícito nos modelos recentes.
  • Servidores de código aberto (vLLM, TGI, SGLang) - o prefix caching vem ativado por padrão no self-host.

A única regra: ponha o conteúdo estável primeiro (prompt de sistema, documentos, esquemas de ferramentas) e o conteúdo variável por último (a vez do usuário). Um cache só corresponde a partir do início do prompt: um token que muda no topo invalida tudo o que vem depois.

Quando não ajuda

Prompts curtos (um chatbot simples com um prompt de sistema de uma linha), ou cargas em que cada requisição é realmente única sem prefixo compartilhado. E um modelo sem tarifa de cache nenhuma — a tabela de preços do Obolith mostra a tarifa de leitura de cache quando o provedor oferece uma.

Ver quais modelos têm tarifa de entrada em cache →Calcule a economia para a sua carga →

Os números são ilustrativos. Confirme os preços atuais no próprio site do provedor antes de decidir.