<- Todos os termos

Cache de prompt

Reutilizar o estado já calculado de um prefixo de prompt repetido em vez de recalculá-lo a cada chamada. Nas APIs aparece como uma tarifa reduzida de "leitura de cache"; no self-host é um recurso do servidor (prefix caching).

O que é

Quando muitas requisições começam com o mesmo bloco longo (um prompt de sistema, um guia de estilo, um documento recuperado, um esquema de ferramenta) o modelo faz o mesmo trabalho nesse bloco toda vez. O cache de prompt guarda o kv cache desse prefixo (na memória da GPU, por pouco tempo) para que uma requisição posterior que combine pule direto para a parte nova.

Nas APIs você ativa (ou é automático) e paga o preço de entrada em cache: uma pequena taxa de escrita e depois ~10-25% da tarifa de entrada nos acertos de cache. Os servidores de self-host fazem prefix caching sozinhos.

Por que importa

Para rag, agentes e chatbots com prompt de sistema longo, o prefixo repetido costuma ser 80-95% dos tokens de entrada. Colocá-lo em cache pode reduzir pela metade ou mais a linha de LLM da sua conta — geralmente é a primeira alavanca a puxar. Também baixa o ttft.

Conceitos relacionados

Use no Obolith

Perguntas frequentes

O cache de prompt é a mesma coisa que o KV cache?

O cache de prompt é uma forma de reutilizar o KV cache entre requisições. O KV cache em si existe dentro de uma única geração.

Última revisão: 2026-09-04 · conceito atemporal