Cache de prompt
Reutilizar o estado já calculado de um prefixo de prompt repetido em vez de recalculá-lo a cada chamada. Nas APIs aparece como uma tarifa reduzida de "leitura de cache"; no self-host é um recurso do servidor (prefix caching).
O que é
Quando muitas requisições começam com o mesmo bloco longo (um prompt de sistema, um guia de estilo, um documento recuperado, um esquema de ferramenta) o modelo faz o mesmo trabalho nesse bloco toda vez. O cache de prompt guarda o kv cache desse prefixo (na memória da GPU, por pouco tempo) para que uma requisição posterior que combine pule direto para a parte nova.
Nas APIs você ativa (ou é automático) e paga o preço de entrada em cache: uma pequena taxa de escrita e depois ~10-25% da tarifa de entrada nos acertos de cache. Os servidores de self-host fazem prefix caching sozinhos.
Por que importa
Para rag, agentes e chatbots com prompt de sistema longo, o prefixo repetido costuma ser 80-95% dos tokens de entrada. Colocá-lo em cache pode reduzir pela metade ou mais a linha de LLM da sua conta — geralmente é a primeira alavanca a puxar. Também baixa o ttft.
Conceitos relacionados
Use no Obolith
Perguntas frequentes
O cache de prompt é a mesma coisa que o KV cache?
O cache de prompt é uma forma de reutilizar o KV cache entre requisições. O KV cache em si existe dentro de uma única geração.