Preço de entrada em cache
Um desconto sobre os tokens de entrada que se repetem entre chamadas — um prompt de sistema estável, exemplos few-shot, um documento longo. O prefixo em cache é cobrado a cerca de 10-25% da tarifa de entrada normal.
O que é
Quando requisições consecutivas compartilham um prefixo de abertura idêntico, o provedor pode reutilizar o cálculo. Você paga uma pequena taxa única de "escrita de cache" e depois uma tarifa de "leitura de cache" bem reduzida em cada chamada posterior que acerta o mesmo prefixo (dentro de um TTL curto).
É um recurso de faturamento, distinto do cache KV na GPU.
Por que importa
Para qualquer app com um prompt fixo grande — instruções de agente, um esquema, uma base de conhecimento — o cache pode cortar a conta de entrada em 50-90%. Só funciona se o prefixo for idêntico byte a byte e as requisições forem frequentes o suficiente para se manter quentes.
Exemplo
Um agente de código com um prompt de sistema de 12K tokens, 100K chamadas/mês: a entrada sem cache são ~1,2B de tokens. A 3 $/1M dá 3.600 $. Com leituras de cache a 0,30 $/1M o mesmo prefixo custa ~360 $ — uma economia de 3.240 $.