← Guías
how-to · 4 min

Caché de prompt: la primera palanca de una factura RAG

Si tus peticiones comparten un bloque de apertura largo (prompt de sistema, documento, esquema de herramienta) pagas precio completo por recalcularlo en cada llamada. Cuánto ahorra y cómo activarlo.

Obolith · Última actualización: 2026-09-10

La mayoría de los equipos busca primero un modelo más barato. Para el rag y los agentes es el primer reflejo equivocado. La ganancia mayor y más fácil es la caché de prompt: dejar de pagar por recalcular la parte del prompt que nunca cambia.

Por qué funciona

Cuando petición tras petición empieza por el mismo bloque (prompt de sistema, guía de estilo, documento recuperado, definiciones de herramientas) el modelo hace exactamente el mismo trabajo sobre él cada vez. Si el proveedor guarda el estado ya calculado de ese prefijo, una petición posterior que coincida salta directa a la parte nueva.

Pagas una pequeña "escritura de caché" única y luego una tarifa de lectura de caché de en torno al 10-25% del precio de entrada normal en cada llamada que acierta el prefijo, dentro de una ventana corta (a menudo de 5 minutos a una hora).

Cuánto ahorra

Para una llamada RAG típica, el prefijo repetido (prompt de sistema más contexto recuperado) es el 80-95% de los tokens de entrada. La respuesta en sí es pequeña. Poner ese prefijo en caché lleva por tanto casi todo el costo de entrada cerca de cero.

ejemplo con números

4.000 tokens de entrada/llamada, de los cuales 3.600 de prefijo estable

sin caché: 4.000 × 0,50 $/1M ......... 0,0020 $ / llamada

con caché: 400 × 0,50 + 3.600 × 0,075 0,0005 $ / llamada

-> la línea de entrada baja ~75 %

Para los agentes es aún más fuerte: el historial de conversación que crece se reenvía en cada paso y la mayor parte no ha cambiado desde el anterior.

Cómo activarlo

  • Anthropic - añade puntos cache_control en la petición; hasta 4 segmentos en caché.
  • OpenAI - automático para prompts de más de 1.024 tokens, sin cambios de código; el descuento se aplica al prefijo coincidente.
  • Google (Gemini) - context caching explícito vía API, o implícito en los modelos recientes.
  • Servidores de código abierto (vLLM, TGI, SGLang) - el prefix caching está activado por defecto en self-host.

La única regla: pon el contenido estable primero (prompt de sistema, documentos, esquemas de herramientas) y el contenido variable al final (el turno del usuario). Una caché solo coincide desde el principio del prompt: un token que cambia arriba invalida todo lo que sigue.

Cuándo no ayuda

Prompts cortos (un chatbot simple con un prompt de sistema de una línea), o cargas donde cada petición es realmente única sin prefijo compartido. Y un modelo sin tarifa de caché en absoluto: la tabla de precios de Obolith muestra la tarifa de lectura de caché cuando el proveedor ofrece una.

Ver qué modelos tienen tarifa de entrada en caché →Calcula el ahorro para tu carga →

Las cifras son ilustrativas. Confirma los precios actuales en el propio sitio del proveedor antes de decidir.