<- Todos los términos

Caché de prompt

Reutilizar el estado ya calculado de un prefijo de prompt repetido en lugar de recalcularlo en cada llamada. En las API se traduce en una tarifa reducida de «lectura de caché»; en self-host es una función del servidor (prefix caching).

Qué es

Cuando muchas peticiones empiezan por el mismo bloque largo (un prompt de sistema, una guía de estilo, un documento recuperado, un esquema de herramienta) el modelo hace el mismo trabajo sobre ese bloque cada vez. La caché de prompt guarda el kv cache de ese prefijo (en memoria de GPU, brevemente) para que una petición posterior que coincida salte directa a la parte nueva.

En las API la activas (o es automática) y pagas el precio de entrada en caché: una pequeña tarifa de escritura y luego ~10-25% de la tarifa de entrada en los aciertos de caché. Los servidores de self-host hacen prefix caching solos.

Por qué importa

Para rag, agentes y chatbots con prompt de sistema largo, el prefijo repetido suele ser el 80-95% de los tokens de entrada. Ponerlo en caché puede reducir a la mitad o más la línea de LLM de tu factura: suele ser la primera palanca que activar. También baja el ttft.

Conceptos relacionados

Úsalo en Obolith

Preguntas frecuentes

¿La caché de prompt es lo mismo que el KV cache?

La caché de prompt es una forma de reutilizar el KV cache entre peticiones. El KV cache en sí existe dentro de una única generación.

Última revisión: 2026-09-04 · concepto atemporal