<- Todos los términos

RAG (generación aumentada por recuperación)

Responder con un LLM recuperando primero fragmentos relevantes de tus propios datos y metiéndolos en el prompt. Más barato y más actual que meterlo todo en una ventana de contexto enorme.

Qué es

Un pipeline RAG: dividir los documentos en fragmentos, hacer sus embeddings, guardarlos en una base vectorial. En el momento de la consulta: hacer el embedding de la pregunta, recuperar los k fragmentos más parecidos y pegarlos en el prompt del LLM como contexto.

Por qué importa

El RAG mantiene pequeño el prompt del LLM (unos pocos miles de tokens de entrada en lugar de todo un corpus), lo que suele ser mucho más barato que una ventana de contexto gigante, y permite actualizar el conocimiento sin reentrenar.

Impacto en costo e infraestructura

Un stack RAG tiene cuatro líneas de costo: llamadas a la API del LLM, un modelo de embeddings, una base vectorial y almacenamiento de objetos para los documentos fuente. El LLM suele ser la mayor; la base vectorial es la que sorprende.

Conceptos relacionados

Úsalo en Obolith

Última revisión: 2026-09-01 · concepto atemporal