RAG (generación aumentada por recuperación)
Responder con un LLM recuperando primero fragmentos relevantes de tus propios datos y metiéndolos en el prompt. Más barato y más actual que meterlo todo en una ventana de contexto enorme.
Qué es
Un pipeline RAG: dividir los documentos en fragmentos, hacer sus embeddings, guardarlos en una base vectorial. En el momento de la consulta: hacer el embedding de la pregunta, recuperar los k fragmentos más parecidos y pegarlos en el prompt del LLM como contexto.
Por qué importa
El RAG mantiene pequeño el prompt del LLM (unos pocos miles de tokens de entrada en lugar de todo un corpus), lo que suele ser mucho más barato que una ventana de contexto gigante, y permite actualizar el conocimiento sin reentrenar.
Impacto en costo e infraestructura
Un stack RAG tiene cuatro líneas de costo: llamadas a la API del LLM, un modelo de embeddings, una base vectorial y almacenamiento de objetos para los documentos fuente. El LLM suele ser la mayor; la base vectorial es la que sorprende.