RAG (geração aumentada por recuperação)
Responder com um LLM recuperando primeiro trechos relevantes dos seus próprios dados e colocando-os no prompt. Mais barato e mais atual do que enfiar tudo numa janela de contexto enorme.
O que é
Um pipeline RAG: dividir os documentos em trechos, fazer os embeddings deles, guardá-los num banco vetorial. Na hora da consulta: fazer o embedding da pergunta, recuperar os k trechos mais parecidos e colá-los no prompt do LLM como contexto.
Por que importa
O RAG mantém o prompt do LLM pequeno — alguns milhares de tokens de entrada em vez de um corpus inteiro — o que geralmente é muito mais barato que uma janela de contexto gigante, e permite atualizar o conhecimento sem retreinar.
Impacto em custo e infraestrutura
Um stack RAG tem quatro linhas de custo: chamadas à API do LLM, um modelo de embeddings, um banco vetorial e armazenamento de objetos para os documentos de origem. O LLM costuma ser a maior; o banco vetorial é o que surpreende.