<- Todos os termos

RAG (geração aumentada por recuperação)

Responder com um LLM recuperando primeiro trechos relevantes dos seus próprios dados e colocando-os no prompt. Mais barato e mais atual do que enfiar tudo numa janela de contexto enorme.

O que é

Um pipeline RAG: dividir os documentos em trechos, fazer os embeddings deles, guardá-los num banco vetorial. Na hora da consulta: fazer o embedding da pergunta, recuperar os k trechos mais parecidos e colá-los no prompt do LLM como contexto.

Por que importa

O RAG mantém o prompt do LLM pequeno — alguns milhares de tokens de entrada em vez de um corpus inteiro — o que geralmente é muito mais barato que uma janela de contexto gigante, e permite atualizar o conhecimento sem retreinar.

Impacto em custo e infraestrutura

Um stack RAG tem quatro linhas de custo: chamadas à API do LLM, um modelo de embeddings, um banco vetorial e armazenamento de objetos para os documentos de origem. O LLM costuma ser a maior; o banco vetorial é o que surpreende.

Conceitos relacionados

Use no Obolith

Última revisão: 2026-09-01 · conceito atemporal