← Quanto custa o seu stack de IA?

Quanto custa rodar uma app RAG?

Uma app com recuperação aumentada toca quatro camadas pagas. Esta é a combinação viável mais barata para uma carga de referência, com uma nota sobre cada uma.

50,000 requisições / mês · 4000/500 ent./saí. · 20,000 docs · 600 tok/doc · 55% cached
API de LLM
gpt-oss-20bvia Darkbloom
$6.50 /mo

A chamada de geração. Domina a entrada (contexto recuperado), então o preço de entrada em cache e um modelo barato mas capaz são o que mais importa.

próximo: Qwen3.7 Flash $6.61comparar tudo ↗

ou self-host: 1× A40 a ~55% de uso de GPU $358/mo· se paga acima de ~2.8M requisições/mês

Embeddings
text-embedding-3-smallvia OpenAI
$0.08 /mo

Um vetor por trecho ao indexar, mais um pequeno embedding por consulta. O índice inicial é pagamento único; o custo contínuo é mínimo.

próximo: voyage-3.5-lite $0.08comparar tudo ↗
Banco vetorial
Zilliz Cloud (Serverless)via Zilliz
$0.12 /mo

Armazena e busca os vetores. Serverless fatura armazenamento + consultas; dedicado fatura tempo de computação — o cruzamento está em alguns milhões de vetores.

próximo: turbopuffer $0.12comparar tudo ↗
Armaz. de objetos
B2via Backblaze
$<0.01 /mo

Os documentos em bruto ficam no armazenamento de objetos. Barato; o fator que varia é a saída se você reindexa com frequência.

próximo: Object Storage $<0.01comparar tudo ↗
Observabilidade
Arize Phoenix
$0 /mo

Rastreamento e eval. Langfuse e Helicone têm planos gratuitos generosos — 0 $ até haver volume real.

próximo: Helicone $0comparar tudo ↗
Total, a sua carga de trabalho≈ $6.70 /mo
Ajuste para os seus números ↗

Preços ao vivo, atualizados 2026-09-15. Um modelo, não um orçamento — cada camada é precificada no provedor mais barato; os embeddings amortizam o índice inicial em 12 meses. Confirme no site de cada provedor.

Conceitos nesta página