← ¿Cuánto cuesta tu stack de IA?

¿Cuánto cuesta ejecutar una app RAG?

Una app con recuperación aumentada toca cuatro capas de pago. Esta es la combinación viable más barata para una carga de referencia, con una nota sobre cada una.

50,000 peticiones / mes · 4000/500 ent./sal. · 20,000 docs · 600 tok/doc · 55% cached
API de LLM
gpt-oss-20bvia Darkbloom
$6.50 /mo

La llamada de generación. Domina la entrada (contexto recuperado), así que el precio de entrada en caché y un modelo barato pero capaz son lo que más importa.

siguiente: Qwen3.7 Flash $6.61comparar todo ↗

o self-host: 1× A40 a ~55% de uso de GPU $358/mo· se amortiza por encima de ~2.8M peticiones/mes

Embeddings
text-embedding-3-smallvia OpenAI
$0.08 /mo

Un vector por fragmento al indexar, más un pequeño embedding por consulta. El índice inicial es un pago único; el costo continuo es mínimo.

siguiente: voyage-3.5-lite $0.08comparar todo ↗
Base vectorial
Zilliz Cloud (Serverless)via Zilliz
$0.12 /mo

Almacena y busca los vectores. Serverless factura almacenamiento + consultas; dedicado factura tiempo de cómputo: el cruce está en torno a unos pocos millones de vectores.

siguiente: turbopuffer $0.12comparar todo ↗
Almac. de objetos
B2via Backblaze
$<0.01 /mo

Los documentos en bruto van en almacenamiento de objetos. Barato; el factor que oscila es la salida si reindexas a menudo.

siguiente: Object Storage $<0.01comparar todo ↗
Observabilidad
Arize Phoenix
$0 /mo

Trazado y eval. Langfuse y Helicone tienen planes gratuitos generosos: 0 $ hasta que hay volumen real.

siguiente: Helicone $0comparar todo ↗
Total, tu carga de trabajo≈ $6.70 /mo
Ajústalo a tus cifras ↗

Precios en vivo, actualizados 2026-09-15. Un modelo, no un presupuesto: cada capa se valora en su proveedor más barato; los embeddings amortizan el índice inicial en 12 meses. Confirma en el sitio de cada proveedor.

Conceptos en esta página