← Combien coûte ta stack IA ?

Combien coûte une app RAG ?

Une app à récupération touche quatre couches payantes. Voici la combinaison viable la moins chère pour une charge de référence, avec une note sur chacune.

50,000 requêtes / mois · 4000/500 entrée/sortie · 20,000 docs · 600 tok/doc · 55% cached
API LLM
gpt-oss-20bvia Darkbloom
$6.50 /mo

L'appel de génération. L'entrée domine (contexte récupéré) : le tarif d'entrée en cache et un modèle pas cher mais capable comptent le plus.

ensuite: Qwen3.7 Flash $6.61tout comparer ↗

ou self-héberger : 1× A40 à ~55% d'utilisation GPU $358/mo· rentable au-delà de ~2.8M requêtes/mois

Embeddings
text-embedding-3-smallvia OpenAI
$0.08 /mo

Un vecteur par chunk à l'indexation, plus un petit embedding par requête. L'index initial est ponctuel ; le coût courant est minime.

ensuite: voyage-3.5-lite $0.08tout comparer ↗
Base vectorielle
Zilliz Cloud (Serverless)via Zilliz
$0.12 /mo

Stocke et cherche les vecteurs. Le serverless facture stockage + requêtes ; le dédié facture le temps de calcul - le croisement est vers quelques millions de vecteurs.

ensuite: turbopuffer $0.12tout comparer ↗
Stockage objet
B2via Backblaze
$<0.01 /mo

Les documents bruts dans du stockage objet. Pas cher ; le facteur qui bouge, c'est l'egress si tu ré-indexes souvent.

ensuite: Object Storage $<0.01tout comparer ↗
Observabilité
Arize Phoenix
$0 /mo

Tracing et éval. Langfuse et Helicone ont de larges paliers gratuits - 0 $ jusqu'au vrai volume.

ensuite: Helicone $0tout comparer ↗
Total, ta charge≈ $6.70 /mo
Ajuste avec tes chiffres ↗

Prix live, mis à jour le 2026-09-15. Un modèle, pas un devis - chaque couche est chiffrée chez son fournisseur le moins cher ; les embeddings amortissent l'index initial sur 12 mois. Vérifie sur le site de chaque fournisseur.

Concepts de cette page