Moteur de coût

Combien coûte ta stack IA ?

Choisis ce que tu construis, règle ton échelle - obtiens la stack viable la moins chère, couche par couche, chiffrée chez le meilleur fournisseur pour ta charge.

Ton échelle
Profil de traficfixe le taux d'utilisation GPU supposé pour le self-host
Recommandé
la stack viable la moins chère pour ta charge
≈ $6.70 /mo
  • ·0.12 $/mois de moins que la combinaison viable suivante
  • ·pas de GPU dédié nécessaire (rentable au-delà de ~2.8M req/mois)
  • ·tous les modèles affichés tiennent dans tes 5K tokens de contexte par requête
change une couche ci-dessous ↓
Compose ta stack
  • API LLM$6.50
    ou self-héberger : 1× A40 à ~55% d'utilisation GPU $358/mo· rentable au-delà de ~2.8M requêtes/mois
  • Embeddings$0.08
    tout comparer ↗· index initial amorti sur 12 mois + embeddings de requête
  • Base vectorielle$0.12
    tout comparer ↗· 1 vecteur par chunk de ~512 tokens · 1 requête par appel· moyenne
  • Stockage objet$<0.01
  • Observabilité$0
    tout comparer ↗· palier gratuit supposé
Total, ta charge Fiabilité: moyenne≈ $6.70 /mo
Hypothèses utilisées

· · · · · · prix actualisés le 2026-09-15

D'où vient la facture
API LLM · tokens d'entrée60%
API LLM · tokens de sortie37%
Base vectorielle2%
Embeddings1%
Comment la réduire
  • ·réduire la sortie à ~300 tokens/requête-$1.19/mo(18%)
  • ·monter le cache hit à 80%-$1.09/mo(16%)

Prix live, mis à jour le 2026-09-15. Un modèle, pas un devis - chaque couche est chiffrée chez son fournisseur le moins cher ; les embeddings amortissent l'index initial sur 12 mois. Vérifie sur le site de chaque fournisseur.

Concepts de cette page