Moteur de coût
Combien coûte ta stack IA ?
Choisis ce que tu construis, règle ton échelle - obtiens la stack viable la moins chère, couche par couche, chiffrée chez le meilleur fournisseur pour ta charge.
Ton échelle
Profil de traficfixe le taux d'utilisation GPU supposé pour le self-host
Recommandé
la stack viable la moins chère pour ta charge
≈ $6.70 /mo
- ·0.12 $/mois de moins que la combinaison viable suivante
- ·pas de GPU dédié nécessaire (rentable au-delà de ~2.8M req/mois)
- ·tous les modèles affichés tiennent dans tes 5K tokens de contexte par requête
change une couche ci-dessous ↓
Compose ta stack
- API LLM$6.50◈ ou self-héberger : 1× A40 à ~55% d'utilisation GPU $358/mo· rentable au-delà de ~2.8M requêtes/mois↗
- Embeddings$0.08tout comparer ↗· index initial amorti sur 12 mois + embeddings de requête
- Base vectorielle$0.12
- Stockage objet$<0.01tout comparer ↗· moyenne
- Observabilité$0tout comparer ↗· palier gratuit supposé
Total, ta charge Fiabilité: moyenne≈ $6.70 /mo
Hypothèses utilisées
· · · · · · prix actualisés le 2026-09-15
D'où vient la facture
API LLM · tokens d'entrée60%
API LLM · tokens de sortie37%
Base vectorielle2%
Embeddings1%
Comment la réduire
- ·réduire la sortie à ~300 tokens/requête-$1.19/mo(18%)
- ·monter le cache hit à 80%-$1.09/mo(16%)
Prix live, mis à jour le 2026-09-15. Un modèle, pas un devis - chaque couche est chiffrée chez son fournisseur le moins cher ; les embeddings amortissent l'index initial sur 12 mois. Vérifie sur le site de chaque fournisseur.