Motor de custo
Quanto custa o seu stack de IA?
Escolha o que você está construindo, defina a sua escala — obtenha o stack viável mais barato, camada por camada, precificado no melhor provedor para a sua carga de trabalho.
A sua escala
Perfil de tráfegodefine a utilização de GPU assumida para o self-host
Recomendado
stack viável mais barato para a sua carga de trabalho
≈ $6.70 /mo
- ·0.12 $/mês abaixo da próxima combinação viável
- ·não é preciso GPU dedicada (o self-host se paga acima de ~2.8M req./mês)
- ·todos os modelos mostrados cabem no seu contexto de 5K tokens por requisição
troque qualquer camada abaixo ↓
Monte o seu stack
- API de LLM$6.50
- Embeddings$0.08comparar tudo ↗· índice inicial amortizado em 12 meses + embeddings de consulta
- Banco vetorial$0.12
- Armaz. de objetos$<0.01comparar tudo ↗· média
- Observabilidade$0comparar tudo ↗· assume-se plano gratuito
Total, a sua carga de trabalho Confiança: média≈ $6.70 /mo
Premissas usadas
· · · · · · preços atualizados 2026-09-15
Para onde vai a conta
API de LLM · tokens de entrada60%
API de LLM · tokens de saída37%
Banco vetorial2%
Embeddings1%
Como reduzir
- ·reduza a saída para ~300 tokens/requisição-$1.19/mo(18%)
- ·suba o acerto de cache para 80%-$1.09/mo(16%)
Preços ao vivo, atualizados 2026-09-15. Um modelo, não um orçamento — cada camada é precificada no provedor mais barato; os embeddings amortizam o índice inicial em 12 meses. Confirme no site de cada provedor.