Motor de custo

Quanto custa o seu stack de IA?

Escolha o que você está construindo, defina a sua escala — obtenha o stack viável mais barato, camada por camada, precificado no melhor provedor para a sua carga de trabalho.

A sua escala
Perfil de tráfegodefine a utilização de GPU assumida para o self-host
Recomendado
stack viável mais barato para a sua carga de trabalho
≈ $6.70 /mo
  • ·0.12 $/mês abaixo da próxima combinação viável
  • ·não é preciso GPU dedicada (o self-host se paga acima de ~2.8M req./mês)
  • ·todos os modelos mostrados cabem no seu contexto de 5K tokens por requisição
troque qualquer camada abaixo ↓
Monte o seu stack
  • API de LLM$6.50
    ou self-host: 1× A40 a ~55% de uso de GPU $358/mo· se paga acima de ~2.8M requisições/mês
  • Embeddings$0.08
    comparar tudo ↗· índice inicial amortizado em 12 meses + embeddings de consulta
  • Banco vetorial$0.12
    comparar tudo ↗· 1 vetor por trecho de ~512 tokens · 1 consulta por requisição· média
  • Armaz. de objetos$<0.01
  • Observabilidade$0
    comparar tudo ↗· assume-se plano gratuito
Total, a sua carga de trabalho Confiança: média≈ $6.70 /mo
Premissas usadas

· · · · · · preços atualizados 2026-09-15

Para onde vai a conta
API de LLM · tokens de entrada60%
API de LLM · tokens de saída37%
Banco vetorial2%
Embeddings1%
Como reduzir
  • ·reduza a saída para ~300 tokens/requisição-$1.19/mo(18%)
  • ·suba o acerto de cache para 80%-$1.09/mo(16%)

Preços ao vivo, atualizados 2026-09-15. Um modelo, não um orçamento — cada camada é precificada no provedor mais barato; os embeddings amortizam o índice inicial em 12 meses. Confirme no site de cada provedor.

Conceitos nesta página