Quanto custa de verdade rodar um LLM?
O detalhamento completo: como funciona o preço por token, por que o mesmo modelo custa valores diferentes para um chatbot, um app RAG e um agente, e quando uma GPU alugada supera a API.
Não existe um único "preço de um LLM". Existe um preço por token de entrada, outro diferente por token de saída, um preço com desconto para a entrada em cache, uma via batch pela metade do preço e — se você alugar a GPU você mesmo — um preço por hora que não tem nada a ver com tokens. A sua conta é a combinação sobre a qual a sua carga de trabalho cai.
Este guia percorre cada camada, com a aritmética, para que você possa prever uma conta antes de gerá-la.
1. A unidade: dólares por milhão de tokens
Um token é cerca de ¾ de uma palavra. Os provedores anunciam dois números por modelo, p. ex. 0,50 $ / 1,50 $ por 1M — cinquenta centavos por milhão de tokens que você envia, um dólar e cinquenta por milhão que ele gera. O seu custo mensal da chamada ao LLM é:
mensal = requisições/mês × [ (tok_ent/1M × preço_ent) + (tok_sai/1M × preço_sai) ]
A saída quase sempre custa 2-5× o preço da entrada, porque gerar um token exige uma passada para frente completa do modelo enquanto ler um é barato. Essa assimetria é toda a razão pela qual um preço "misto" engana — mais sobre isso abaixo.
O Obolith normaliza cada modelo para essa unidade e adiciona um número misto 3:1 para que você possa ordenar ~200 modelos numa coluna, mas a calculadora usa a sua proporção real.
Comparar preços por milhão de tokens →2. O mesmo modelo, três contas diferentes
Um chatbot, um app rag e um agente enviam formas de requisição muito diferentes. Aqui está o que custa uma requisição no mesmo modelo de gama média, e o que domina:
- Chatbot - prompt curto, resposta curta. A saída é a metade maior. Alavanca: um modelo mais barato, ou limitar
max_tokens. - RAG - alguns milhares de tokens de contexto recuperado por chamada, uma resposta curta. A entrada é 80-95% do custo. Alavanca: cache do prompt sobre o que se repete.
- Agente - cada passo reenvia toda a conversa mais os resultados das ferramentas, e gera raciocínio. Os dois eixos disparam. Alavanca: cache, um modelo menor para os passos de roteamento, e menos passos.
É por isso que o preço de etiqueta mais baixo raramente ganha para você. Modele os seus números reais — a calculadora de custo mensal de API aplica o seu tráfego a todos os modelos de uma vez.
Abrir a calculadora de custo de API →3. Dois descontos que a maioria dos times perde
Entrada em cache. Quando muitas requisições começam pelo mesmo bloco — prompt de sistema, guia de estilo, documento recuperado — o provedor pode reutilizar o cálculo. Você paga uma pequena taxa de escrita e depois ~10-25% da tarifa de entrada em cada chamada posterior que acerta o prefixo. Para o RAG e os agentes é a maior alavanca; ver cached input pricing.
A API batch. Você envia um arquivo de requisições, recebe os resultados em 24 h e paga cerca da metade. Tudo o que não estiver diante de um usuário em tempo real — resumos noturnos, classificação em massa, embeddings de um corpus, avaliações — vai para lá. Ver API batch.
RAG a preço de etiqueta ......... 100 $ / mês
+ cache dos docs recuperados .. −55 $
+ batch da reindexação ....... −8 $
efetivo ...................... 37 $ / mês
4. Onde encaixa o resto do stack
A chamada ao LLM costuma ser a maior linha, mas um stack RAG em produção toca outras quatro camadas pagas. Para uma carga de referência elas se distribuem mais ou menos assim:
A linha do banco vetorial é a que surpreende: os planos serverless cobram armazenamento + consultas, os dedicados cobram tempo de cômputo, e o cruzamento fica em alguns milhões de vetores. O custo dos embeddings é um pagamento único para o índice inicial mais um fio d'água por consulta. O armazenamento de objetos dos documentos brutos são centavos, a menos que você reindexe constantemente (egress é o fator que faz variar). Ferramentas de rastreamento como Langfuse e Helicone têm planos gratuitos que cobrem você até o volume de verdade.
Precifique todo o seu stack para a sua carga →5. Quando uma GPU alugada supera a API
Uma API cobra tokens. Um modelo auto-hospedado cobra cada hora em que a máquina está ligada, ocupada ou não. O self-host é, portanto, uma aposta na taxa de utilização — a fração do tempo em que a sua GPU faz trabalho útil.
Leia da esquerda para a direita. Volume pequeno: a API é bem mais barata — você não paga por silício parado. Quando o volume cresce, a conta da API sobe em linha reta enquanto a da GPU fica plana até você precisar de uma segunda placa. Passado o cruzamento, a GPU ganha, e continua ganhando.
Duas coisas movem o ponto de equilíbrio. A abertura do modelo: só modelos de pesos abertos (Llama, Qwen, DeepSeek, Mistral, gpt-oss…) podem ser auto-hospedados — um modelo fechado de fronteira não tem opção de GPU. A forma do tráfego: uma carga constante em horário comercial atinge ~55% de utilização; um serviço em rajadas ou quase sempre ocioso atinge 10-30%, o que empurra o equilíbrio para longe. A ferramenta Stack cost pergunta o seu perfil de tráfego e faz esse cálculo por modelo.
Encontre o seu ponto de equilíbrio de self-host →Se a conta diz que o self-host ganha, a próxima pergunta é o que comprar de fato. O configurador de infraestrutura de IA transforma um número de GPUs numa lista de peças real: preço, consumo e quais modelos consegue rodar.
Configurar uma estação ou um servidor →6. Um checklist
- Anuncie cada modelo em
$ / 1M ente$ / 1M saiseparadamente, nunca um número só. - Multiplique pelas suas contagens de tokens e o seu volume — use a calculadora.
- Ative o cache do prompt antes de comparar provedores. É a maior alavanca isolada para o RAG e os agentes.
- Mova para a API batch tudo o que pode esperar.
- Adicione as camadas fora do LLM (banco vetorial, armazenamento, rastreamento) — normalmente 15-25% a mais.
- Só considere o self-host se o modelo for de pesos abertos e você conseguir manter a GPU ocupada. Abaixo de alguns milhões de requisições por mês, a API quase sempre ganha.
O stack viável mais barato raramente é o de menor preço de etiqueta. É o que se encaixa na forma da sua carga de trabalho.Monte o seu stack viável mais barato →
Os números são ilustrativos. Confirme os preços atuais no próprio site do provedor antes de decidir.