← Guias
prática · 5 min

Seis alavancas para reduzir a sua conta de API de LLM

Antes de trocar de provedor, acione estas alavancas — a maioria dos times deixa 40 a 70% na mesa.

Obolith · Última atualização: 2026-09-01

Trocar por um modelo mais barato é o movimento óbvio, e muitas vezes o primeiro passo errado. Aqui vão seis alavancas, mais ou menos em ordem de relação esforço/retorno.

1. Dimensionar bem o modelo

A maior parte do tráfego de produção não precisa de um modelo de fronteira. Encaminhe os 80% fáceis para um modelo pequeno e reserve o caro para os casos difíceis. Um custo misto de 0,60 $/1M em vez de 6,00 $/1M é 10× menos, sem perda de qualidade no caminho fácil.

2. Cache de prompt

Se o seu prompt de sistema ou o seu contexto recuperado se repete entre requisições, o cache de prompt reduz o preço de entrada da parte em cache em 75 a 90%. Para cargas de RAG e de agentes, onde o prompt supera em muito a resposta, é a maior alavanca.

3. Pôr em batch o trabalho não urgente

Avaliações, back-fills, trabalhos de classificação, resumos noturnos — qualquer coisa que não precise de resposta em segundos vai para a API batch, normalmente pela metade do preço.

4. Enxugar o prompt

Exemplos few-shot de que você já não precisa, instruções prolixas, documentos inteiros onde um trecho bastaria. Os tokens de entrada são mais baratos que os de saída mas não são de graça, e prompts longos também deixam tudo mais lento.

5. Limitar a saída

Os tokens de saída custam 3-5× os de entrada. Defina max_tokens, peça respostas concisas, use saída estruturada em vez de prosa quando puder.

6. E então, comparar provedores

Uma vez que a carga está enxuta, o mesmo modelo costuma estar disponível mais barato via um agregador ou outro host. Isso é os últimos 10-30%, não os primeiros.

Ver o preço atual de cada modelo →

Os números são ilustrativos. Confirme os preços atuais no próprio site do provedor antes de decidir.