A API Batch: metade do preço para tudo o que pode esperar
Todos os grandes provedores de LLM têm uma via batch assíncrona a cerca de 50% do preço por token normal. Se um processo não precisa de resposta em segundos, é lá que ele vai.
Existe em quase toda API de LLM uma via que custa a metade e que a maioria dos times nunca usa: a API batch. Você abre mão da baixa latência; ganha um desconto de ~50% e limites de taxa bem mais altos.
Como funciona
Em vez de uma requisição por vez via HTTP, você envia um arquivo — uma linha JSON por requisição, aos milhares. O provedor executa o arquivo quando tem capacidade livre e devolve um arquivo de resultados, com um prazo de conclusão normalmente de 24 horas (muitas vezes bem mais rápido na prática).
Mesmos modelos, mesmos parâmetros, mesma qualidade de saída. A única diferença: você não pode fazer streaming da resposta e não controla exatamente quando ela roda.
O que vai para lá
- Resumo, marcação ou extração noturnos ou agendados
- Classificação ou moderação em massa de um backlog
- Embeddings de um corpus inteiro para um novo índice rag
- Geração de um dataset sintético para fine tuning
- Rodar uma suíte de avaliações sobre centenas ou milhares de prompts
- Qualquer back-fill ou reprocessamento único
Em resumo: se nenhum humano está esperando a resposta agora, pode ser um job batch.
A economia
2M chamadas de classificação/mês, 600 ent + 20 sai tokens cada uma
API em tempo real ..... ~95 $ / mês
API batch (−50 %) ..... ~48 $ / mês
O desconto se acumula com todo o resto — um modelo menor, o cache do prompt, um prompt mais curto. O batch é a via por token mais barata de um provedor.
Disponibilidade
OpenAI, Anthropic, Google, Mistral e vários agregadores têm uma API batch; o desconto é de 50% nos três grandes. A tabela de preços do Obolith sinaliza o suporte a batch por modelo quando o provedor o publica.
Verifique o suporte a batch por modelo →Os números são ilustrativos. Confirme os preços atuais no próprio site do provedor antes de decidir.