<- Todos os termos

API de batch

Um modo assíncrono oferecido pela maioria dos provedores de LLM: você envia um arquivo de requisições, recebe os resultados dentro de um prazo (normalmente 24 h) e paga cerca de 50% do preço por token normal.

O que é

Em vez de uma requisição por vez via HTTP, você sobe um arquivo JSONL com milhares de requisições. O provedor as executa quando tem capacidade livre e devolve um arquivo de resultados. Em troca de abrir mão da baixa latência, você ganha um desconto de ~50% e limites de taxa bem mais altos.

Por que importa

Qualquer carga que não esteja diante de um usuário em tempo real (resumo noturno, classificação em massa, embeddings de um corpus, geração de datasets, evals) provavelmente deveria ir pela API de batch. É a opção por token mais barata que um provedor oferece, e a tabela de preços do Obolith sinaliza quando está disponível.

Conceitos relacionados

Use no Obolith

Última revisão: 2026-09-04 · conceito atemporal