La API Batch: mitad de precio para todo lo que puede esperar
Todos los grandes proveedores de LLM tienen una vía batch asíncrona a en torno al 50% del precio por token normal. Si un proceso no necesita respuesta en segundos, va ahí.
En casi todas las API de LLM hay una vía que cuesta la mitad y que la mayoría de los equipos no usa nunca: la API batch. Renuncias a la baja latencia; obtienes un descuento de ~50% y límites de tasa mucho más altos.
Cómo funciona
En lugar de una petición a la vez por HTTP, envías un archivo: una línea JSON por petición, miles. El proveedor ejecuta el archivo cuando tiene capacidad libre y devuelve un archivo de resultados, con un plazo de finalización normalmente de 24 horas (a menudo mucho más rápido en la práctica).
Mismos modelos, mismos parámetros, misma calidad de salida. La única diferencia: no puedes hacer streaming de la respuesta y no controlas exactamente cuándo se ejecuta.
Qué va ahí
- Resumen, etiquetado o extracción nocturnos o programados
- Clasificación o moderación masiva de un backlog
- Embeddings de un corpus entero para un nuevo índice rag
- Generación de un dataset sintético para fine tuning
- Ejecutar una suite de evals sobre cientos o miles de prompts
- Cualquier back-fill o reprocesado único
En resumen: si ningún humano está esperando la respuesta ahora mismo, puede ser un trabajo batch.
La economía
2M llamadas de clasificación/mes, 600 ent + 20 sal tokens cada una
API en tiempo real ..... ~95 $ / mes
API batch (−50 %) ...... ~48 $ / mes
El descuento se acumula con todo lo demás: un modelo más pequeño, la caché de prompt, un prompt más corto. El batch es la vía por token más barata de un proveedor.
Disponibilidad
OpenAI, Anthropic, Google, Mistral y varios agregadores tienen una API batch; el descuento es del 50% en los tres grandes. La tabla de precios de Obolith señala el soporte de batch por modelo cuando el proveedor lo publica.
Comprueba el soporte de batch por modelo →Las cifras son ilustrativas. Confirma los precios actuales en el propio sitio del proveedor antes de decidir.