API batch
Un modo asíncrono que ofrecen la mayoría de los proveedores de LLM: envías un archivo de peticiones, obtienes los resultados dentro de un plazo (normalmente 24 h) y pagas aproximadamente el 50% del precio por token normal.
Qué es
En lugar de una petición a la vez por HTTP, subes un archivo JSONL con miles de peticiones. El proveedor las ejecuta cuando tiene capacidad libre y devuelve un archivo de resultados. A cambio de renunciar a la baja latencia obtienes un descuento de ~50% y límites de tasa mucho más altos.
Por qué importa
Cualquier carga que no esté de cara al usuario en tiempo real (resumen nocturno, clasificación masiva, hacer embeddings de un corpus, generación de datasets, evals) probablemente debería ir por la API batch. Es la opción por token más barata que ofrece un proveedor, y la tabla de precios de Obolith lo señala cuando está disponible.