<- Todos los términos

API batch

Un modo asíncrono que ofrecen la mayoría de los proveedores de LLM: envías un archivo de peticiones, obtienes los resultados dentro de un plazo (normalmente 24 h) y pagas aproximadamente el 50% del precio por token normal.

Qué es

En lugar de una petición a la vez por HTTP, subes un archivo JSONL con miles de peticiones. El proveedor las ejecuta cuando tiene capacidad libre y devuelve un archivo de resultados. A cambio de renunciar a la baja latencia obtienes un descuento de ~50% y límites de tasa mucho más altos.

Por qué importa

Cualquier carga que no esté de cara al usuario en tiempo real (resumen nocturno, clasificación masiva, hacer embeddings de un corpus, generación de datasets, evals) probablemente debería ir por la API batch. Es la opción por token más barata que ofrece un proveedor, y la tabla de precios de Obolith lo señala cuando está disponible.

Conceptos relacionados

Úsalo en Obolith

Última revisión: 2026-09-04 · concepto atemporal