API Batch
Un mode asynchrone proposé par la plupart des fournisseurs de LLM : tu soumets un fichier de requêtes, tu récupères les résultats dans un délai (souvent 24 h), et tu paies environ 50 % du tarif au token normal.
Ce que c'est
Au lieu d'une requête à la fois en HTTP, tu envoies un fichier JSONL de milliers de requêtes. Le fournisseur les exécute quand il a de la capacité libre et renvoie un fichier de résultats. En échange d'abandonner la basse latence, tu obtiens une remise de ~50 % et des limites de débit bien plus hautes.
Pourquoi c'est important
Tout traitement qui n'est pas en face d'un utilisateur en temps réel - résumé nocturne, classification en masse, embedding d'un corpus, génération de dataset, évals - devrait sans doute passer par l'API batch. C'est l'option au token la moins chère d'un fournisseur, et le tableau de prix d'Obolith le signale quand c'est disponible.