← Guías
práctica · 5 min

Seis palancas para reducir tu factura de API de LLM

Antes de cambiar de proveedor, acciona estas palancas: la mayoría de los equipos deja un 40-70% sobre la mesa.

Obolith · Última actualización: 2026-09-01

Cambiar a un modelo más barato es el movimiento obvio, y a menudo el primer paso equivocado. Aquí van seis palancas, más o menos por orden de relación esfuerzo/beneficio.

1. Dimensionar bien el modelo

La mayoría del tráfico de producción no necesita un modelo de frontera. Enruta el 80% fácil a un modelo pequeño y reserva el caro para los casos difíciles. Un costo mixto de 0,60 $/1M en lugar de 6,00 $/1M es 10× menos, sin pérdida de calidad en el camino fácil.

2. Caché de prompt

Si tu prompt de sistema o tu contexto recuperado se repite entre peticiones, la caché de prompt reduce el precio de entrada de la parte cacheada entre un 75 y un 90%. Para cargas de RAG y de agentes donde el prompt empequeñece a la respuesta, es la mayor palanca.

3. Poner en batch el trabajo no urgente

Evals, back-fills, trabajos de clasificación, resúmenes nocturnos: cualquier cosa que no necesite respuesta en segundos va a la API batch, normalmente a mitad de precio.

4. Recortar el prompt

Ejemplos few-shot que ya no necesitas, instrucciones verbosas, documentos enteros donde bastaría un fragmento. Los tokens de entrada son más baratos que los de salida pero no son gratis, y los prompts largos además te frenan.

5. Limitar la salida

Los tokens de salida cuestan 3-5× los de entrada. Fija max_tokens, pide respuestas concisas, usa salida estructurada en lugar de prosa cuando puedas.

6. Y entonces, comparar proveedores

Una vez la carga está ligera, el mismo modelo suele estar disponible más barato a través de un agregador o de otro host. Eso es el último 10-30%, no el primero.

Ver el precio actual de cada modelo →

Las cifras son ilustrativas. Confirma los precios actuales en el propio sitio del proveedor antes de decidir.