Seis palancas para reducir tu factura de API de LLM
Antes de cambiar de proveedor, acciona estas palancas: la mayoría de los equipos deja un 40-70% sobre la mesa.
Cambiar a un modelo más barato es el movimiento obvio, y a menudo el primer paso equivocado. Aquí van seis palancas, más o menos por orden de relación esfuerzo/beneficio.
1. Dimensionar bien el modelo
La mayoría del tráfico de producción no necesita un modelo de frontera. Enruta el 80% fácil a un modelo pequeño y reserva el caro para los casos difíciles. Un costo mixto de 0,60 $/1M en lugar de 6,00 $/1M es 10× menos, sin pérdida de calidad en el camino fácil.
2. Caché de prompt
Si tu prompt de sistema o tu contexto recuperado se repite entre peticiones, la caché de prompt reduce el precio de entrada de la parte cacheada entre un 75 y un 90%. Para cargas de RAG y de agentes donde el prompt empequeñece a la respuesta, es la mayor palanca.
3. Poner en batch el trabajo no urgente
Evals, back-fills, trabajos de clasificación, resúmenes nocturnos: cualquier cosa que no necesite respuesta en segundos va a la API batch, normalmente a mitad de precio.
4. Recortar el prompt
Ejemplos few-shot que ya no necesitas, instrucciones verbosas, documentos enteros donde bastaría un fragmento. Los tokens de entrada son más baratos que los de salida pero no son gratis, y los prompts largos además te frenan.
5. Limitar la salida
Los tokens de salida cuestan 3-5× los de entrada. Fija max_tokens, pide respuestas concisas, usa salida estructurada en lugar de prosa cuando puedas.
6. Y entonces, comparar proveedores
Una vez la carga está ligera, el mismo modelo suele estar disponible más barato a través de un agregador o de otro host. Eso es el último 10-30%, no el primero.
Ver el precio actual de cada modelo →Las cifras son ilustrativas. Confirma los precios actuales en el propio sitio del proveedor antes de decidir.