← Guías
modelo de costo · 11 min

¿Cuánto cuesta de verdad hacer funcionar un LLM?

El desglose completo: cómo funciona el precio por token, por qué el mismo modelo cuesta distinto para un chatbot, una app RAG y un agente, y cuándo una GPU alquilada supera a la API.

Obolith · Última actualización: 2026-09-08

No hay un único "precio de un LLM". Hay un precio por token de entrada, otro distinto por token de salida, un precio rebajado para la entrada en caché, una vía batch a mitad de precio y, si alquilas la GPU tú mismo, un precio por hora que no tiene nada que ver con los tokens. Tu factura es la combinación sobre la que cae tu carga de trabajo.

Esta guía recorre cada capa, con la aritmética, para que puedas prever una factura antes de generarla.

1. La unidad: dólares por millón de tokens

Un token es más o menos ¾ de palabra. Los proveedores dan dos números por modelo, p. ej. 0,50 $ / 1,50 $ por 1M: cincuenta céntimos por millón de tokens que envías, un dólar cincuenta por millón que genera. Tu costo mensual de la llamada al LLM es:

la fórmula

mensual = peticiones/mes × [ (tok_ent/1M × precio_ent) + (tok_sal/1M × precio_sal) ]

La salida casi siempre cuesta 2-5× el precio de la entrada, porque generar un token requiere una pasada hacia delante completa del modelo mientras que leer uno es barato. Esa asimetría es toda la razón de que un precio "mixto" despiste; más sobre eso abajo.

Obolith normaliza cada modelo a esta unidad y añade una cifra mixta 3:1 para que puedas ordenar ~200 modelos en una columna, pero la calculadora usa tu proporción real.

Comparar precios por millón de tokens →

2. El mismo modelo, tres facturas distintas

Un chatbot, una app rag y un agente envían formas de petición muy distintas. Esto es lo que cuesta una petición en el mismo modelo de gama media, y qué domina:

chatbot RAG agente $/pet. entrada entrada en caché salida
Costo por petición según el workload. Un chatbot está guiado por la salida y es barato; el RAG está guiado por la entrada porque el contexto recuperado empequeñece la respuesta; un agente es caro en los dos ejes porque cada paso reenvía un historial que crece.
  • Chatbot - prompt corto, respuesta corta. La salida es la mitad mayor. Palanca: un modelo más barato, o limitar max_tokens.
  • RAG - unos miles de tokens de contexto recuperado por llamada, una respuesta corta. La entrada es el 80-95% del costo. Palanca: caché de prompt sobre lo que se repite.
  • Agente - cada paso reenvía toda la conversación más los resultados de las herramientas, y genera razonamiento. Los dos ejes se disparan. Palanca: caché, un modelo más pequeño para los pasos de enrutado, y menos pasos.

Por eso el precio de etiqueta más bajo rara vez gana para ti. Modela tus números reales: la calculadora de costo mensual de API aplica tu tráfico a todos los modelos de una vez.

Abrir la calculadora de costo de API →

3. Dos descuentos que la mayoría de los equipos se pierde

Entrada en caché. Cuando muchas peticiones empiezan por el mismo bloque (prompt de sistema, guía de estilo, documento recuperado) el proveedor puede reutilizar el cómputo. Pagas una pequeña tarifa de escritura y luego ~10-25% de la tarifa de entrada en cada llamada posterior que acierta el prefijo. Para el RAG y los agentes es la mayor palanca; ver cached input pricing.

La API batch. Envías un archivo de peticiones, obtienes los resultados en 24 h y pagas aproximadamente la mitad. Todo lo que no esté delante de un usuario en tiempo real (resúmenes nocturnos, clasificación masiva, embeddings de un corpus, evals) va ahí. Ver API batch.

acumulado

RAG a precio de etiqueta ......... 100 $ / mes

+ caché de los docs recuperados . −55 $

+ batch del reíndice ............ −8 $

efectivo ........................ 37 $ / mes

4. Dónde encaja el resto del stack

La llamada al LLM suele ser la línea mayor, pero un stack RAG en producción toca otras cuatro capas de pago. Para una carga de referencia se reparten más o menos así:

LLM 74% llamada LLM 74% base vectorial 14% observabilidad 6% almac. objetos 4% embeddings 2%
Parte de una factura RAG mensual típica. La llamada al LLM domina; la base vectorial es la siguiente línea real; almacenamiento, trazado y embeddings son errores de redondeo hasta que eres grande.

La línea de base vectorial es la que sorprende: las ofertas serverless facturan almacenamiento + consultas, las dedicadas facturan tiempo de cómputo, y el cruce está en unos pocos millones de vectores. El costo de los embeddings es un pago único para el índice inicial más un hilo por consulta. El almacenamiento de objetos de los documentos en bruto son céntimos salvo que reindexes constantemente (egress es el factor que lo mueve). Herramientas de trazado como Langfuse y Helicone tienen planes gratuitos que te cubren hasta el volumen real.

Pon precio a todo tu stack para tu carga →

5. Cuándo una GPU alquilada supera a la API

Una API factura tokens. Un modelo autoalojado factura cada hora que la máquina está encendida, ocupada o no. El self-host es por tanto una apuesta sobre la tasa de utilización: la parte del tiempo en que tu GPU hace trabajo útil.

0 $ 1k $ 2k $ peticiones / mes → 0 5M umbral ≈ 2M / mes API (por token) GPU dedicada
Costo mensual según el volumen. La línea de la API es una rampa recta: pagas por token. Una GPU dedicada bien utilizada es casi plana: un costo fijo, ocupada o no. Se cruzan en el punto de equilibrio; por debajo la API es más barata, por encima lo es la GPU.

Léelo de izquierda a derecha. Volumen pequeño: la API es mucho más barata, no pagas silicio parado. Cuando el volumen crece, la factura de la API sube en línea recta mientras la de la GPU se mantiene plana hasta que hace falta una segunda tarjeta. Pasado el cruce, la GPU gana, y sigue ganando.

Dos cosas mueven el umbral. La apertura del modelo: solo los modelos de pesos abiertos (Llama, Qwen, DeepSeek, Mistral, gpt-oss…) pueden autoalojarse; un modelo cerrado de frontera no tiene opción de GPU. La forma del tráfico: una carga constante en horario laboral alcanza ~55% de utilización; un servicio a ráfagas o a menudo parado alcanza el 10-30%, lo que aleja mucho el umbral. La herramienta Stack cost te pregunta tu perfil de tráfico y hace este cálculo por modelo.

Halla tu punto de equilibrio de self-host →

Si el cálculo dice que el self-host gana, la siguiente pregunta es qué comprar de verdad. El configurador de infraestructura de IA convierte un número de GPU en una lista de piezas real: precio, consumo y qué modelos puede ejecutar.

Configurar una estación o un servidor →

6. Una checklist

  • Anuncia cada modelo en $ / 1M ent y $ / 1M sal por separado, nunca un solo número.
  • Multiplica por tus recuentos de tokens y tu volumen: usa la calculadora.
  • Activa la caché de prompt antes de comparar proveedores. Es la mayor palanca individual para el RAG y los agentes.
  • Pasa a la API batch todo lo que pueda esperar.
  • Añade las capas no-LLM (base vectorial, almacenamiento, trazado): normalmente un 15-25% más.
  • Plantéate el self-host solo si el modelo es de pesos abiertos y puedes mantener la GPU ocupada. Por debajo de unos pocos millones de peticiones al mes, la API casi siempre gana.
El stack viable más barato rara vez es el del precio de etiqueta más bajo. Es el que encaja con la forma de tu workload.
Compón tu stack viable más barato →

Las cifras son ilustrativas. Confirma los precios actuales en el propio sitio del proveedor antes de decidir.