¿Sale más barato hacer self-host o usar una API?
Alquilar una GPU parece barato al lado de una factura por token, hasta que cuentas las horas paradas. La aritmética que lo decide.
Alquilar una H100 por hora parece barato al lado de una factura de API por token, hasta que tienes en cuenta las horas que esa GPU está parada. Esta es la aritmética que lo decide.
Una API solo te cobra por los tokens que envías y recibes de verdad. Un modelo autoalojado te cobra cada segundo que la máquina está encendida, esté sirviendo una petición o esperando una. Así que la pregunta es en realidad sobre la utilización: qué parte del tiempo tu GPU hace trabajo útil.
El punto de equilibrio, en una línea
Toma el precio por hora de la GPU, divídelo entre los tokens por hora que produce a tu tamaño de batch, y compáralo con el precio por token de la API.
self-host $/tok = (GPU $/h) ÷ (tokens/h × utilización)
más barato el self-host cuando self-host $/tok < API $/tok
Con números reales. Una H100 a 2,50 $/h sirviendo un modelo de 70B a 2,0M de tokens de salida por hora, funcionando al 40% de utilización:
| Costo de GPU por hora | 2,50 $ |
| Tokens útiles por hora (40%) | 800.000 |
| Self-host, por 1M de tokens | 3,13 $ |
| Un 70B alojado rápido, por 1M de salida | 0,79 $ |
Al 40% de utilización la API gana por mucho. El self-host solo se pone por delante cuando mantienes la GPU ocupada la mayor parte del tiempo (en torno al 70%+ para este modelo y precio), o cuando la residencia de los datos, la latencia o unos pesos con fine-tuning hacen que la API no sea una opción.
El tiempo de GPU parada es toda la historia del costo. Lo demás es un error de redondeo.
Dos costos más que la fórmula deja fuera, ambos a favor de la API: el tiempo de ingeniería para ejecutar la inferencia de forma fiable, y la capacidad que pagas pero nunca usas durante los valles de tráfico. Las GPU reservadas bajan la tarifa por hora pero suben el listón de utilización.
Haz tus propios números en la calculadora self-host frente a API →Las cifras son ilustrativas. Confirma los precios actuales en el propio sitio del proveedor antes de decidir.