API frente a self-hosting
La decisión de infraestructura central para quien ejecuta LLM a escala: pagar por token a un proveedor, o pagar por hora por GPU que tú operas. La respuesta depende del volumen, la utilización y cuánto control necesitas.
Qué es
| API | Self-hosting | |
| Facturación | por token | por GPU-hora |
| Costo en reposo | cero | lo pagas tú |
| Esfuerzo de ops | casi nulo | significativo |
| Mejor cuando | volumen variable / bajo / mixto | volumen alto, constante y predecible |
Por qué importa
Equivocarse aquí sale caro en ambos sentidos: una GPU dedicada para una app a ráfagas quema dinero en tiempo parado; una factura por token para un servicio constante de gran volumen puede ser 3-5× lo que costaría el self-hosting. Halla tu punto de equilibrio antes de comprometerte.