Self-hosting (autoalojamiento)
Ejecutar un modelo de pesos abiertos en GPU que alquilas o posees, en lugar de llamar a la API de un proveedor. Cambias una factura por token por una factura por hora más esfuerzo de ingeniería.
Qué es
Eliges un modelo de pesos abiertos (Llama, Qwen, Mistral, DeepSeek, gpt-oss), un stack de servicio (vLLM, TGI, SGLang) y una GPU con suficiente VRAM, posiblemente tras cuantización. Lo ejecutas en GPU de nube alquiladas, un endpoint dedicado o tu propia máquina.
Por qué importa
El self-hosting puede ser mucho más barato con volumen alto y constante, y da control sobre los datos, la latencia y los pesos con fine-tuning. También puede ser mucho más caro con utilización baja, y añade una carga operativa real que las cuentas por token ignoran.
Impacto en costo e infraestructura
Costos que las cuentas por token dejan fuera, todos a favor de la API: el tiempo de ingeniería para ejecutar la inferencia de forma fiable, la redundancia y la capacidad que pagas durante los valles de tráfico. Las GPU reservadas bajan la tarifa por hora pero suben la utilización que necesitas.