Self-hosting (auto-hospedagem)
Rodar um modelo de pesos abertos em GPUs que você aluga ou possui, em vez de chamar a API de um provedor. Você troca uma conta por token por uma conta por hora mais esforço de engenharia.
O que é
Você escolhe um modelo de pesos abertos (Llama, Qwen, Mistral, DeepSeek, gpt-oss), um stack de serviço (vLLM, TGI, SGLang) e uma GPU com VRAM suficiente — possivelmente após quantização. Você o roda em GPUs de nuvem alugadas, um endpoint dedicado ou na sua própria máquina.
Por que importa
O self-hosting pode ser muito mais barato com volume alto e constante, e dá controle sobre os dados, a latência e os pesos com fine-tuning. Também pode ser muito mais caro com utilização baixa, e adiciona uma carga operacional real que as contas por token ignoram.
Impacto em custo e infraestrutura
Custos que as contas por token deixam de fora, todos a favor da API: o tempo de engenharia para rodar a inferência de forma confiável, a redundância e a capacidade que você paga durante os vales de tráfego. GPUs reservadas cortam a tarifa por hora mas aumentam a utilização de que você precisa.