<- Todos os termos

Self-hosting (auto-hospedagem)

Rodar um modelo de pesos abertos em GPUs que você aluga ou possui, em vez de chamar a API de um provedor. Você troca uma conta por token por uma conta por hora mais esforço de engenharia.

O que é

Você escolhe um modelo de pesos abertos (Llama, Qwen, Mistral, DeepSeek, gpt-oss), um stack de serviço (vLLM, TGI, SGLang) e uma GPU com VRAM suficiente — possivelmente após quantização. Você o roda em GPUs de nuvem alugadas, um endpoint dedicado ou na sua própria máquina.

Por que importa

O self-hosting pode ser muito mais barato com volume alto e constante, e dá controle sobre os dados, a latência e os pesos com fine-tuning. Também pode ser muito mais caro com utilização baixa, e adiciona uma carga operacional real que as contas por token ignoram.

Impacto em custo e infraestrutura

Custos que as contas por token deixam de fora, todos a favor da API: o tempo de engenharia para rodar a inferência de forma confiável, a redundância e a capacidade que você paga durante os vales de tráfego. GPUs reservadas cortam a tarifa por hora mas aumentam a utilização de que você precisa.

Conceitos relacionados

Use no Obolith

Última revisão: 2026-09-01