Sai mais barato fazer self-host ou usar uma API?
Alugar uma GPU parece barato ao lado de uma conta por token — até você contar as horas ociosas. A aritmética que decide.
Alugar uma H100 por hora parece barato ao lado de uma conta de API por token — até você levar em conta as horas em que essa GPU fica ociosa. Esta é a aritmética que decide.
Uma API cobra só pelos tokens que você realmente envia e recebe. Um modelo auto-hospedado cobra cada segundo em que a máquina está ligada, esteja atendendo uma requisição ou esperando por uma. Então a pergunta é, na verdade, sobre utilização: que fração do tempo a sua GPU faz trabalho útil.
O ponto de equilíbrio, em uma linha
Pegue o preço por hora da GPU, divida pelos tokens por hora que ela produz no seu tamanho de batch, e compare com o preço por token da API.
self-host $/tok = (GPU $/h) ÷ (tokens/h × utilização)
mais barato o self-host quando self-host $/tok < API $/tok
Com números reais. Uma H100 a 2,50 $/h servindo um modelo de 70B a 2,0M de tokens de saída por hora, rodando a 40% de utilização:
| Custo de GPU por hora | 2,50 $ |
| Tokens úteis por hora (40%) | 800.000 |
| Self-host, por 1M de tokens | 3,13 $ |
| Um 70B hospedado rápido, por 1M de saída | 0,79 $ |
A 40% de utilização a API ganha com folga. O self-host só passa à frente quando você mantém a GPU ocupada a maior parte do tempo — em torno de 70%+ para este modelo e preço — ou quando a residência dos dados, a latência ou pesos com fine-tuning tornam a API inviável.
O tempo de GPU ociosa é toda a história do custo. O resto é erro de arredondamento.
Mais dois custos que a fórmula deixa de fora, ambos a favor da API: o tempo de engenharia para rodar a inferência de forma confiável, e a capacidade que você paga mas nunca usa durante os vales de tráfego. GPUs reservadas baixam a tarifa por hora mas elevam a régua de utilização.
Faça as suas próprias contas na calculadora self-host vs API →Os números são ilustrativos. Confirme os preços atuais no próprio site do provedor antes de decidir.