API vs self-hosting
A decisão central de infraestrutura para quem roda LLMs em escala: pagar por token a um provedor, ou pagar por hora por GPUs que você opera. A resposta depende do volume, da utilização e de quanto controle você precisa.
O que é
| API | Self-hosting | |
| Cobrança | por token | por GPU-hora |
| Custo ocioso | zero | você paga |
| Esforço de ops | quase nulo | significativo |
| Melhor quando | volume variável / baixo / misto | volume alto, constante e previsível |
Por que importa
Errar aqui sai caro nas duas direções: uma GPU dedicada para uma app em rajadas queima dinheiro em tempo ocioso; uma conta por token para um serviço constante de grande volume pode ser 3-5× o que o self-hosting custaria. Ache o seu ponto de equilíbrio antes de se comprometer.