Self-hosting
Faire tourner un modèle open-weight sur des GPU que tu loues ou possèdes, au lieu d'appeler l'API d'un fournisseur. Tu échanges une facture au token contre une facture à l'heure plus de l'ingénierie.
Ce que c'est
Tu choisis un modèle open-weight (Llama, Qwen, Mistral, DeepSeek, gpt-oss), une stack de serving (vLLM, TGI, SGLang), et un GPU avec assez de VRAM - éventuellement après quantization. Tu le fais tourner sur des GPU cloud loués, un endpoint dédié, ou ta propre machine.
Pourquoi c'est important
Le self-hosting peut être bien moins cher à gros volume régulier, et donne le contrôle sur les données, la latence et les poids fine-tunés. Il peut aussi être bien plus cher à faible utilisation, et ajoute une charge opérationnelle réelle que le calcul au token ignore.
Impact coût & infrastructure
Coûts que le calcul au token oublie, tous en faveur de l'API : le temps d'ingénierie pour une inférence fiable, la redondance, et la capacité payée pendant les creux. Les GPU réservés baissent le tarif horaire mais montent l'utilisation requise.