<- Tous les termes

Self-hosting

Faire tourner un modèle open-weight sur des GPU que tu loues ou possèdes, au lieu d'appeler l'API d'un fournisseur. Tu échanges une facture au token contre une facture à l'heure plus de l'ingénierie.

Ce que c'est

Tu choisis un modèle open-weight (Llama, Qwen, Mistral, DeepSeek, gpt-oss), une stack de serving (vLLM, TGI, SGLang), et un GPU avec assez de VRAM - éventuellement après quantization. Tu le fais tourner sur des GPU cloud loués, un endpoint dédié, ou ta propre machine.

Pourquoi c'est important

Le self-hosting peut être bien moins cher à gros volume régulier, et donne le contrôle sur les données, la latence et les poids fine-tunés. Il peut aussi être bien plus cher à faible utilisation, et ajoute une charge opérationnelle réelle que le calcul au token ignore.

Impact coût & infrastructure

Coûts que le calcul au token oublie, tous en faveur de l'API : le temps d'ingénierie pour une inférence fiable, la redondance, et la capacité payée pendant les creux. Les GPU réservés baissent le tarif horaire mais montent l'utilisation requise.

Concepts liés

Sur Obolith

Dernière revue : 2026-09-01