<- Tous les termes

Taux d'utilisation

La part du temps où un GPU loué fait un travail utile plutôt que de rester au repos. Le nombre qui décide si le self-hosting bat une API.

Ce que c'est

Une API ne facture que les tokens. Un GPU loué facture chaque heure allumée, actif ou non. Si ton trafic occupe un GPU 30 % de la journée, tu paies 100 % et gaspilles 70 %. Le coût effectif au token = coût affiché / utilisation.

Pourquoi c'est important

Les usages irréguliers ou petits atteignent rarement les ~60-70 % d'utilisation nécessaires pour battre une API moderne. Le trafic régulier, gros volume et prévisible, c'est là que le self-hosting gagne. L'autoscaling et le spot aident ; un GPU dédié allumé en permanence pour une app irrégulière, c'est l'erreur classique.

Concepts liés

Sur Obolith

Dernière revue : 2026-09-01 · concept stable