Tokens par seconde
La vitesse à laquelle un modèle génère de la sortie une fois lancé. Fixe la durée d'une réponse complète et, sur un GPU self-hosté, détermine le coût au token.
Ce que c'est
Une mesure par requête pour la phase decode. Chaque token de sortie demande une passe qui lit les poids et le cache KV depuis la VRAM, donc la vitesse dépend de la bande passante mémoire, pas du calcul brut.
Elle dépend peu de la longueur du prompt - ce coût-là tombe dans le ttft.
Pourquoi c'est important
Une réponse de 300 tokens à 20 tok/s prend 15 secondes ; à 120 tok/s, 2,5 secondes. Pour les agents qui enchaînent des appels, une génération lente s'accumule en minutes.
Impact coût & infrastructure
Sur un GPU loué, coût par 1M tokens = (GPU $/h / tok/s) x 278. Doubler les tok/s - GPU plus rapide, quantization, meilleur batching - divise par deux le coût au token. C'est le cœur du calcul self hosting.
Concepts liés
Sur Obolith
FAQ
Pourquoi mon modèle self-hosté est-il plus lent que l'API ?
Les fournisseurs utilisent des stacks d'inférence optimisées, batchent fort entre utilisateurs, et servent souvent des poids quantizés sur du matériel haut de gamme. Une requête isolée non batchée sur un GPU l'égale rarement.