Inférence
Faire tourner un modèle déjà entraîné pour obtenir une réponse, par opposition à l'entraîner. Se divise en une phase prefill (lire le prompt) et une phase decode (écrire la réponse token par token).
Ce que c'est
Le prefill traite tout le prompt en une passe parallèle et construit le cache KV. Son coût croît avec la longueur du prompt et il fixe le temps jusqu'au premier token.
Le decode génère ensuite la réponse un token à la fois, chaque étape lisant le cache KV qui grossit. Il est limité par la bande passante mémoire et fixe les tokens par seconde.
Pourquoi c'est important
L'inférence est ce que paient une facture d'API comme un GPU self-hosté. Comprendre les deux phases explique pourquoi les longs prompts démarrent lentement, pourquoi la vitesse de génération dépend peu de la longueur du prompt, et pourquoi la concurrence est limitée par la VRAM.
Impact coût & infrastructure
Sur un GPU self-hosté, le coût au token dépend entièrement du nombre de tokens/heure poussés face au prix horaire - voir taux d'utilisation et seuil de rentabilité. Regrouper les requêtes (batching) est le principal moyen d'augmenter ce débit.