Décodage spéculatif
Une astuce de vitesse : un petit modèle rapide propose plusieurs tokens, le grand modèle les vérifie tous en une passe et garde ceux avec lesquels il est d'accord. Génération 2-3x plus rapide, sortie identique.
Ce que c'est
Générer un token, normalement, c'est une passe avant complète du grand modèle. Le décodage spéculatif fait tourner un « brouillon » pas cher (un petit modèle, une recherche n-gram, ou des têtes en plus type Medusa/EAGLE) pour deviner les 4-8 tokens suivants, puis fait une passe du grand modèle qui vérifie toute la proposition d'un coup. Les tokens acceptés sont de la vitesse gratuite ; les rejetés reviennent au décodage normal. La sortie est prouvablement identique au décodage classique.
Pourquoi c'est important
Comme ça réduit le temps réel par requête sans changer la qualité, ça relève le débit du même GPU - plus de requêtes par GPU-heure, donc un coût par requête plus bas en self-host. Plusieurs fournisseurs d'API l'utilisent en coulisses, ce qui explique en partie la baisse continue des prix au token.