Decodificación especulativa
Un truco de velocidad: un modelo pequeño y rápido propone varios tokens, el modelo grande los verifica todos en una sola pasada y conserva aquellos con los que coincide. Generación 2-3× más rápida, con salida idéntica.
Qué es
Generar un token normalmente significa una pasada hacia delante completa del modelo grande. La decodificación especulativa ejecuta un «borrador» barato (un modelo pequeño, una búsqueda n-grama o cabezas adicionales tipo Medusa/EAGLE) para adivinar los siguientes 4-8 tokens y luego hace una pasada del modelo grande que verifica toda la propuesta de una vez. Los tokens aceptados son velocidad gratis; los rechazados vuelven a la decodificación normal. La salida es demostrablemente idéntica a la decodificación normal.
Por qué importa
Como recorta el tiempo real por petición sin cambiar la calidad, sube el rendimiento de la misma GPU: más peticiones por GPU-hora, así que un costo por petición más bajo en un self-host. Varios proveedores de API lo usan por debajo, lo que explica en parte que los precios por token sigan bajando.