<- Todos los términos

Decodificación especulativa

Un truco de velocidad: un modelo pequeño y rápido propone varios tokens, el modelo grande los verifica todos en una sola pasada y conserva aquellos con los que coincide. Generación 2-3× más rápida, con salida idéntica.

Qué es

Generar un token normalmente significa una pasada hacia delante completa del modelo grande. La decodificación especulativa ejecuta un «borrador» barato (un modelo pequeño, una búsqueda n-grama o cabezas adicionales tipo Medusa/EAGLE) para adivinar los siguientes 4-8 tokens y luego hace una pasada del modelo grande que verifica toda la propuesta de una vez. Los tokens aceptados son velocidad gratis; los rechazados vuelven a la decodificación normal. La salida es demostrablemente idéntica a la decodificación normal.

Por qué importa

Como recorta el tiempo real por petición sin cambiar la calidad, sube el rendimiento de la misma GPU: más peticiones por GPU-hora, así que un costo por petición más bajo en un self-host. Varios proveedores de API lo usan por debajo, lo que explica en parte que los precios por token sigan bajando.

Conceptos relacionados

Úsalo en Obolith

Última revisión: 2026-09-04 · concepto atemporal