<- Todos os termos

Decodificação especulativa

Um truque de velocidade: um modelo pequeno e rápido propõe vários tokens, o modelo grande verifica todos numa passada só e fica com os que aprova. Geração 2-3× mais rápida, com saída idêntica.

O que é

Gerar um token normalmente significa uma passada para a frente completa do modelo grande. A decodificação especulativa roda um "rascunho" barato (um modelo pequeno, uma busca por n-grama ou cabeças extras tipo Medusa/EAGLE) para adivinhar os próximos 4-8 tokens e então faz uma passada do modelo grande que verifica todo o palpite de uma vez. Os tokens aceitos são velocidade de graça; os rejeitados voltam para a decodificação normal. A saída é comprovadamente idêntica à decodificação comum.

Por que importa

Como corta o tempo real por requisição sem mudar a qualidade, aumenta o throughput da mesma GPU: mais requisições por GPU-hora, então um custo por requisição mais baixo num self-host. Vários provedores de API usam isso por baixo dos panos, o que explica em parte a queda contínua dos preços por token.

Conceitos relacionados

Use no Obolith

Última revisão: 2026-09-04 · conceito atemporal