<- Todos os termos

Mistura de especialistas (MoE)

Uma arquitetura de modelo em que cada token é roteado apenas para algumas de muitas sub-redes "especialistas". O total de parâmetros é enorme, mas a computação por token é pequena — e por isso esses modelos são baratos de servir.

O que é

Um modelo denso roda cada parâmetro para cada token. Um modelo MoE tem, digamos, 128 blocos de especialistas por camada mas um roteador escolhe 2-8 por token. Assim, um modelo com 400B de parâmetros totais pode usar só 30B de parâmetros ativos num token qualquer.

Você ainda precisa de vram suficiente para segurar todos os especialistas (parâmetros totais), mas a velocidade e o custo se comportam como o número de parâmetros ativos.

Por que importa

MoE é a razão de vários dos modelos capazes mais baratos da tabela de preços (DeepSeek, Mixtral, Qwen, GPT-oss, Llama 4) ficarem abaixo de modelos densos de qualidade parecida. Quando você auto-hospeda um, dimensione a GPU pelos parâmetros totais para a memória, mas espere um throughput mais perto do patamar dos parâmetros ativos.

Conceitos relacionados

Use no Obolith

Última revisão: 2026-09-04 · conceito atemporal