<- Todos los términos

Mezcla de expertos (MoE)

Una arquitectura de modelo donde cada token se enruta solo a unos pocos de muchas subredes «expertas». El total de parámetros es enorme, pero el cómputo por token es pequeño, y por eso estos modelos son baratos de servir.

Qué es

Un modelo denso ejecuta cada parámetro para cada token. Un modelo MoE tiene, pongamos, 128 bloques de expertos por capa pero un enrutador elige 2-8 por token. Así, un modelo con 400B de parámetros totales puede usar solo 30B de parámetros activos en un token dado.

Aun así necesitas suficiente vram para mantener todos los expertos (parámetros totales), pero la velocidad y el costo se comportan como el número de parámetros activos.

Por qué importa

MoE es la razón de que varios de los modelos capaces más baratos de la tabla de precios (DeepSeek, Mixtral, Qwen, GPT-oss, Llama 4) queden por debajo de modelos densos de calidad similar. Cuando autoalojas uno, dimensiona la GPU por los parámetros totales para la memoria, pero espera un rendimiento más cercano al de los parámetros activos.

Conceptos relacionados

Úsalo en Obolith

Última revisión: 2026-09-04 · concepto atemporal