Mezcla de expertos (MoE)
Una arquitectura de modelo donde cada token se enruta solo a unos pocos de muchas subredes «expertas». El total de parámetros es enorme, pero el cómputo por token es pequeño, y por eso estos modelos son baratos de servir.
Qué es
Un modelo denso ejecuta cada parámetro para cada token. Un modelo MoE tiene, pongamos, 128 bloques de expertos por capa pero un enrutador elige 2-8 por token. Así, un modelo con 400B de parámetros totales puede usar solo 30B de parámetros activos en un token dado.
Aun así necesitas suficiente vram para mantener todos los expertos (parámetros totales), pero la velocidad y el costo se comportan como el número de parámetros activos.
Por qué importa
MoE es la razón de que varios de los modelos capaces más baratos de la tabla de precios (DeepSeek, Mixtral, Qwen, GPT-oss, Llama 4) queden por debajo de modelos densos de calidad similar. Cuando autoalojas uno, dimensiona la GPU por los parámetros totales para la memoria, pero espera un rendimiento más cercano al de los parámetros activos.