Mélange d’experts (MoE)
Une architecture où chaque token n'est routé que vers quelques-uns de nombreux sous-réseaux « experts ». Le nombre total de paramètres est énorme, mais le calcul par token est faible - d'où le faible coût de service de ces modèles.
Ce que c'est
Un modèle dense exécute chaque paramètre pour chaque token. Un modèle MoE a, disons, 128 blocs experts par couche mais un routeur en choisit 2-8 par token. Un modèle à 400 Md de paramètres totaux peut n'utiliser que 30 Md de paramètres actifs sur un token donné.
Il te faut quand même assez de vram pour tenir tous les experts (params totaux), mais la vitesse et le coût se comportent comme le nombre de params actifs.
Pourquoi c'est important
MoE explique pourquoi plusieurs des modèles compétents les moins chers du tableau de prix (DeepSeek, Mixtral, Qwen, GPT-oss, Llama 4) passent sous les modèles denses de qualité comparable. Quand tu en self-héberges un, dimensionne le GPU sur les params totaux pour la mémoire, mais attends-toi à un débit proche du palier des params actifs.