Les modèles Mixture-of-Experts ont un coût structurel souvent sous-estimé : le routage.

Dans un MoE classique, chaque jeton passe par une porte qui choisit les experts à activer. Cette porte travaille à la dimension complète de la représentation. Elle n’est pas forcément la partie la plus coûteuse du modèle, mais elle limite le nombre d’experts qu’il est raisonnable de proposer.

LatentMoE, présenté avec le rapport technique de Nemotron 3 Super, s’attaque directement à cette limite.[1][2][3]

L’idée en une phrase

Compresser le jeton dans un espace latent plus petit avant le routage, faire travailler les experts dans cet espace, puis projeter le résultat vers la dimension complète.

Il ne s’agit pas d’une nouvelle famille de modèles ni d’un objectif d’entraînement exotique. C’est un changement de l’endroit où le calcul expert intervient par rapport à la représentation du jeton.

Pourquoi cela fonctionne

Dans un MoE standard, un jeton de dimension cachée $d$ est routé et traité à cette même dimension. Le trafic entre la représentation et les experts évolue donc avec $d$.

LatentMoE introduit une projection $d \to \ell$, avec $\ell \ll d$. La porte et les experts travaillent alors dans la dimension $\ell$, avant une projection inverse $\ell \to d$.

Les calculs routés utilisent ainsi moins de dimensions. Cela réduit la charge par expert et le trafic associé. Le budget économisé peut servir à augmenter le nombre total d’experts ou le nombre d’experts actifs par jeton, à coût d’inférence comparable.

Le rapport décrit précisément cette réorganisation : la diminution de dimension compense l’augmentation du nombre d’experts et du nombre d’experts sélectionnés.[3]

Ce que cela n’est pas

Ce n’est pas simplement « un MoE amélioré ». C’est un MoE dont le routage cesse d’être le principal frein à la spécialisation.

La distinction est importante. La lecture habituelle du compromis MoE — plus d’experts, plus de paramètres et plus de mémoire — suppose que le coût du routage reste fixe. En le déplaçant dans un espace latent, l’architecture permet une spécialisation plus fine sans payer le même prix à chaque ajout d’expert.

C’est pertinent pour les usages agentiques. Un agent qui travaille avec du code, une conversation et des documents récupérés peut bénéficier de spécialistes supplémentaires : appel d’outils, styles de raisonnement ou langages de programmation. La difficulté est de les rendre disponibles sans rendre chaque jeton plus coûteux.

La partie Mamba-2

Nemotron 3 Super associe des couches Mamba-2, des couches d’attention et des couches LatentMoE.[2][3] Les couches de type espace d’état visent un traitement de séquence à coût linéaire, tandis que l’attention conserve des capacités de rappel associatif précises à certains niveaux.

Le modèle intègre aussi la prédiction de plusieurs jetons futurs. Cette conception peut soutenir le décodage spéculatif : le modèle propose plusieurs jetons, puis les vérifie plus efficacement.[3]

Ce que cela implique pour l’IA locale

Les poids, les jeux de données et la recette de Nemotron 3 Super sont publiés ouvertement selon NVIDIA.[2][3] Dans ce contexte, le nombre de paramètres actifs est souvent plus utile que le total : il indique mieux le calcul mobilisé à chaque jeton.

Il reste néanmoins nécessaire de mesurer les résultats dans des conditions indépendantes. Une capacité de spécialistes plus élevée peut améliorer le maintien du contexte, l’appel d’outils ou la robustesse sur des sessions longues, mais ces hypothèses doivent être testées plutôt que déduites d’un diagramme d’architecture.

Le motif plus large

LatentMoE illustre une direction récurrente de la recherche : identifier un goulet d’étranglement structurel, le compresser, puis réinvestir l’économie dans la capacité qui améliore réellement l’usage.

L’attention des transformeurs a longtemps été limitée par son coût avec la longueur de contexte. Le routage des MoE est limité par la largeur de la représentation. Dans les deux cas, déplacer le calcul vers une représentation plus compacte peut modifier le compromis fondamental.

La prochaine frontière n’est peut-être pas un modèle plus grand. C’est un modèle qui dépense ses paramètres avec plus de précision.

Sources

[1] arXiv — LatentMoE

[2] NVIDIA Developer Blog — Introducing Nemotron 3 Super

[3] NVIDIA Research — Nemotron 3 Super Technical Report