2026-09-03
Latent MoE : compresser les experts avant de les router
Nemotron 3 Super compresse les représentations dans un espace latent avant le routage vers les experts. L’objectif : davantage de spécialisation à coût d’inférence comparable.
Nemotron 3 Super compresse les représentations dans un espace latent avant le routage vers les experts. L’objectif : davantage de spécialisation à coût d’inférence comparable.
Les architectures hybrides à états et l’évolution des backends Vulkan élargissent les possibilités de l’inférence locale.