2026-09-03
Latent MoE: comprimere gli esperti prima di instradarli
LatentMoE comprime le rappresentazioni prima dell'instradamento agli esperti, riducendo il costo di specializzazione nei modelli MoE.
LatentMoE comprime le rappresentazioni prima dell'instradamento agli esperti, riducendo il costo di specializzazione nei modelli MoE.
Le architetture ibride Mamba, MoE e attenzione richiedono nuovi kernel. Il supporto Vulkan amplia le opzioni per l'inferenza locale.