Bande passante ou capacité : choisir une machine pour les LLM locaux
La bande passante accélère les modèles qui tiennent en mémoire ; la capacité détermine ceux qui peuvent être exécutés.
La bande passante accélère les modèles qui tiennent en mémoire ; la capacité détermine ceux qui peuvent être exécutés.
Llama 4 Scout est un modèle MoE multimodal de Meta avec 17 milliards de paramètres actifs et 109 milliards au total. Voici ce que ses caractéristiques impliquent pour l’inférence locale.
Les modèles à mélange d'experts demandent une évaluation locale qui sépare mémoire, vitesse, format et qualité.
Les architectures hybrides à états et l’évolution des backends Vulkan élargissent les possibilités de l’inférence locale.
Préremplissage, génération et paramètres actifs : une lecture prudente des benchmarks de LLM locaux.
De vrais benchmarks du modèle open-weight 120B MoE d'OpenAI sur un Ryzen AI Max+ 395 avec 128 Go de mémoire unifiée. Pas de cloud, pas d'A100, juste du bare metal.