2026-04-02
Bande passante ou capacité : choisir une machine pour les LLM locaux
La bande passante accélère les modèles qui tiennent en mémoire ; la capacité détermine ceux qui peuvent être exécutés.
La bande passante accélère les modèles qui tiennent en mémoire ; la capacité détermine ceux qui peuvent être exécutés.
Llama 4 Scout est un modèle MoE multimodal de Meta avec 17 milliards de paramètres actifs et 109 milliards au total. Voici ce que ses caractéristiques impliquent pour l’inférence locale.
Les modèles à mélange d'experts demandent une évaluation locale qui sépare mémoire, vitesse, format et qualité.
J'ai benchmarké 17 LLMs locaux sur 13 dimensions avec 39 tests. Les résultats ont détruit mes hypothèses sur la taille des modèles.