Bande passante ou capacité : choisir une machine pour les LLM locaux
Choisir une machine pour l’inférence locale ne revient pas à classer des puces sur une seule valeur. La capacité mémoire, la bande passante, le moteur d’inférence, la quantification et le contexte interagissent. Une spécification peut orienter une présélection ; elle ne remplace pas une mesure sur le modèle réellement visé.
Deux contraintes différentes
La capacité mémoire décide si les poids du modèle, le cache de contexte et les allocations nécessaires peuvent coexister. Elle fixe donc une limite pratique aux modèles et aux contextes envisageables. Un fichier de poids qui semble tenir selon sa taille nominale peut devenir insuffisant dès que le contexte ou les tâches concurrentes augmentent l’empreinte.
La bande passante influence ensuite la vitesse à laquelle les poids et les données circulent. Pour la génération autorégressive, elle peut peser fortement sur la réactivité. Mais son effet dépend du format, du backend, de la part exécutée par chaque accélérateur et de la longueur de la requête.
Les architectures à mélange d’experts rendent cette séparation encore plus importante. Elles peuvent réduire le calcul actif, sans éliminer l’exigence de stockage de l’ensemble des poids. Confondre ces deux dimensions conduit à des attentes irréalistes.
Le logiciel est dans la boucle
Les pages matérielles d’Apple et d’AMD décrivent des gammes et des configurations, mais la compatibilité effective relève aussi du logiciel. Le projet llama.cpp, par exemple, évolue avec les formats de modèles et les backends pris en charge. Avant un achat, il faut donc vérifier que l’outil choisi prend en charge le modèle, la quantification et l’accélération attendus.
Mesurer avec un protocole
Un essai utile fixe le modèle, le format, la longueur de contexte et les paramètres de génération. Il relève séparément le temps de chargement, le préremplissage, la génération, la mémoire occupée et la qualité sur les tâches représentatives. Le même protocole doit être appliqué à chaque machine.
Le résultat est plus utile qu’un duel de marques. Une machine peut être excellente pour un modèle compact interactif et moins adaptée à un modèle plus vaste avec un long contexte ; l’inverse peut aussi être vrai. Le bon choix est celui qui satisfait la charge de travail, pas celui qui gagne une comparaison abstraite.