Un modèle à mélange d’experts rend les comparaisons locales plus délicates, pas plus simples. Il est tentant de résumer l’architecture par le nombre d’experts actifs. Pourtant, l’expérience dépend aussi de la mémoire nécessaire aux poids, du cache de contexte, du moteur, du format de quantification et de la qualité du modèle de messages.

Ce que signifie MoE

Dans une architecture dense, un grand ensemble de paramètres participe généralement à chaque passage. Une architecture MoE route une entrée vers un sous-ensemble spécialisé. Cette organisation peut modifier le coût de calcul actif, mais elle ne crée pas une règle universelle de vitesse ou de qualité.

C’est pourquoi comparer un MoE à un modèle dense sur le seul nombre de paramètres produit souvent une fausse précision. Deux exécutions avec un format ou un contexte différent ne répondent déjà plus à la même question.

L’exécution est une intégration

Les annonces de fournisseurs et les dépôts officiels permettent de repérer les versions publiées, les licences et les documents associés. Le projet llama.cpp fournit un exemple d’outil d’inférence dont la prise en charge évolue. Avant de juger un modèle, il faut vérifier que le moteur sait interpréter son architecture et que le modèle de conversation correspond à la variante utilisée.

Un marqueur de format dans une réponse ou une sortie mal structurée peut signaler une mauvaise intégration. Le noter est utile ; l’attribuer immédiatement à une faiblesse fondamentale du modèle ne l’est pas.

Un benchmark qui mérite son nom

Une évaluation locale devrait publier ses conditions : matériel, version du moteur, modèle exact, quantification, contexte, paramètres de génération et tâches. Elle devrait séparer au moins le chargement, le préremplissage, la génération et les critères qualitatifs. Pour des usages d’agents, il faut tester les formats structurés, les refus justifiés, les cas limites et le comportement après un résultat d’outil.

Le résultat doit être présenté comme une observation de cette configuration. Cela rend la comparaison plus modeste, mais également plus utile à quelqu’un qui souhaite la reproduire.

Une décision de produit

Un grand MoE local peut être pertinent lorsque l’environnement possède la mémoire nécessaire et que sa polyvalence apporte un bénéfice mesurable. Un modèle plus compact peut être préférable lorsque la simplicité, la latence ou le coût d’exploitation dominent. La bonne conclusion n’est pas un vainqueur abstrait : c’est une correspondance démontrée entre un modèle, un outil et une charge de travail.