Les modèles hybrides combinant attention, experts spécialisés et modèles d’état remettent en cause l’idée que toute l’inférence locale doit ressembler à un Transformer classique. Cette évolution compte surtout lorsque le contexte s’allonge : l’attention traditionnelle peut devenir coûteuse, alors que certaines architectures récurrentes cherchent à traiter les séquences avec des coûts plus réguliers.

Pourquoi Mamba attire l’attention

Mamba est une famille de modèles d’état sélectifs. Son intérêt vient de son approche de séquences longues : au lieu de reconstituer une interaction d’attention complète entre tous les jetons, le modèle maintient et met à jour un état. Cela ne supprime pas les compromis de qualité, de mémoire ou de compatibilité, mais ouvre une voie différente pour les charges longues.

Les modèles hybrides ne remplacent pas automatiquement les Transformers. Ils mélangent souvent plusieurs types de couches afin de conserver les points forts de l’attention tout en limitant certains coûts sur les séquences étendues.

Un backend doit comprendre les opérations

Une nouvelle architecture n’est exploitable localement que lorsque le moteur d’inférence et son backend prennent en charge ses opérations spécifiques. Les GPU ne se résument pas à une promesse générique de calcul parallèle : chaque primitive doit être implémentée, testée et optimisée pour le backend concerné.

Les évolutions de Vulkan dans les projets d’inférence ouverts sont donc importantes. Elles rendent progressivement accessibles des opérations qui n’étaient auparavant disponibles que dans certains écosystèmes, et élargissent les choix de matériel compatibles avec une même pile logicielle.

Quantification, mémoire et contexte

La quantification réduit la taille des poids, mais elle ne rend pas le contexte gratuit. L’empreinte réelle inclut les poids, les caches nécessaires à l’exécution et les allocations du moteur. Les annonces de très grandes fenêtres de contexte doivent être évaluées avec une charge réaliste, pas seulement avec une valeur maximale annoncée.

Pour les modèles MoE, il faut également distinguer les paramètres actifs des paramètres totaux. Une fraction des experts peut être sollicitée à chaque jeton, tandis que l’ensemble des poids reste une contrainte de stockage.

Ce qu’il faut mesurer ensuite

La promesse d’une architecture ne suffit pas. Les comparaisons utiles mesurent le préremplissage, le débit de génération, la mémoire, la stabilité sur un contexte long et la qualité sur des tâches précises. Elles indiquent aussi la version du moteur, le format des poids et le backend utilisés.

La leçon est moins spectaculaire qu’un classement : le matériel grand public devient intéressant pour davantage de modèles lorsque les architectures, les formats et les backends progressent ensemble.

Sources