2026-04-02
Bande passante ou capacité : choisir une machine pour les LLM locaux
La bande passante accélère les modèles qui tiennent en mémoire ; la capacité détermine ceux qui peuvent être exécutés.
La bande passante accélère les modèles qui tiennent en mémoire ; la capacité détermine ceux qui peuvent être exécutés.
Les architectures hybrides à états et l’évolution des backends Vulkan élargissent les possibilités de l’inférence locale.
Préremplissage, génération et paramètres actifs : une lecture prudente des benchmarks de LLM locaux.
Comment j'ai mis en place un stack IA local complet — texte, image et vidéo — sur une seule machine, sans aucune dépendance cloud. Tout en Vulkan, tout coexistant, tout gratuit.