2026-04-04
Lire une fiche de modèle sans la transformer en benchmark
Une fiche de modèle décrit une possibilité ; elle ne remplace pas une évaluation reproductible sur la charge de travail visée.
Une fiche de modèle décrit une possibilité ; elle ne remplace pas une évaluation reproductible sur la charge de travail visée.
Les modèles à mélange d'experts demandent une évaluation locale qui sépare mémoire, vitesse, format et qualité.
Comment concevoir et interpréter un benchmark d’appel d’outils pour des modèles locaux.
Un week-end passé à tester tous les modèles d'IA locaux prometteurs sur du matériel grand public. Voici ce qui fonctionne vraiment.
J'ai benchmarké 17 LLMs locaux sur 13 dimensions avec 39 tests. Les résultats ont détruit mes hypothèses sur la taille des modèles.
De vrais benchmarks du modèle open-weight 120B MoE d'OpenAI sur un Ryzen AI Max+ 395 avec 128 Go de mémoire unifiée. Pas de cloud, pas d'A100, juste du bare metal.