2026-04-02
M5 Max gegen AMD Strix Halo: Was zählt für lokale LLMs?
Speicherbandbreite und Speicherkapazität sind bei lokaler Inferenz zwei verschiedene Entscheidungen.
Speicherbandbreite und Speicherkapazität sind bei lokaler Inferenz zwei verschiedene Entscheidungen.
Llama 4 Scout verbindet ein MoE-Design mit multimodalen Fähigkeiten und langem Kontext. Für lokale Inferenz sind Speicherbedarf, Quantisierung und unabhängige Tests wichtiger als die Marketingzahl der Gesamtparameter.
Mistral Small 4 kombiniert Reasoning, Bildverständnis und agentisches Coding in einem sparsamen Mixture-of-Experts-Modell.
Ich habe 17 lokale LLMs über 13 Dimensionen mit 39 Tests gebenchmarkt. Die Ergebnisse haben meine Annahmen über Modellgrösse zerstört.