M5 Max gegen AMD Strix Halo: Was zählt für lokale LLMs?
Speicherbandbreite und Speicherkapazität sind bei lokaler Inferenz zwei verschiedene Entscheidungen.
Speicherbandbreite und Speicherkapazität sind bei lokaler Inferenz zwei verschiedene Entscheidungen.
Llama 4 Scout verbindet ein MoE-Design mit multimodalen Fähigkeiten und langem Kontext. Für lokale Inferenz sind Speicherbedarf, Quantisierung und unabhängige Tests wichtiger als die Marketingzahl der Gesamtparameter.
Mistral Small 4 kombiniert Reasoning, Bildverständnis und agentisches Coding in einem sparsamen Mixture-of-Experts-Modell.
Warum Vulkan-Unterstützung für Mamba-artige Operationen die lokale Inferenz erweitert.
Warum Prefill, Generierung, Kontext und Speicher getrennt gemessen werden müssen, wenn lokale Sprachmodelle verglichen werden.
Echte Benchmarks von OpenAIs Open-Weight-120B-MoE-Modell auf einem Ryzen AI Max+ 395 mit 128 GB Unified Memory. Keine Cloud, keine A100s, nur Bare Metal.