2026-04-02
M5 Max gegen AMD Strix Halo: Was zählt für lokale LLMs?
Speicherbandbreite und Speicherkapazität sind bei lokaler Inferenz zwei verschiedene Entscheidungen.
Speicherbandbreite und Speicherkapazität sind bei lokaler Inferenz zwei verschiedene Entscheidungen.
Warum Vulkan-Unterstützung für Mamba-artige Operationen die lokale Inferenz erweitert.
Warum Prefill, Generierung, Kontext und Speicher getrennt gemessen werden müssen, wenn lokale Sprachmodelle verglichen werden.
Wie ich einen kompletten lokalen KI-Stack aufgebaut habe — Text, Bild und Video — auf einer einzigen Maschine, ohne jede Cloud-Abhängigkeit. Alles Vulkan, alles koexistierend, alles gratis.