2026-03-07
Llm
2026-03-05
Lokale LLMs für Tool-Aufrufe bewerten
Ein Testkonzept für lokale Modelle, bei dem Auswahl, Argumente, Format und das Unterlassen unnötiger Aufrufe getrennt bewertet werden.
2026-03-05
Lokale LLM-Geschwindigkeit sinnvoll vergleichen
Warum Prefill, Generierung, Kontext und Speicher getrennt gemessen werden müssen, wenn lokale Sprachmodelle verglichen werden.
2026-03-04
Reasoning-Destillation: Was ein kleineres Modell übernehmen kann — und was nicht
Destillation kann kleineren Modellen bei klar abgegrenzten Aufgaben helfen. Bei Claude-Ausgaben setzt die zulässige Nutzung einen Blick in die aktuellen Bedingungen voraus.
2026-03-01
Ich habe 10 KI-Modelle getestet, damit du es nicht musst
Ein Wochenende voller Benchmarks mit lokalen KI-Modellen auf Consumer-Hardware. Hier ist, was wirklich funktioniert.
2026-02-23
GPT-OSS 120B: Erste Benchmarks auf Consumer-AMD-Hardware
Echte Benchmarks von OpenAIs Open-Weight-120B-MoE-Modell auf einem Ryzen AI Max+ 395 mit 128 GB Unified Memory. Keine Cloud, keine A100s, nur Bare Metal.