Lokale LLM-Geschwindigkeit sinnvoll vergleichen
„Welches lokale LLM ist am schnellsten?“ klingt nach einer Tabelle. In Wirklichkeit ist es eine unvollständige Frage. Ein Modell kann lange Eingaben rasch verarbeiten und bei der Ausgabe langsam sein. Ein anderes reagiert schnell auf kurze Chats, verliert aber bei großem Kontext an Tempo oder benötigt mehr Speicher, als die Zielumgebung sinnvoll bereitstellen kann.
Ein brauchbarer Vergleich trennt deshalb Messgrößen, statt sie in eine einzige Rangliste zu pressen.
Prefill und Generierung sind verschiedene Phasen
Beim Prefill verarbeitet das Modell die Eingabe und baut den benötigten Kontextzustand auf. Diese Phase ist für Dokumentanalyse, Retrieval und lange Prompts relevant.
Bei der Generierung entsteht die Antwort Token für Token. Diese Phase prägt, wie flüssig eine Unterhaltung oder ein interaktives Werkzeug wirkt. Weil jedes neue Token vom bisherigen Kontext abhängt, folgen hier andere Engpässe als beim Prefill.
Wer nur eine Rate veröffentlicht, verschweigt oft, welche Erfahrung damit gemeint ist. Für eine Zusammenfassung langer Texte kann Prefill entscheidend sein. Für eine schreibende Assistenz ist die Generierungsrate meist sichtbarer.
Das Testprotokoll ist Teil des Ergebnisses
Eine Zahl ohne Protokoll lässt sich kaum interpretieren. Ein Vergleich sollte mindestens dokumentieren:
- Modellrevision und Quantisierung;
- Inferenzsoftware und Einstellungen;
- Länge und Art der Eingabe;
- gewünschte Ausgabelänge;
- Batch-Größe und Parallelität;
- verfügbare Speicherressourcen;
- ob Werkzeuge wie Caching verwendet wurden.
llama.cpp stellt unterschiedliche Backends und Modellformate bereit; daraus folgt bereits, dass Ergebnisse von der gewählten Laufzeit abhängen.[1] Selbst bei gleicher Hardware können Prompt-Format, Kontextlänge und Quantisierung das Verhältnis zwischen Speicherbedarf und Tempo deutlich verändern.
Qualität gehört daneben, nicht darunter
Ein Performance-Test beantwortet keine Qualitätsfrage. Ein Modell kann schnell sein und eine Aufgabe trotzdem falsch verstehen. Umgekehrt kann ein langsameres Modell für anspruchsvolle Recherche, Code oder strukturierte Ausgabe die bessere Wahl sein.
Deshalb sind Performance- und Qualitätsmessung getrennte Achsen. MLPerf beschreibt standardisierte Inferenzmessungen als Vergleich unter genau definierten Regeln.[2] Für lokale Sprachmodelle gilt derselbe Grundsatz: Erst das Szenario festlegen, dann messen, dann nur innerhalb dieses Szenarios vergleichen.
Ein kleines, ehrliches Vorgehen
Für eine Auswahl reichen oft wenige repräsentative Aufgaben: eine kurze Frage, eine längere Zusammenfassung und eine strukturierte Ausgabe. Jede Aufgabe sollte mehrfach laufen. Ausreißer gehören in die Notizen, nicht unter den Teppich. Wichtig ist außerdem, die Tests nach Modell- oder Laufzeitwechseln zu wiederholen.
So entsteht keine universelle Bestenliste. Es entsteht etwas Brauchbareres: eine Entscheidung für den eigenen Anwendungsfall.
Fazit
Lokale LLM-Performance ist ein Profil aus Eingabeverarbeitung, Ausgaberate, Speicher, Kontext und Qualität. Wer diese Größen getrennt misst und das Protokoll veröffentlicht, kann Modelle fair vergleichen. Wer nur eine Spitzengeschwindigkeit nennt, beschreibt meist nur einen Moment einer viel größeren Geschichte.
Quellen
[1] llama.cpp