Quale LLM locale è più veloce? Come costruire un benchmark che dica qualcosa
Chiedere quale LLM locale sia più veloce è legittimo. Pubblicare una risposta senza dire come è stata misurata, molto meno.
La velocità percepita dipende da almeno due fasi: il trattamento del prompt e la generazione del testo. Una configurazione può eccellere con una domanda breve e rallentare con un contesto lungo. Un’altra può produrre token rapidamente ma fornire risposte che richiedono più correzioni. Una sola cifra non descrive tutto questo.
Misurare il lavoro, non il logo
Un benchmark utile definisce un carico di lavoro prima di eseguirlo. Deve indicare modello, revisione dei pesi, quantizzazione, backend, impostazioni di campionamento, lunghezza del prompt e numero di ripetizioni. Senza queste informazioni, il risultato è difficile da riprodurre e quasi impossibile da confrontare.
Le suite MLPerf sono un riferimento utile non perché misurino ogni scenario locale, ma perché trattano la riproducibilità come parte del risultato. Le regole di misura contano quanto la tabella finale.
Quattro misure minime
Per un confronto pratico, raccoglierei almeno:
- tempo o velocità di elaborazione del prompt;
- velocità di generazione su un output di lunghezza definita;
- memoria richiesta durante l’esecuzione;
- qualità sul compito che l’utente intende davvero svolgere.
llama.cpp rende possibili molte combinazioni di modelli, quantizzazioni e piattaforme. Proprio questa flessibilità rende necessario descrivere l’ambiente di prova: cambiare una quantizzazione o un backend può cambiare il risultato più di quanto suggerisca il nome della famiglia del modello.
Non confondere velocità e capacità
AgentBench ricorda che l’uso reale degli LLM spesso include compiti a più passaggi. Per questi casi, token al secondo è una metrica necessaria ma insufficiente. Un modello rapido che sceglie male un’azione o perde vincoli nel contesto può costare più tempo di un modello un po’ più lento ma affidabile.
Il benchmark migliore non proclama un vincitore universale. Mostra con precisione quale configurazione ha funzionato meglio per un carico dichiarato. È meno spettacolare. È anche l’unico dato che vale la pena riusare.