2026-03-07
Llm
2026-03-05
Quali LLM locali sanno davvero usare gli strumenti?
Il tool calling va valutato su scelta, argomenti, astensione e gestione degli errori; il nome del modello non basta.
2026-03-05
Quale LLM locale è più veloce? Come costruire un benchmark che dica qualcosa
Prefill, generazione, qualità e configurazione devono essere misurati insieme: una classifica isolata non basta.
2026-03-04
Distillare Claude: cosa si può davvero affermare sul trasferimento di capacità
La distillazione è una tecnica consolidata; attribuire capacità di un modello a un fine-tuning richiede dati, provenienza e valutazioni riproducibili.
2026-03-01
Ho testato 10 modelli di IA così non devi farlo tu
Un fine settimana di benchmark con modelli IA locali su hardware consumer. Ecco cosa funziona davvero.
2026-02-23
GPT-OSS 120B: primi benchmark su hardware AMD consumer
Benchmark reali del modello open-weight 120B MoE di OpenAI su un Ryzen AI Max+ 395 con 128 GB di memoria unificata. Niente cloud, niente A100, solo bare metal.