Quali sono i migliori LLM locali del 2026? A settembre 2026, i modelli più interessanti da eseguire con Ollama o LM Studio sono Qwen3.8 27B, Gemma 4, LFM2.5, gpt-oss 20B e Devstral 24B. La scelta corretta dipende soprattutto da hardware, uso previsto e dalla necessità di elaborare immagini, audio, codice o chiamate a strumenti esterni.

Eseguire un modello linguistico in locale è diventato molto più semplice rispetto a pochi anni fa. È possibile avere un assistente AI privato sul PC, senza inviare prompt e documenti a un servizio cloud, usando Ollama su Linux oppure LM Studio. Tuttavia, il numero di parametri non basta per decidere: incidono anche quantizzazione, lunghezza del contesto, memoria riservata alla KV cache, supporto multimodale e velocità di generazione.

Questa guida aggiornata a settembre 2026 privilegia le famiglie open-weight recenti, disponibili o in arrivo nei principali runtime locali. Per evitare una lista basata su modelli ormai superati, DeepSeek-R1 e Qwen3/Qwen3.5 non sono più le scelte principali per uso generico: restano utilizzabili e validi su hardware già configurato, ma oggi hanno alternative più nuove per molte esigenze.

I migliori LLM locali del 2026 in breve

Modello Categoria Perché sceglierlo Hardware indicativo
Qwen3.8 27B Migliore modello locale completo Chat, coding, reasoning controllabile, uso di tool, immagini e video. È la scelta principale per una workstation. 32 GB di RAM; GPU da 24 GB consigliata per una buona esperienza.
Gemma 4 E4B Migliore per notebook e PC compatti Modello recente, multimodale e compatto per testo, immagini e audio, con contesto da 128K. 16 GB di RAM; 8 GB di VRAM consigliati.
Gemma 4 26B A4B Miglior MoE da workstation 26B parametri totali ma 3,8B attivi per token; unisce qualità, reasoning, vision e tool calling. 32 GB di RAM; 16-24 GB di VRAM consigliati.
LFM2.5 8B-A1B Migliore assistente personale locale Progettato per tool calling veloce, istruzioni complesse e agenti su hardware consumer. 16 GB di RAM; GPU facoltativa, 6-8 GB di VRAM più comodi.
gpt-oss 20B Reasoning e workflow agentici Modello open-weight di OpenAI per reasoning, sviluppo e uso di strumenti, con 128K di contesto. 32 GB di RAM o GPU da 16 GB di VRAM; 24 GB di VRAM è preferibile.
Devstral 24B Coding agentico Specifico per esplorare codebase, utilizzare strumenti e modificare più file in un repository. 32 GB di RAM; GPU da 24 GB raccomandata.

Per chi vuole una risposta rapida: Gemma 4 E4B è il nuovo punto di partenza su PC comuni, LFM2.5 è molto interessante per un assistente personale con tool calling, mentre Qwen3.8 27B è il modello più completo da considerare se si possiede una GPU da 24 GB o un Mac con memoria unificata abbondante.

Ollama o LM Studio: cosa usare per gli LLM locali

Ollama è la scelta più immediata se si vuole installare un modello da terminale, esporre un’API locale e integrarlo con Docker, script, editor e servizi self-hosted. È particolarmente adatto a chi vuole collegare il modello a Open WebUI, a un bot o a un’applicazione che usa API.

LM Studio è preferibile se si desidera un’interfaccia grafica per cercare modelli, scaricare file GGUF, confrontare quantizzazioni e controllare in modo visuale l’offload dei layer alla GPU. È utile soprattutto per testare lo stesso prompt su più modelli prima di scegliere quello da usare stabilmente.

Entrambi permettono l’inferenza CPU-only, ma una GPU riduce drasticamente la latenza. LM Studio indica 16 GB di RAM e 4 GB di VRAM come requisito generale minimo; nella pratica questa è una soglia per modelli piccoli e contesto limitato, non una garanzia per qualunque LLM moderno.

Qwen3.8 27B: il miglior LLM locale completo

Qwen3.8 27B è la novità più importante da inserire in una guida agli LLM locali aggiornata. È un modello dense da 27B parametri, disponibile in Ollama in un pacchetto da circa 18 GB, con finestra di contesto da 256K e input di testo e immagini.

Rispetto alle generazioni Qwen precedenti, Qwen3.8 punta esplicitamente su coding, ricerca, lavoro professionale e task agentici di lunga durata. Integra il controllo del ragionamento: la modalità thinking è attiva di default, ma può essere disabilitata o regolata quando si preferiscono risposte più brevi, rapide ed economiche in memoria.

È il miglior candidato per chi vuole un solo modello di qualità su una workstation locale: può riassumere documenti, generare o analizzare codice, interpretare immagini e lavorare con tool calling. Una quantizzazione Q4 rende plausibile l’avvio con 32 GB di RAM, ma per velocità interattiva e contesti ampi è consigliabile una GPU con 24 GB di VRAM.

Nota su Qwen3.8-Flash-Next: è un’interessante anteprima open-weight dell’architettura che anticipa Qwen4, multimodale e MoE, ma ha 125B parametri principali più 51B di embedding n-gram. Non è quindi una scelta realistica per il PC consumer, anche se attiva soltanto 6B parametri per token. Va citato come novità tecnica, non consigliato come LLM locale per la maggior parte degli utenti.

Gemma 4: la famiglia da preferire a Gemma 3

Gemma 4 sostituisce Gemma 3 in questa classifica. La nuova famiglia è open-weight, supporta nativamente testo e immagini, aggiunge audio sulle versioni E2B ed E4B, include modalità thinking configurabile e function calling. In Ollama sono disponibili le varianti E2B, E4B, 12B, 26B e 31B.

Variante Gemma 4 Quando sceglierla Contesto e modalità Comando Ollama
E2B Dispositivi edge, mini PC e notebook con RAM limitata. 128K; testo, immagini e audio. ollama run gemma4:e2b
E4B Scelta consigliata per PC comuni: ottimo compromesso fra dimensione e capacità moderne. 128K; testo, immagini e audio. ollama run gemma4:e4b
12B Qualità più alta con una GPU da 12-16 GB o un buon sistema con 32 GB di RAM. 256K; testo e immagini. ollama run gemma4:12b
26B A4B Workstation: modello MoE adatto a reasoning, coding e agenti senza il costo computazionale di un 26B denso. 256K; testo e immagini. ollama run gemma4:26b
31B Massima qualità Gemma locale per chi dispone di molta VRAM o memoria unificata. 256K; testo e immagini. ollama run gemma4:31b

La sigla E significa effective parameters: E2B ed E4B sono progettati per dispositivi edge e non sono semplicemente versioni ridotte dei classici modelli dense. Gemma 4 26B A4B è invece un Mixture-of-Experts: ha 25,2B parametri totali, ma ne attiva 3,8B per token. Questo migliora l’efficienza di calcolo, ma non elimina il fabbisogno di memoria necessario a conservare tutti i pesi.

LFM2.5: il nuovo modello per assistenti personali

LFM2.5 8B-A1B di Liquid AI è una delle novità più interessanti per chi desidera un assistente locale anziché un generico chatbot. È una famiglia di modelli ibridi progettata per l’esecuzione on-device, il rispetto delle istruzioni e il concatenamento affidabile di chiamate a strumenti.

Il modello Ollama occupa circa 5,2 GB ed espone un contesto da 125K. È una scelta concreta per automazioni personali, assistenti che chiamano API locali, gestione di task e applicazioni self-hosted: scenari in cui velocità, affidabilità nel tool calling e consumi contano più della qualità massima nella scrittura creativa.

Per PC veramente modesti esiste anche LFM2.5 2.6B, rilasciato nell’agosto 2026 e pensato per agenti locali compatti. Per un desktop o notebook con almeno 16 GB di RAM, però, l’8B-A1B offre un margine qualitativo più interessante senza diventare pesante quanto un 20B-30B.

gpt-oss e Devstral per reasoning e coding

gpt-oss 20B resta una scelta attuale, nonostante non sia una novità del 2026. È un modello open-weight di OpenAI orientato a reasoning, task agentici e casi d’uso da sviluppatore. Il pacchetto Ollama pesa circa 14 GB e offre un contesto da 128K; è una buona alternativa quando servono risposta ragionata e uso di strumenti su una GPU da 16 GB, meglio ancora da 24 GB.

Devstral 24B va invece scelto quando la priorità è il coding agentico. È stato progettato per esplorare codebase, usare tool, modificare più file e alimentare agenti per software engineering. Non è necessariamente il miglior chatbot generalista, ma è più mirato di molti modelli universali per repository reali, terminale e IDE agentici.

DeepSeek-R1 può restare installato se già funziona bene nel proprio stack, soprattutto nella revisione R1-0528 da 8B basata su Qwen3. Tuttavia, in una nuova installazione conviene iniziare da Qwen3.8, Gemma 4 o gpt-oss: sono le famiglie più aggiornate nella libreria Ollama e offrono capacità più moderne per visione, agenti o tool calling.

Quanta RAM e VRAM servono per un LLM locale?

Le stime seguenti si riferiscono a modelli quantizzati, in genere GGUF Q4 o pacchetti Ollama equivalenti. Sono indicative: il consumo reale aumenta se si abilita un contesto molto lungo, l’analisi delle immagini, la KV cache sulla GPU o se sono in esecuzione altre applicazioni. La regola più sicura è non riempire completamente RAM o VRAM.

Fascia Modelli aggiornati RAM consigliata VRAM consigliata Uso reale
2B-4B effettivi Gemma 4 E2B, Gemma 4 E4B, LFM2.5 2.6B 16 GB 4-8 GB; facoltativa per l’uso CPU Notebook, mini PC, assistenti semplici, testo breve, immagini/audio con Gemma 4.
8B LFM2.5 8B-A1B 16 GB, 24 GB più comodi 6-8 GB Assistente personale, tool calling, automazioni locali e API.
12B Gemma 4 12B 24-32 GB 12-16 GB Chat e documenti più complessi, vision e contesto lungo con minori compromessi.
20B-27B gpt-oss 20B, Gemma 4 26B A4B, Qwen3.8 27B, Devstral 24B 32 GB; 64 GB consigliati se si usa molto offload CPU 16 GB minimo pratico; 24 GB consigliati Workstation, coding, reasoning, agenti e analisi avanzata.
31B e oltre Gemma 4 31B, Qwen3.8-Flash-Next e modelli di classe server 64 GB o più 24 GB per 31B Q4; molto di più per i grandi MoE Workstation potenti e server. Flash-Next non è adatto a un PC consumer.

Se il modello non entra interamente nella VRAM, Ollama e LM Studio possono trasferire una parte dei layer in RAM. Il modello parte comunque, ma la velocità può calare molto. Inoltre, un file del modello da 18 GB non equivale a 18 GB di VRAM necessari: bisogna considerare cache, buffer, contesto e memoria usata dal sistema.

Quale LLM locale scegliere in base al PC?

  • PC senza GPU e 16 GB di RAM: Gemma 4 E2B oppure LFM2.5 2.6B. Se la CPU è valida, si può provare anche Gemma 4 E4B, accettando una velocità minore.
  • Notebook con 16 GB di RAM e GPU da 6-8 GB: Gemma 4 E4B per un assistente multimodale; LFM2.5 8B-A1B se si vogliono tool, API e automazioni.
  • Desktop con 32 GB di RAM e GPU da 12-16 GB: Gemma 4 12B oppure gpt-oss 20B con offload parziale; è una buona fascia per uso avanzato senza workstation estrema.
  • GPU NVIDIA da 24 GB, come RTX 3090/4090/5090: Qwen3.8 27B è la scelta più completa; Devstral 24B è da preferire per coding agentico; Gemma 4 26B A4B è un’alternativa multimodale MoE molto efficiente.
  • Mac con 32 GB o più di memoria unificata: i 20B-27B quantizzati sono una classe realistica; usare le varianti MLX quando disponibili in Ollama o LM Studio.

Domande frequenti sugli LLM locali

Qual è il miglior LLM locale da usare nel 2026?

Per un computer potente, Qwen3.8 27B è il modello più completo della selezione grazie a reasoning, vision, tool use e coding. Su un PC comune la scelta più equilibrata è Gemma 4 E4B, mentre LFM2.5 8B-A1B è particolarmente adatto a un assistente personale e alle automazioni locali.

Qwen3.8 si può eseguire in locale?

Sì. Qwen3.8 27B è disponibile in Ollama con il comando ollama run qwen3.8; il pacchetto indicato nel catalogo pesa circa 18 GB e supporta testo, immagini e 256K di contesto. Per un uso fluido è preferibile una GPU da 24 GB, anche se una configurazione con 32 GB di RAM e offload può avviarlo più lentamente.

Gemma 4 è migliore di Gemma 3?

Per una nuova installazione conviene scegliere Gemma 4: offre le varianti edge E2B ed E4B, modelli fino a 31B, contesto fino a 256K, reasoning configurabile, function calling e funzioni multimodali aggiornate. Gemma 3 resta utilizzabile, ma non è più il riferimento principale in questa fascia.

Posso usare questi modelli senza GPU dedicata?

Sì, ma bisogna privilegiare Gemma 4 E2B/E4B e LFM2.5 2.6B o 8B quantizzati e limitare il contesto. Per modelli da 20B-27B il solo uso CPU è possibile con molta RAM, ma raramente risulta abbastanza veloce per una chat interattiva o un agente di coding.

Meglio Ollama o LM Studio?

Ollama è la soluzione migliore per terminale, API, Docker e servizi self-hosted. LM Studio è più adatto a chi vuole una GUI, catalogo visuale, file GGUF e controllo diretto dell’offload alla GPU. Entrambi sono validi: la scelta dipende soprattutto dal workflow, non dalla qualità del modello.

In conclusione: non conviene più limitarsi a una classifica per numero di parametri. Nel 2026 è più utile scegliere un modello recente in base allo scenario: Gemma 4 per efficienza e multimodalità, LFM2.5 per assistenti e tool calling, Qwen3.8 per un modello locale completo, Devstral per coding agentico e gpt-oss per reasoning e sviluppo. Provare gli stessi prompt reali su due o tre modelli resta il modo migliore per scegliere quello adatto al proprio hardware.

Articolo aggiornato il 16 settembre 2026

Rispondi