LM Studio vs Ollama: quale scegliere per gli LLM in locale
Confronta LM Studio e Ollama per gli LLM in locale: API, app desktop, GPU, privacy, licenze per il lavoro e costi del software e dei piani cloud.
Pubblicato il

Scegli Ollama per un’API locale gestita da sviluppatori e LM Studio per un ambiente desktop in cui cercare, configurare e usare i modelli in chat. Con entrambi, il software per eseguire i modelli in locale costa $0. Nel confronto LM Studio vs Ollama, la scelta dipende dal flusso di lavoro e dai permessi d’uso; per chi sviluppa applicazioni, anche il supporto alle API con stato può cambiare la decisione.
Prezzi, condizioni d’uso professionale e funzionalità verificati sulle pagine ufficiali dei produttori l’11 ottobre 2026. Il confronto si basa sulla documentazione, senza benchmark di velocità eseguiti direttamente. Il costo del software locale è confermato dalle pagine dei prezzi di Ollama e LM Studio.
LM Studio vs Ollama: quale scegliere?
Scegli Ollama quando sono applicazioni e agenti a interrogare il modello. Scegli LM Studio quando le persone lavorano direttamente in un’app desktop. Entrambi possono esporre un’API, l’interfaccia attraverso cui un’applicazione richiede una risposta al modello. Entrambi hanno anche un’interfaccia grafica: ridurre la scelta a «terminale o desktop» non basta.
Per chi sviluppa un classificatore di documenti interni, il backend di un agente di programmazione o un’automazione pianificata, Ollama è la scelta di partenza. La procedura documentata per configurarlo come servizio e la licenza MIT lo rendono un componente semplice da gestire in autonomia. Il limite: l’applicazione che lo usa, i controlli di accesso e le verifiche operative restano a carico tuo.
Per un piccolo team che vuole esplorare modelli, affinare i prompt e lavorare su documenti locali, LM Studio è il punto di partenza migliore. Il suo ambiente desktop riunisce ricerca dei modelli, impostazioni, chat e interazione con i documenti. Il limite: la licenza dell’app consente l’uso aziendale interno, ma pone restrizioni a diverse forme di ridistribuzione del software o di offerta a terzi come servizio.
La scelta si sposta verso LM Studio se l’applicazione dipende da chiamate Responses con stato, che permettono al server di proseguire una conversazione usando l’ID di una risposta precedente. Ollama documenta invece esplicitamente un supporto a Responses senza stato. Questa differenza può pesare più della raccomandazione generale per gli sviluppatori.
I relativi limiti sono descritti nella guida alla compatibilità delle API di Ollama, nella guida ad app e daemon di LM Studio e nelle licenze esaminate più avanti.
Uso desktop: LM Studio è più adatto al lavoro diretto con i modelli
LM Studio, un’applicazione desktop per scaricare ed eseguire modelli locali, è la scelta migliore quando occorre controllare e modificare la configurazione dei modelli durante la giornata. Permette di cercare modelli su Hugging Face, il servizio che li ospita, configurare impostazioni e preset, conversare in chat e usare documenti locali come contesto. Per lavorare sui documenti usa la retrieval-augmented generation, o RAG: recupera i contenuti pertinenti da cui il modello può ricavare la risposta. Queste funzionalità sono descritte nella guida all’app LM Studio.
Per un analista che esamina specifiche interne o uno sviluppatore che confronta le impostazioni dei prompt, un ambiente grafico riduce il numero di componenti software da mettere insieme. Sceglilo per questo tipo di lavoro. Un’app desktop per esplorare i modelli non fornisce, da sola, autenticazione, interfaccia utente e monitoraggio per la futura applicazione aziendale.
Anche Ollama, un software per eseguire modelli locali dotato di riga di comando e server HTTP, ha una propria app di chat. La sua app per macOS e Windows permette di scaricare modelli, conversare e aggiungere file trascinandoli nella finestra. Se la tua configurazione Ollama funziona, non devi sostituirla solo per avere una chat con interfaccia grafica.
Vince LM Studio come ambiente desktop per lavorare con i modelli. Rimani con Ollama se la sua chat copre già le tue esigenze e le integrazioni con le applicazioni sono stabili.
API locali e server senza interfaccia grafica: conta il comportamento delle API
Ollama è la scelta di partenza per un servizio gestito da sviluppatori; LM Studio prevale quando la sua API con stato semplifica il lavoro dell’applicazione. Entrambi possono funzionare in modalità headless, cioè senza tenere aperta un’interfaccia desktop.
Ollama espone l’API nativa su http://localhost:11434/api. L’URL di base compatibile con OpenAI è http://localhost:11434/v1. Per LM Studio, l’URL di base compatibile è http://localhost:1234/v1, mentre l’API nativa usa /api/v1/*. Entrambi documentano endpoint per chat completions, embedding, elenco dei modelli e Responses. Vedi l’introduzione alle API di Ollama e l’elenco di compatibilità di LM Studio.
Il formato comune delle richieste può facilitare l’adattamento dei client. Non rende però i server intercambiabili:
- Responses in Ollama è senza stato. Il produttore dichiara che
previous_response_ideconversationnon sono supportati. L’applicazione deve inviare la cronologia necessaria. Riferimento sulla compatibilità di Ollama. - LM Studio permette di proseguire le conversazioni con Responses mantenendo lo stato, tramite
previous_response_id. È utile per un assistente interno il cui client non debba ricostruire la conversazione a ogni turno. Riferimento su Responses in LM Studio. - In LM Studio, la chat nativa e quella compatibile hanno funzionalità diverse. La tabella delle funzionalità indica il supporto agli strumenti personalizzati su
/v1/responsese/v1/chat/completions, ma non sull’endpoint nativo/api/v1/chat. Scegliere l’endpoint nativo solo perché sembra più completo può compromettere l’integrazione di un agente. Confronto delle funzionalità dell’API nativa.
Anche la capacità di chiamare strumenti dipende dal modello. Il fatto che un endpoint accetti lo schema di uno strumento non dimostra che il modello scelto sappia usarlo in modo affidabile.
Per Ollama, la guida Linux documenta ollama serve e la configurazione di un servizio all’avvio. Per LM Studio, llmster è un daemon indipendente: non occorre lasciare aperta l’app desktop. La guida all’installazione per sviluppatori fornisce programmi di installazione per macOS/Linux e Windows.
Avvia il servizio adatto al tuo flusso di lavoro
Con Ollama, avvia il server installato con
ollama serve, se non è già in esecuzione. Nell’installazione headless di LM Studio, avvia il daemon conlms daemon up.Scarica e carica un modello adatto
La guida rapida di Ollama usa
ollama run gemma4:e2b. LM Studio documentalms get openai/gpt-oss-20b, seguito dalms load openai/gpt-oss-20b. Sono esempi dei produttori: non significano che quei modelli siano adatti a qualsiasi macchina o che rappresentino carichi di lavoro equivalenti.Collega l’applicazione all’endpoint previsto
Per LM Studio, esegui
lms server start. Imposta nel client compatibile della tua applicazione l’URL di base/v1corretto e seleziona l’identificativo del modello esposto dal server. Prima di sostituire il backend, verifica le specifiche funzionalità API usate dall’applicazione.
I comandi dei modelli provengono dalla guida rapida di Ollama e dalla guida al daemon di LM Studio.
Installazione e formati dei modelli: parti dalla macchina
Ollama è preferibile per installare un servizio dal terminale; LM Studio per una configurazione desktop guidata. Entrambi supportano macOS, Windows e Linux, ma i requisiti non sono identici.
Su macOS, Ollama si installa da un’immagine disco trascinando l’app in Applicazioni. Per Windows è disponibile un programma di installazione nativo; la documentazione richiede Windows 10 22H2 o successivo. Per Linux sono disponibili pacchetti x86-64 e ARM64, oltre a questo comando di installazione documentato:
curl -fsSL https://ollama.com/install.sh | shFonti: Ollama per macOS, Windows e Linux.
LM Studio offre download per ogni piattaforma desktop; su Linux è distribuito come AppImage. La pagina dei requisiti hardware elenca Windows x64 e ARM, oltre a Linux x64 e ARM64; su Windows x64 sono richieste le istruzioni CPU AVX2. Per l’uso headless su macOS/Linux, il comando di installazione separato è:
curl -fsSL https://lmstudio.ai/install.sh | bashQuesti comandi scaricano ed eseguono lo script di installazione del rispettivo produttore. LM Studio documenta anche un programma di installazione per Windows PowerShell nella guida per sviluppatori; prima di installarlo, consulta i requisiti di sistema per la macchina specifica.
GGUF è il formato comune per passare da un software all’altro: racchiude il modello in un file utilizzato dai motori di inferenza locali. Ollama documenta l’importazione di pesi GGUF e Safetensors tramite un Modelfile, il suo file di configurazione del modello. LM Studio esegue i modelli GGUF compatibili attraverso il motore di inferenza llama.cpp e supporta i modelli MLX su Apple Silicon. MLX è il framework di Apple per il machine learning. Nessuna di queste estensioni di file garantisce il supporto a tutte le architetture di modello. Guida all’importazione in Ollama; formati dei modelli in LM Studio.
Ollama vs LM Studio su Mac: Apple Silicon o Intel?
LM Studio è preferibile per esplorare GGUF e MLX su un Mac con Apple Silicon. Su un Mac Intel, tra i due, la scelta supportata è Ollama. Entrambi i produttori richiedono macOS 14 o successivo; Ollama documenta il supporto Intel/x86 con esecuzione solo su CPU, mentre LM Studio esclude esplicitamente i Mac Intel. LM Studio raccomanda almeno 16 GB di RAM, precisando che modelli più piccoli e un contesto limitato possono funzionare su Mac con 8 GB. Sono requisiti dell’app, non una garanzia che la memoria basti per il modello scelto. Requisiti Mac di Ollama; requisiti di LM Studio.
Supporto GPU: verifica il backend, oltre alla marca
Scegli il software che supporta la GPU e il modello che hai già. Ollama documenta il supporto a NVIDIA, a determinate GPU AMD tramite ROCm, alle GPU Apple tramite Metal e ad altro hardware su Windows/Linux tramite Vulkan. La pagina sull’hardware riporta i requisiti relativi a schede e driver.
LM Studio documenta il supporto NVIDIA CUDA e AMD ROCm/Vulkan nelle note di rilascio, insieme ai controlli grafici per più GPU. Alcuni controlli dipendono dall’hardware. Anche una GPU supportata deve avere memoria sufficiente per il modello e per il suo contesto di lavoro, cioè il materiale della conversazione che mantiene mentre risponde.
LM Studio vince per la configurazione tramite interfaccia grafica; sull’hardware non c’è un vincitore universale. In Ollama, ollama ps indica se un modello caricato occupa memoria CPU, memoria GPU o entrambe. Controllalo prima di attribuire al software la lentezza delle risposte.
Licenze per uso professionale: Ollama offre più libertà
Entrambi si possono usare per il lavoro interno senza acquistare un abbonamento al software locale. Cambiano i diritti di ridistribuzione.
Il repository di Ollama usa la licenza MIT. Consente uso commerciale, modifica, distribuzione e vendita, a condizione di conservare l’avviso di copyright e la dichiarazione di autorizzazione richiesti. Per questo è la scelta di partenza più solida se potresti dover integrare il software in un prodotto o controllare l’implementazione di un servizio.
LM Studio ha eliminato l’obbligo di una licenza separata per uso professionale nel luglio 2025. Le condizioni attuali dell’app, datate 23 agosto 2026, consentono l’uso personale e aziendale interno. In base a queste condizioni, l’azienda può usare l’app per i flussi di lavoro privati dei dipendenti.
L’uso aziendale interno non equivale a un’autorizzazione generale a rivendere il software come servizio. Le condizioni dell’app LM Studio limitano ridistribuzione, sublicenza, uso come service bureau, come application service provider e come SaaS. Se l’impiego previsto va oltre il lavoro interno, verifica di avere l’autorizzazione per quel tipo di utilizzo prima di basarti sull’annuncio della gratuità per uso professionale.
Per una piccola agenzia che prepara specifiche interne, il permesso d’uso professionale di LM Studio copre il caso pertinente. Per uno sviluppatore che deve decidere come integrare l’inferenza in un software venduto ai clienti, Ollama vince per flessibilità della licenza.
Con entrambi, il modello ha una licenza propria. La gratuità del software che lo esegue non elimina le restrizioni specifiche del modello: verificane separatamente le condizioni.
Costi: parità per gli LLM in locale, cloud facoltativo a parte
Il costo del software locale è identico: $0. Non esiste una soglia di utenti o token oltre la quale una delle due licenze locali diventa più economica. Le pagine dei prezzi attuali includono entrambe l’uso gratuito dei modelli locali. Prezzi di Ollama; prezzi di LM Studio.
Per un esempio concreto a parità di carico, immaginiamo cinque sviluppatori che elaborano un milione di token al mese ciascuno su macchine già disponibili e adeguate, con modelli senza costi di licenza separati. Il gruppo elabora quindi cinque milioni di token. Con entrambi i software:
- Costo mensile del software locale: 5 × $0 = $0.
- Costo del software per utente al mese: $0.
- Costo del software per 1,000 token elaborati in locale: $0.
Questi calcoli riguardano il software: la capacità di calcolo non diventa gratuita. Nel budget restano eventuali acquisti di hardware, elettricità, configurazione, manutenzione e licenze dei modelli. Poiché nessuno dei due software richiede un abbonamento per quel carico di lavoro, è più utile confrontare il tempo necessario a gestire il flusso di lavoro che inventare un vantaggio sul prezzo per token.
Piani cloud facoltativi: prezzi verificati l’11 ottobre 2026
Ollama propone Free a $0, Pro a $20/mese o $200/anno, Max a $100/mese e Team in accesso anticipato a $500/mese. I crediti mensili inclusi nei piani a pagamento sono rispettivamente $60 per Pro, $300 per Max e $1,000 condivisi per Team; Team consente un numero illimitato di utenti. Enterprise ha un prezzo personalizzato. Sono piani cloud, non licenze necessarie per eseguire modelli in locale. Piani attuali di Ollama.
Anche la pagina dei prezzi di LM Studio ora elenca abbonamenti cloud facoltativi: Bionic+ a $20/mese e Pro a $100/mese, accanto a Free a $0 per i modelli locali. Presenta la fatturazione centralizzata dei crediti di inferenza per i team, mentre gli abbonamenti per team sono ancora annunciati come in arrivo. Piani attuali di LM Studio/Bionic.
Abbonamenti allo stesso prezzo non garantiscono la stessa convenienza nell’inferenza. La pagina pubblica di LM Studio non fornisce dati sufficienti sull’utilizzo incluso e sulle tariffe degli stessi modelli per calcolare in modo attendibile a quale soglia il suo cloud convenga rispetto a Ollama. Per questa scelta, che riguarda l’uso privato sulle proprie macchine, escludi entrambi i costi cloud dal confronto di base. La guida ai prezzi di Ollama approfondisce la scelta tra i piani.
Dati privati: mantieni locale il percorso di inferenza
Un URL localhost non dimostra che il modello venga eseguito sulla tua macchina. Dopo l’accesso all’account, il server locale di Ollama può usare anche modelli cloud. Per un’installazione locale destinata a dati privati, seleziona modelli scaricati sulla macchina e disattiva le funzionalità cloud di Ollama con OLLAMA_NO_CLOUD=1, oppure con l’impostazione documentata disable_ollama_cloud, quindi riavvia. Istruzioni di Ollama per il funzionamento solo in locale.

LM Studio documenta il funzionamento offline per i modelli scaricati, l’elaborazione dei documenti e il server locale. Ricerca dei modelli, download, installazione dei runtime e controlli degli aggiornamenti possono usare internet. Le funzionalità cloud facoltative e gli eventuali strumenti esterni costituiscono percorsi separati da valutare quando il lavoro deve restare sulle proprie macchine. Funzionamento offline di LM Studio.
Per l’accesso condiviso, un’altra differenza pratica riguarda l’autenticazione. Negli esempi di compatibilità locale di Ollama, il valore della chiave API fornita viene ignorato: non è una password che protegge il server. LM Studio offre l’autenticazione tramite token API, ma è disattivata per impostazione predefinita e va abilitata nelle impostazioni del server. Comportamento del client Ollama; autenticazione di LM Studio.
LM Studio vince per i controlli integrati tramite token; entrambi possono gestire flussi di lavoro locali. Prima di condividere uno dei due sulla rete dell’ufficio, configura gli accessi in modo consapevole. Una richiesta riuscita dal tuo portatile non basta a dimostrare che il servizio condiviso sia pronto a gestire i dati privati del team.
Ollama vs LM Studio: chi offre le prestazioni migliori?
Le fonti usate qui non permettono di assegnare a nessuno dei due il primato di velocità. Per confrontarli servono la stessa macchina, lo stesso file del modello, la stessa quantizzazione, lunghezza del contesto, allocazione GPU e lo stesso carico di richieste. La quantizzazione memorizza i pesi del modello con una precisione ridotta: modificarla cambia il confronto, non soltanto un’impostazione del download.
Nelle tue verifiche, separa il tempo di caricamento del modello da quello di generazione delle risposte. Poi confronta il tempo necessario a ottenere il primo output utile, la qualità delle risposte, l’uso della memoria e il comportamento quando più colleghi inviano richieste contemporaneamente. Un modello rapido in una breve chat può comunque essere poco adatto a un agente che deve gestire una lunga cronologia del repository.
Scegli prima il software in base al flusso di lavoro, poi verifica un modello adatto. La nostra pagina sui migliori modelli di AI locale per programmare include ora Mellum2.1 e distingue i file dei modelli dai requisiti hardware. Cambiare soltanto il software di esecuzione non trasforma un modello inadatto in un assistente di programmazione migliore.
LM Studio vs Ollama: quando conviene cambiare?
Cambia quando un limite documentato ostacola il tuo lavoro. Mantieni una configurazione stabile se l’unico vantaggio è un’interfaccia diversa.
LM Studio è un’alternativa a Ollama quando servono il suo ambiente di lavoro con i modelli, il supporto MLX su Mac o Responses con stato. Ollama è un’alternativa a LM Studio quando sono decisivi il controllo del servizio o la licenza MIT. Puoi tenere LM Studio per esplorare i modelli e gestire al contempo un servizio Ollama, ma un piccolo team dovrebbe mantenerli entrambi solo se questa divisione fa risparmiare abbastanza lavoro.

Parti dal file esatto del modello. Ollama supporta l’importazione GGUF tramite un Modelfile; LM Studio supporta file GGUF esterni compatibili tramite lms import. Questo può ridurre i download, ma non garantisce il trasferimento automatico degli archivi di modelli gestiti dai due software o delle cronologie delle chat. Importazione in Ollama; importazione in LM Studio.
Trasferisci poi il prompt di sistema, le impostazioni del contesto, le scelte di campionamento e le definizioni degli strumenti. Aggiorna l’URL di base del client e l’identificativo del modello. Ricontrolla lo streaming, le risposte strutturate e le chiamate agli strumenti usate dall’applicazione. Un’app che usa l’endpoint nativo /api/chat di Ollama non si migra cambiando soltanto la porta con quella predefinita di LM Studio.
Se usavi ID di risposta memorizzati in LM Studio, prima di passare a Ollama pianifica come l’applicazione conserverà e invierà di nuovo la cronologia della conversazione. Non cambiare solo per avere il funzionamento headless o per evitare un presunto costo di licenza commerciale: LM Studio supporta già un daemon autonomo e l’uso interno gratuito.
Se nessuno dei due software è adatto all’installazione prevista, la guida alle alternative a Ollama esamina un ventaglio più ampio di opzioni.
Domande frequenti
È meglio LM Studio o Ollama?
Ollama è la scelta di partenza più solida per un servizio gestito da sviluppatori e per chi cerca ampia libertà nella licenza software. LM Studio è più adatto come ambiente desktop per lavorare con i modelli; il supporto a Responses con stato può renderlo anche il backend migliore per alcune applicazioni interne.
Vale la pena pagare per Ollama?
Valuta un piano a pagamento solo se ti interessa l’offerta cloud. L’uso dei modelli locali non richiede Pro, Max o Team. Per il lavoro che deve essere eseguito sulle tue macchine, questi piani non offrono vantaggi nel confronto dei costi del software locale.
Ollama esegue i modelli di AI in locale?
Sì, quando selezioni un modello locale già scaricato. Ollama offre anche modelli cloud: controlla quindi il modello selezionato e usa l’impostazione documentata per il funzionamento solo in locale quando l’inferenza remota non rientra nel tuo flusso di lavoro.
Ollama può funzionare sulla CPU?
Sì. Non è necessario eseguire tutto sulla GPU. Usa ollama ps per controllare come il modello caricato è distribuito tra CPU e GPU; scegli modello e contesto in base alla macchina.
Perché Ollama non usa la GPU?
Confronta la scheda specifica, il sistema operativo, il driver e il backend con la documentazione hardware di Ollama. Poi controlla ollama ps e i log del server. La presenza di una GPU non dimostra che il backend supportato l’abbia rilevata o che l’intero modello entri nella sua memoria.
Usa la checklist per valutare i flussi di lavoro aziendali con l’AI per scegliere il primo flusso di lavoro privato che vale la pena trasferire sulle tue macchine, e iscriviti alla newsletter per seguire le successive novità sugli strumenti.
- Pubblicato
- Categoria
- Build
- Lingua







