Far girare un modello di IA in locale con LM Studio
Installare LM Studio, scegliere il modello giusto per la memoria che hai e usarlo senza inviare nulla online: requisiti, quantizzazione e primi passi.

In questa pagina
Aspettative giuste. I modelli che girano su un computer di casa sono meno capaci di quelli dei grandi servizi online. Per riassumere, riformulare, classificare, tradurre e ragionare sui tuoi documenti vanno benissimo; sui compiti complessi la differenza con ChatGPT o Claude si sente.
Da luglio 2025 LM Studio è gratuito anche per uso aziendale, senza licenze da chiedere.
Requisiti #
| Sistema | Requisiti |
|---|---|
| macOS | Solo Apple Silicon, macOS 14 o successivo, consigliati 16 GB di memoria |
| Windows | x64 con istruzioni AVX2 oppure ARM, consigliati 16 GB di memoria e 4 GB di memoria video |
| Linux | Ubuntu 20.04 o successivo, distribuito come AppImage per x64 e ARM64 |
Con 8 GB di memoria funziona, ma solo con i modelli più piccoli. Il salto arriva a 16 GB, e con 32 GB puoi usare quasi tutto quello che ha senso su un computer personale.
Sui Mac con chip Apple la memoria è condivisa fra processore e grafica, ed è un bel vantaggio: un Mac con 32 GB carica modelli che su un PC vorrebbero una scheda video di fascia alta. LM Studio sul Mac usa anche i modelli in formato MLX, ottimizzati per quei chip e di solito più veloci. Su PC, con una scheda NVIDIA, tieni aggiornati i driver.
Quanta memoria serve per quale modello #
È la domanda che conta, e la risposta dipende dalla quantizzazione: una tecnica che riduce la precisione dei numeri dentro il modello, così pesa molto meno in cambio di un piccolo calo di qualità.
Un modello si indica con il numero di parametri (7B, 14B, 32B, dove B sta per miliardi) e con il livello di quantizzazione, spesso scritto come Q4_K_M o simili. Più è basso il numero dopo la Q, più il file è leggero e più la qualità cala.
Come riferimento pratico:
| Modello | File quantizzato a 4 bit | Memoria consigliata |
|---|---|---|
| 3B | circa 2 GB | 8 GB |
| 7-8B | circa 4-5 GB | 16 GB |
| 14B | circa 8-9 GB | 16-24 GB |
| 32B | circa 18-20 GB | 32 GB |
| 70B | circa 40 GB | 64 GB o più |
La regola spiccia: guarda quanto pesa il file e aggiungi qualche gigabyte per il contesto e per il sistema operativo. Se la somma supera la memoria che hai, il modello gira lo stesso ma molto più piano, perché una parte del lavoro passa sul processore o sul disco.
Installazione e primo modello #
Scarica il programma dal sito ufficiale di LM Studio nella versione per il tuo sistema e installalo come qualsiasi altra app.
Al primo avvio ti propone un modello da scaricare. Accetta, oppure cercane uno specifico con la lente nella barra laterale.
Nei risultati ogni variante mostra quanto pesa e se è compatibile con il tuo hardware. Scegline una che stia nella tua memoria.
Finito il download, apri la chat, carica il modello dal menu in alto e scrivi.
Il primo caricamento dura qualche decina di secondi, perché il modello viene letto in memoria. Poi le risposte partono subito.

Le impostazioni che contano #
Quando carichi un modello trovi alcuni parametri. Quelli da toccare sono tre.
Lunghezza del contesto. Decide quanto testo il modello può tenere a mente. Alzarla ti fa lavorare su documenti lunghi, ma consuma molta più memoria: è il parametro che causa più spesso gli errori di caricamento.
Scaricamento sulla GPU. Decide quanta parte del modello va sulla scheda video. Con una scheda dedicata, portalo al massimo che la memoria video permette: le risposte diventano molto più veloci.
Temperatura. Regola quanto sono prevedibili le risposte: valori bassi per compiti precisi come estrarre dati o classificare, più alti per la scrittura creativa.
Usarlo con i propri documenti #
La funzione più utile nella pratica è fare domande sui tuoi file: un contratto, un manuale, una raccolta di appunti. Trascini il PDF nella chat, il programma estrae il testo, lo divide e passa al modello i pezzi che servono per rispondere (è la tecnica chiamata RAG).

Va bene con documenti di dimensioni normali e domande precise. Con archivi enormi o domande che devono collegare informazioni sparse in punti lontani, i limiti si vedono.
Per certi usi però il vantaggio è decisivo: niente esce dal computer, quindi puoi analizzare documenti che non caricheresti mai su un servizio esterno.
Il server locale #
LM Studio può far girare il modello come servizio sul tuo computer, compatibile con le API di OpenAI, di solito all’indirizzo http://localhost:1234/v1. Vuol dire che programmi e script scritti per i servizi online possono usare il modello locale cambiando solo l’indirizzo. Dal terminale lo gestisci anche con il comando lms.

Interessa soprattutto a chi sviluppa: provi un’applicazione senza consumare crediti e senza mandare dati fuori.
Le alternative #
Ollama fa lo stesso lavoro partendo dalla riga di comando (ollama run qwen3), ed è più adatto a chi lavora nel terminale o vuole integrarlo in script e servizi. Oggi ha anche una sua app con la chat, e si abbina a interfacce come Open WebUI.
Msty, a cui era dedicata la prima versione di questo articolo, oggi si chiama Msty Studio: ha un’interfaccia molto curata, mette nella stessa finestra modelli locali e servizi online con le tue chiavi API, e ha gli Stack di conoscenza per interrogare i tuoi documenti e le chat divise per confrontare le risposte di più modelli. Si parte gratis, con una licenza a pagamento per le funzioni avanzate.

Le soluzioni integrate nel sistema, come i modelli di Apple Intelligence sui dispositivi Apple o quelli dei PC Copilot+ con un acceleratore dedicato, ti danno meno scelta ma non devi installare niente.
GPT4All e progetti simili offrono un’esperienza vicina a quella di LM Studio, con cataloghi e impostazioni differenti.
Domande frequenti #
Funziona anche senza connessione a internet? #
Sì, dopo aver scaricato il modello. La connessione serve solo per il catalogo e gli aggiornamenti. È proprio per questo che interessa a chi lavora con documenti riservati.
Quanto sono peggiori dei servizi online? #
Sui compiti circoscritti (riassumere, riformulare, tradurre, estrarre informazioni da un testo) un buon modello da 7-14 miliardi di parametri se la cava bene. Su ragionamenti lunghi, domande che richiedono molte conoscenze e codice complesso, la distanza dai modelli dei grandi servizi resta netta.
Serve una scheda video dedicata? #
No, ma aiuta molto. Senza, il modello gira sul processore e le risposte arrivano più piano, anche se con i modelli piccoli restano usabili. Sui Mac con chip Apple il problema non c’è, perché la memoria unificata fa quel lavoro.
I modelli sono gratuiti? #
Quelli con licenza aperta sì, e sono quasi tutti quelli del catalogo. Le licenze però cambiano da modello a modello: alcune (come quella di Llama) mettono condizioni sull’uso commerciale, altre (Qwen, Mistral, gpt-oss) sono Apache 2.0. Se il modello ti serve per lavoro, leggi la licenza.
Quanto spazio serve sul disco? #
Ogni modello occupa da un paio di gigabyte a diverse decine. Con quattro o cinque modelli arrivi in fretta a 50 GB: ogni tanto apri la sezione I miei modelli e togli quelli che non usi più.

