↓Salta al contenuto principale
Alemasone

Far girare un modello di IA in locale con LM Studio

Installare LM Studio, scegliere il modello giusto per la memoria che hai e usarlo senza inviare nulla online: requisiti, quantizzazione e primi passi.

7 min di lettura Aggiornato il
Interfaccia di LM Studio con un modello caricato e una conversazione in corso
In questa pagina
Se fai girare un modello linguistico sul tuo computer, i documenti non escono da lì e non paghi nessun abbonamento. LM Studio è il modo più semplice: lo installi, scegli un modello dal catalogo e cominci a scrivere. Il limite è la memoria: ti serve almeno tanta memoria quanto pesa il file del modello, più un margine.

Aspettative giuste. I modelli che girano su un computer di casa sono meno capaci di quelli dei grandi servizi online. Per riassumere, riformulare, classificare, tradurre e ragionare sui tuoi documenti vanno benissimo; sui compiti complessi la differenza con ChatGPT o Claude si sente.

Da luglio 2025 LM Studio è gratuito anche per uso aziendale, senza licenze da chiedere.

Requisiti #

SistemaRequisiti
macOSSolo Apple Silicon, macOS 14 o successivo, consigliati 16 GB di memoria
Windowsx64 con istruzioni AVX2 oppure ARM, consigliati 16 GB di memoria e 4 GB di memoria video
LinuxUbuntu 20.04 o successivo, distribuito come AppImage per x64 e ARM64

Con 8 GB di memoria funziona, ma solo con i modelli più piccoli. Il salto arriva a 16 GB, e con 32 GB puoi usare quasi tutto quello che ha senso su un computer personale.

Sui Mac con chip Apple la memoria è condivisa fra processore e grafica, ed è un bel vantaggio: un Mac con 32 GB carica modelli che su un PC vorrebbero una scheda video di fascia alta. LM Studio sul Mac usa anche i modelli in formato MLX, ottimizzati per quei chip e di solito più veloci. Su PC, con una scheda NVIDIA, tieni aggiornati i driver.

Quanta memoria serve per quale modello #

È la domanda che conta, e la risposta dipende dalla quantizzazione: una tecnica che riduce la precisione dei numeri dentro il modello, così pesa molto meno in cambio di un piccolo calo di qualità.

Un modello si indica con il numero di parametri (7B, 14B, 32B, dove B sta per miliardi) e con il livello di quantizzazione, spesso scritto come Q4_K_M o simili. Più è basso il numero dopo la Q, più il file è leggero e più la qualità cala.

Come riferimento pratico:

ModelloFile quantizzato a 4 bitMemoria consigliata
3Bcirca 2 GB8 GB
7-8Bcirca 4-5 GB16 GB
14Bcirca 8-9 GB16-24 GB
32Bcirca 18-20 GB32 GB
70Bcirca 40 GB64 GB o più

La regola spiccia: guarda quanto pesa il file e aggiungi qualche gigabyte per il contesto e per il sistema operativo. Se la somma supera la memoria che hai, il modello gira lo stesso ma molto più piano, perché una parte del lavoro passa sul processore o sul disco.

Da dove partire. Scegli un modello da 7-8 miliardi di parametri quantizzato a 4 bit, per esempio Qwen 3 8B, Llama 3.1 8B o Gemma 3 da 12B se hai 16 GB. Gira su quasi tutto, risponde a velocità ragionevole e basta per capire se questo modo di lavorare ti serve. Con 16 GB di memoria video o un Mac da 32 GB puoi provare anche gpt-oss 20B, il modello aperto di OpenAI.

Installazione e primo modello #

  1. Scarica il programma dal sito ufficiale di LM Studio nella versione per il tuo sistema e installalo come qualsiasi altra app.

  2. Al primo avvio ti propone un modello da scaricare. Accetta, oppure cercane uno specifico con la lente nella barra laterale.

  3. Nei risultati ogni variante mostra quanto pesa e se è compatibile con il tuo hardware. Scegline una che stia nella tua memoria.

  4. Finito il download, apri la chat, carica il modello dal menu in alto e scrivi.

Il primo caricamento dura qualche decina di secondi, perché il modello viene letto in memoria. Poi le risposte partono subito.

Ricerca dei modelli in LM Studio con l’elenco dei modelli e le opzioni di download della variante quantizzata
La ricerca segnala quali varianti rientrano nella memoria disponibile

Le impostazioni che contano #

Quando carichi un modello trovi alcuni parametri. Quelli da toccare sono tre.

Lunghezza del contesto. Decide quanto testo il modello può tenere a mente. Alzarla ti fa lavorare su documenti lunghi, ma consuma molta più memoria: è il parametro che causa più spesso gli errori di caricamento.

Scaricamento sulla GPU. Decide quanta parte del modello va sulla scheda video. Con una scheda dedicata, portalo al massimo che la memoria video permette: le risposte diventano molto più veloci.

Temperatura. Regola quanto sono prevedibili le risposte: valori bassi per compiti precisi come estrarre dati o classificare, più alti per la scrittura creativa.

Usarlo con i propri documenti #

La funzione più utile nella pratica è fare domande sui tuoi file: un contratto, un manuale, una raccolta di appunti. Trascini il PDF nella chat, il programma estrae il testo, lo divide e passa al modello i pezzi che servono per rispondere (è la tecnica chiamata RAG).

Chat di LM Studio con un PDF allegato e la risposta del modello basata sul suo contenuto

Va bene con documenti di dimensioni normali e domande precise. Con archivi enormi o domande che devono collegare informazioni sparse in punti lontani, i limiti si vedono.

Per certi usi però il vantaggio è decisivo: niente esce dal computer, quindi puoi analizzare documenti che non caricheresti mai su un servizio esterno.

Il server locale #

LM Studio può far girare il modello come servizio sul tuo computer, compatibile con le API di OpenAI, di solito all’indirizzo http://localhost:1234/v1. Vuol dire che programmi e script scritti per i servizi online possono usare il modello locale cambiando solo l’indirizzo. Dal terminale lo gestisci anche con il comando lms.

Impostazioni del server locale di LM Studio con la porta 1234, CORS e caricamento dei modelli su richiesta

Interessa soprattutto a chi sviluppa: provi un’applicazione senza consumare crediti e senza mandare dati fuori.

Le alternative #

Ollama fa lo stesso lavoro partendo dalla riga di comando (ollama run qwen3), ed è più adatto a chi lavora nel terminale o vuole integrarlo in script e servizi. Oggi ha anche una sua app con la chat, e si abbina a interfacce come Open WebUI.

Msty, a cui era dedicata la prima versione di questo articolo, oggi si chiama Msty Studio: ha un’interfaccia molto curata, mette nella stessa finestra modelli locali e servizi online con le tue chiavi API, e ha gli Stack di conoscenza per interrogare i tuoi documenti e le chat divise per confrontare le risposte di più modelli. Si parte gratis, con una licenza a pagamento per le funzioni avanzate.

Chat di Msty con la scelta del modello e gli stack di conoscenza collegati
Msty mette insieme modelli locali, servizi online e documenti

Le soluzioni integrate nel sistema, come i modelli di Apple Intelligence sui dispositivi Apple o quelli dei PC Copilot+ con un acceleratore dedicato, ti danno meno scelta ma non devi installare niente.

GPT4All e progetti simili offrono un’esperienza vicina a quella di LM Studio, con cataloghi e impostazioni differenti.

Domande frequenti #

Funziona anche senza connessione a internet? #

Sì, dopo aver scaricato il modello. La connessione serve solo per il catalogo e gli aggiornamenti. È proprio per questo che interessa a chi lavora con documenti riservati.

Quanto sono peggiori dei servizi online? #

Sui compiti circoscritti (riassumere, riformulare, tradurre, estrarre informazioni da un testo) un buon modello da 7-14 miliardi di parametri se la cava bene. Su ragionamenti lunghi, domande che richiedono molte conoscenze e codice complesso, la distanza dai modelli dei grandi servizi resta netta.

Serve una scheda video dedicata? #

No, ma aiuta molto. Senza, il modello gira sul processore e le risposte arrivano più piano, anche se con i modelli piccoli restano usabili. Sui Mac con chip Apple il problema non c’è, perché la memoria unificata fa quel lavoro.

I modelli sono gratuiti? #

Quelli con licenza aperta sì, e sono quasi tutti quelli del catalogo. Le licenze però cambiano da modello a modello: alcune (come quella di Llama) mettono condizioni sull’uso commerciale, altre (Qwen, Mistral, gpt-oss) sono Apache 2.0. Se il modello ti serve per lavoro, leggi la licenza.

Quanto spazio serve sul disco? #

Ogni modello occupa da un paio di gigabyte a diverse decine. Con quattro o cinque modelli arrivi in fretta a 50 GB: ogni tanto apri la sezione I miei modelli e togli quelli che non usi più.

Da leggere anche