Como correr um modelo de IA localmente com o LM Studio
Instala o LM Studio, escolhe o modelo ideal para a tua memória e usa-o offline: requisitos, quantização e primeiros passos.

Nesta página
Expectativas realistas. Os modelos que correm num computador doméstico são menos capazes do que os dos grandes serviços online. Para resumir, reformular, classificar, traduzir e raciocinar sobre os teus documentos funcionam lindamente; para tarefas complexas, a diferença em relação ao ChatGPT ou Claude nota-se.
A partir de julho de 2025, o LM Studio passa a ser gratuito também para uso empresarial, sem necessidade de pedir licenças.
Requisitos #
| Sistema | Requisitos |
|---|---|
| macOS | Apenas Apple Silicon, macOS 14 ou posterior, recomendados 16 GB de memória |
| Windows | x64 com instruções AVX2 ou ARM, recomendados 16 GB de memória e 4 GB de memória de vídeo |
| Linux | Ubuntu 20.04 ou posterior, distribuído como AppImage para x64 e ARM64 |
Com 8 GB de memória funciona, mas apenas com os modelos mais pequenos. O salto dá-se aos 16 GB e, com 32 GB, podes usar quase tudo o que faça sentido num computador pessoal.
Nos Mac com chip Apple a memória é partilhada entre o processador e a gráfica, o que é uma grande vantagem: um Mac com 32 GB carrega modelos que num PC exigiriam uma placa de vídeo de gama alta. O LM Studio no Mac também utiliza os modelos em formato MLX, otimizados para esses chips e, por norma, mais rápidos. No PC, com uma placa NVIDIA, mantém os drivers atualizados.
Quanta memória é necessária para cada modelo #
Esta é a pergunta crucial, e a resposta depende da quantização: uma técnica que reduz a precisão dos números dentro do modelo, fazendo com que o ficheiro pese muito menos em troca de uma pequena perda de qualidade.
Um modelo é indicado pelo número de parâmetros (7B, 14B, 32B, onde B significa biliões) e pelo nível de quantização, frequentemente escrito como Q4_K_M ou semelhante. Quanto mais baixo for o número após o Q, mais leve será o ficheiro e maior será a perda de qualidade.
Como referência prática:
| Modelo | Ficheiro quantizado a 4 bits | Memória recomendada |
|---|---|---|
| 3B | cerca de 2 GB | 8 GB |
| 7-8B | cerca de 4-5 GB | 16 GB |
| 14B | cerca de 8-9 GB | 16-24 GB |
| 32B | cerca de 18-20 GB | 32 GB |
| 70B | cerca de 40 GB | 64 GB ou mais |
A regra simples: vê quanto pesa o ficheiro e adiciona alguns gigabytes para o contexto e para o sistema operativo. Se a soma ultrapassar a memória que tens, o modelo corre na mesma, mas muito mais lentamente, porque parte do trabalho passa para o processador ou para o disco.
Instalação e primeiro modelo #
Descarrega o programa no sítio oficial do LM Studio na versão para o teu sistema operativo e instala-o como qualquer outra aplicação.
Na primeira execução, ele propõe um modelo para descarregar. Aceita ou procura um específico usando a lupa na barra lateral.
Nos resultados, cada variante mostra o seu peso e se é compatível com o teu hardware. Escolhe uma que caiba na tua memória.
Terminado o download, abre o chat, carrega o modelo através do menu superior e começa a escrever.
O primeiro carregamento demora algumas dezenas de segundos, porque o modelo está a ser lido para a memória. Depois, as respostas surgem de imediato.

As definições que importam #
Ao carregares um modelo, encontras alguns parâmetros. Os três que deves ajustar são:
Comprimento do contexto. Define quanto texto o modelo consegue manter na memória. Aumentar este valor permite trabalhar com documentos longos, mas consome muito mais memória: é o parâmetro que causa mais frequentemente erros de carregamento.
Carregamento na GPU. Define que parte do modelo vai para a placa gráfica. Com uma placa dedicada, coloca-o no máximo permitido pela memória de vídeo: as respostas tornar-se-ão muito mais rápidas.
Temperatura. Regula o quão previsíveis são as respostas: valores baixos para tarefas precisas como extrair dados ou classificar, e valores mais altos para escrita criativa.
Usar com os teus próprios documentos #
A função mais útil na prática é fazer perguntas sobre os teus ficheiros: um contrato, um manual, uma coleção de notas. Arrastas o PDF para o chat, o programa extrai o texto, divide-o e passa ao modelo as partes necessárias para responder (é a técnica chamada RAG).

Funciona bem com documentos de dimensões normais e perguntas precisas. Com arquivos enormes ou perguntas que exijam ligar informações espalhadas por pontos distantes, as limitações tornam-se evidentes.
Para certos usos, porém, a vantagem é decisiva: nada sai do teu computador, pelo que podes analisar documentos que nunca carregarias num serviço externo.
O servidor local #
O LM Studio pode correr o modelo como um serviço no teu computador, compatível com as APIs da OpenAI, normalmente no endereço http://localhost:1234/v1. Isto significa que programas e scripts escritos para serviços online podem usar o modelo local apenas alterando o endereço. Podes também o gerir através do terminal com o comando lms.

Interessa sobretudo a quem desenvolve: podes testar uma aplicação sem gastar créditos e sem enviar dados para fora.
Alternativas #
Ollama faz o mesmo trabalho através da linha de comandos (ollama run qwen3), sendo mais adequado para quem trabalha no terminal ou quer integrá-lo em scripts e serviços. Hoje em dia já tem também uma app própria com chat, e combina perfeitamente com interfaces como a Open WebUI.
Msty, ao qual foi dedicada a primeira versão deste artigo, hoje chama-se Msty Studio: tem uma interface muito cuidada, coloca na mesma janela modelos locais e serviços online com as tuas chaves API, e inclui os Knowledge Stacks para consultares os teus documentos e o chat dividido para comparares as respostas de vários modelos. Podes começar gratuitamente, com uma licença paga para funções avançadas.

As soluções integradas no sistema, como os modelos da Apple Intelligence nos dispositivos Apple ou os dos PCs Copilot+ com um acelerador dedicado, dão-te menos opções de escolha, mas não precisas de instalar nada.
GPT4All e projetos semelhantes oferecem uma experiência próxima da do LM Studio, com catálogos e definições diferentes.
Perguntas frequentes #
Funciona também sem ligação à internet? #
Sim, depois de teres descarregado o modelo. A ligação só é necessária para o catálogo e atualizações. É precisamente por isso que interessa a quem trabalha com documentos confidenciais.
O quanto são piores do que os serviços online? #
Em tarefas específicas (resumir, reformular, traduzir, extrair informações de um texto), um bom modelo de 7-14 mil milhões de parâmetros desenrasca-se bem. Em raciocínios longos, perguntas que exigem muito conhecimento e código complexo, a distância em relação aos modelos dos grandes serviços continua a ser enorme.
Preciso de uma placa gráfica dedicada? #
Não, mas ajuda imenso. Sem ela, o modelo corre no processador e as respostas demoram mais tempo a chegar, embora com modelos pequenos continuem utilizáveis. Nos Mac com chips Apple o problema não existe, porque a memória unificada faz esse trabalho.
Os modelos são gratuitos? #
Aqueles com licença aberta sim, e são quase todos os que estão no catálogo. No entanto, as licenças variam de modelo para modelo: algumas (como a do Llama) impõem condições ao uso comercial, outras (Qwen, Mistral, gpt-oss) são Apache 2.0. Se precisares do modelo para trabalho, lê a licença.
Quanto espaço é necessário no disco? #
Cada modelo ocupa desde alguns gigabytes até várias dezenas. Com quatro ou cinco modelos chegas rapidamente aos 50 GB: de vez em quando abre a secção Os meus modelos e remove aqueles que já não usas.

