---
title: "Como correr um modelo de IA localmente com o LM Studio"
description: "Instala o LM Studio, escolhe o modelo ideal para a tua memória e usa-o offline: requisitos, quantização e primeiros passos."
url: "https://www.alemasone.com/pt/correr-modelo-ia-localmente-lm-studio/"
language: "pt"
published: 2025-09-27
updated: 2026-09-20
categories: ["Software E Ferramentas"]
translations:
  it: "https://www.alemasone.com/it/modelli-llm-in-locale-lm-studio/"
  en: "https://www.alemasone.com/en/run-ai-models-locally-lm-studio/"
  es: "https://www.alemasone.com/es/ejecutar-modelos-ia-local-lm-studio/"
  fr: "https://www.alemasone.com/fr/faire-tourner-ia-local-lm-studio/"
  de: "https://www.alemasone.com/de/ki-modelle-lokal-ausfuehren-lm-studio/"
---

# Como correr um modelo de IA localmente com o LM Studio

Se executares um modelo de linguagem no teu computador, os documentos não saem de lá e não pagas qualquer subscrição. O **LM Studio** é a forma mais simples: instalas, escolhes um modelo do catálogo e começas a escrever. O limite é a memória: precisas de ter disponível pelo menos o peso do ficheiro do modelo, mais uma margem de manobra.

> **Expectativas realistas.** Os modelos que correm num computador doméstico são menos capazes do que os dos grandes serviços online. Para resumir, reformular, classificar, traduzir e raciocinar sobre os teus documentos funcionam lindamente; para tarefas complexas, a diferença em relação ao ChatGPT ou Claude nota-se.
>
> A partir de julho de 2025, o LM Studio passa a ser gratuito também para uso empresarial, sem necessidade de pedir licenças.

## Requisitos

| Sistema | Requisitos |
|---------|-----------|
| macOS | Apenas Apple Silicon, macOS 14 ou posterior, recomendados 16 GB de memória |
| Windows | x64 com instruções AVX2 ou ARM, recomendados 16 GB de memória e 4 GB de memória de vídeo |
| Linux | [Ubuntu](https://ubuntu.com/) 20.04 ou posterior, distribuído como AppImage para x64 e ARM64 |

Com 8 GB de memória funciona, mas apenas com os modelos mais pequenos. O salto dá-se aos 16 GB e, com 32 GB, podes usar quase tudo o que faça sentido num computador pessoal.

Nos [Mac com chip Apple](/pt/virtualizacao-mac-apple-silicon-windows-linux/) a memória é partilhada entre o processador e a gráfica, o que é uma grande vantagem: um Mac com 32 GB carrega modelos que num PC exigiriam uma placa de vídeo de gama alta. O LM Studio no Mac também utiliza os modelos em formato **MLX**, otimizados para esses chips e, por norma, mais rápidos. No PC, com uma placa NVIDIA, mantém os drivers atualizados.

## Quanta memória é necessária para cada modelo

Esta é a pergunta crucial, e a resposta depende da **quantização**: uma técnica que reduz a precisão dos números dentro do modelo, fazendo com que o ficheiro pese muito menos em troca de uma pequena perda de qualidade.

Um modelo é indicado pelo número de parâmetros (7B, 14B, 32B, onde B significa biliões) e pelo nível de quantização, frequentemente escrito como `Q4_K_M` ou semelhante. Quanto mais baixo for o número após o Q, mais leve será o ficheiro e maior será a perda de qualidade.

Como referência prática:

| Modelo | Ficheiro quantizado a 4 bits | Memória recomendada |
|---------|-------------------------:|--------------------:|
| 3B | cerca de 2 GB | 8 GB |
| 7-8B | cerca de 4-5 GB | 16 GB |
| 14B | cerca de 8-9 GB | 16-24 GB |
| 32B | cerca de 18-20 GB | 32 GB |
| 70B | cerca de 40 GB | 64 GB ou mais |

A regra simples: **vê quanto pesa o ficheiro e adiciona alguns gigabytes** para o contexto e para o sistema operativo. Se a soma ultrapassar a memória que tens, o modelo corre na mesma, mas muito mais lentamente, porque parte do trabalho passa para o processador ou para o disco.

> **Por onde começar.** Escolhe um modelo de 7-8 mil milhões de parâmetros quantizado a 4 bits, por exemplo, Qwen 3 8B, Llama 3.1 8B ou Gemma 3 de 12B se tiveres 16 GB. Corre em quase tudo, responde a uma velocidade razoável e é suficiente para perceberes se este modo de trabalhar te serve. Com 16 GB de memória de vídeo ou um Mac de 32 GB, podes também experimentar o gpt-oss 20B, o modelo aberto da OpenAI.

## Instalação e primeiro modelo

1. Descarrega o programa no [sítio oficial do LM Studio](https://lmstudio.ai/) na versão para o teu sistema operativo e instala-o como qualquer outra aplicação.

2. Na primeira execução, ele propõe um modelo para descarregar. Aceita ou procura um específico usando a lupa na barra lateral.

3. Nos resultados, cada variante mostra o seu peso e se é compatível com o teu hardware. Escolhe uma que caiba na tua memória.

4. Terminado o download, abre o chat, carrega o modelo através do menu superior e começa a escrever.

O primeiro carregamento demora algumas dezenas de segundos, porque o modelo está a ser lido para a memória. Depois, as respostas surgem de imediato.

![Pesquisa de modelos no LM Studio com a lista de modelos e as opções de download da variante quantizada](interfaccia-lm-studio-modelli-caricati.png "A pesquisa indica quais variantes cabem na memória disponível")

## As definições que importam

Ao carregares um modelo, encontras alguns parâmetros. Os três que deves ajustar são:

**Comprimento do contexto.** Define quanto texto o modelo consegue manter na memória. Aumentar este valor permite trabalhar com documentos longos, mas consome muito mais memória: é o parâmetro que causa mais frequentemente erros de carregamento.

**Carregamento na GPU.** Define que parte do modelo vai para a placa gráfica. Com uma placa dedicada, coloca-o no máximo permitido pela memória de vídeo: as respostas tornar-se-ão muito mais rápidas.

**Temperatura.** Regula o quão previsíveis são as respostas: valores baixos para tarefas precisas como extrair dados ou classificar, e valores mais altos para escrita criativa.

## Usar com os teus próprios documentos

A função mais útil na prática é fazer perguntas sobre os teus ficheiros: um contrato, um manual, uma coleção de notas. Arrastas o PDF para o chat, o programa extrai o texto, divide-o e passa ao modelo as partes necessárias para responder (é a técnica chamada RAG).

![Chat do LM Studio com um PDF anexado e a resposta do modelo baseada no seu conteúdo](lm-studio-chat-con-pdf-e-risposta.png)

Funciona bem com documentos de dimensões normais e perguntas precisas. Com arquivos enormes ou perguntas que exijam ligar informações espalhadas por pontos distantes, as limitações tornam-se evidentes.

Para certos usos, porém, a vantagem é decisiva: **nada sai do teu computador**, pelo que podes analisar documentos que nunca carregarias num serviço externo.

## O servidor local

O LM Studio pode correr o modelo como um serviço no teu computador, compatível com as APIs da OpenAI, normalmente no endereço `http://localhost:1234/v1`. Isto significa que programas e scripts escritos para serviços online podem usar o modelo local apenas alterando o endereço. Podes também o gerir através do terminal com o comando `lms`.

![Definições do servidor local do LM Studio com a porta 1234, CORS e carregamento de modelos sob pedido](https://www.alemasone.com/it/modelli-llm-in-locale-lm-studio/impostazioni-server-lm-studio.png)

Interessa sobretudo a quem desenvolve: podes testar uma aplicação sem gastar créditos e sem enviar dados para fora.

## Alternativas

**[Ollama](https://ollama.com/)** faz o mesmo trabalho através da linha de comandos (`ollama run qwen3`), sendo mais adequado para quem trabalha no terminal ou quer integrá-lo em scripts e serviços. Hoje em dia já tem também uma app própria com chat, e combina perfeitamente com interfaces como a Open WebUI.

**[Msty](https://msty.ai/)**, ao qual foi dedicada a primeira versão deste artigo, hoje chama-se Msty Studio: tem uma interface muito cuidada, coloca na mesma janela modelos locais e serviços online com as tuas chaves API, e inclui os **Knowledge Stacks** para consultares os teus documentos e o **chat dividido** para comparares as respostas de vários modelos. Podes começar gratuitamente, com uma licença paga para funções avançadas.

![Chat do Msty com a escolha do modelo e os knowledge stacks ligados](interfaccia-msty-studio-con-deepseek-r1.png "O Msty combina modelos locais, serviços online e documentos")

**As soluções integradas no sistema**, como os modelos da Apple Intelligence nos dispositivos Apple ou os dos PCs Copilot+ com um acelerador dedicado, dão-te menos opções de escolha, mas não precisas de instalar nada.

**[GPT4All](https://github.com/nomic-ai/gpt4all)** e projetos semelhantes oferecem uma experiência próxima da do LM Studio, com catálogos e definições diferentes.

## Perguntas frequentes

### Funciona também sem ligação à internet?

Sim, depois de teres descarregado o modelo. A ligação só é necessária para o catálogo e atualizações. É precisamente por isso que interessa a quem trabalha com documentos confidenciais.

### O quanto são piores do que os serviços online?

Em tarefas específicas (resumir, reformular, traduzir, extrair informações de um texto), um bom modelo de 7-14 mil milhões de parâmetros desenrasca-se bem. Em raciocínios longos, perguntas que exigem muito conhecimento e código complexo, a distância em relação aos modelos dos grandes serviços continua a ser enorme.

### Preciso de uma placa gráfica dedicada?

Não, mas ajuda imenso. Sem ela, o modelo corre no processador e as respostas demoram mais tempo a chegar, embora com modelos pequenos continuem utilizáveis. Nos Mac com chips Apple o problema não existe, porque a memória unificada faz esse trabalho.

### Os modelos são gratuitos?

Aqueles com licença aberta sim, e são quase todos os que estão no catálogo. No entanto, as licenças variam de modelo para modelo: algumas (como a do Llama) impõem condições ao uso comercial, outras (Qwen, Mistral, gpt-oss) são Apache 2.0. Se precisares do modelo para trabalho, lê a licença.

### Quanto espaço é necessário no disco?

Cada modelo ocupa desde alguns gigabytes até várias dezenas. Com quatro ou cinco modelos chegas rapidamente aos 50 GB: de vez em quando abre a secção **Os meus modelos** e remove aqueles que já não usas.
