↓Salta al contenuto principale
Alemasone

Como correr um modelo de IA localmente com o LM Studio

Instala o LM Studio, escolhe o modelo ideal para a tua memória e usa-o offline: requisitos, quantização e primeiros passos.

7 min de leitura Atualizado a
Interface do LM Studio com um modelo carregado e uma conversa em curso
Nesta página
Se executares um modelo de linguagem no teu computador, os documentos não saem de lá e não pagas qualquer subscrição. O LM Studio é a forma mais simples: instalas, escolhes um modelo do catálogo e começas a escrever. O limite é a memória: precisas de ter disponível pelo menos o peso do ficheiro do modelo, mais uma margem de manobra.

Expectativas realistas. Os modelos que correm num computador doméstico são menos capazes do que os dos grandes serviços online. Para resumir, reformular, classificar, traduzir e raciocinar sobre os teus documentos funcionam lindamente; para tarefas complexas, a diferença em relação ao ChatGPT ou Claude nota-se.

A partir de julho de 2025, o LM Studio passa a ser gratuito também para uso empresarial, sem necessidade de pedir licenças.

Requisitos #

SistemaRequisitos
macOSApenas Apple Silicon, macOS 14 ou posterior, recomendados 16 GB de memória
Windowsx64 com instruções AVX2 ou ARM, recomendados 16 GB de memória e 4 GB de memória de vídeo
LinuxUbuntu 20.04 ou posterior, distribuído como AppImage para x64 e ARM64

Com 8 GB de memória funciona, mas apenas com os modelos mais pequenos. O salto dá-se aos 16 GB e, com 32 GB, podes usar quase tudo o que faça sentido num computador pessoal.

Nos Mac com chip Apple a memória é partilhada entre o processador e a gráfica, o que é uma grande vantagem: um Mac com 32 GB carrega modelos que num PC exigiriam uma placa de vídeo de gama alta. O LM Studio no Mac também utiliza os modelos em formato MLX, otimizados para esses chips e, por norma, mais rápidos. No PC, com uma placa NVIDIA, mantém os drivers atualizados.

Quanta memória é necessária para cada modelo #

Esta é a pergunta crucial, e a resposta depende da quantização: uma técnica que reduz a precisão dos números dentro do modelo, fazendo com que o ficheiro pese muito menos em troca de uma pequena perda de qualidade.

Um modelo é indicado pelo número de parâmetros (7B, 14B, 32B, onde B significa biliões) e pelo nível de quantização, frequentemente escrito como Q4_K_M ou semelhante. Quanto mais baixo for o número após o Q, mais leve será o ficheiro e maior será a perda de qualidade.

Como referência prática:

ModeloFicheiro quantizado a 4 bitsMemória recomendada
3Bcerca de 2 GB8 GB
7-8Bcerca de 4-5 GB16 GB
14Bcerca de 8-9 GB16-24 GB
32Bcerca de 18-20 GB32 GB
70Bcerca de 40 GB64 GB ou mais

A regra simples: vê quanto pesa o ficheiro e adiciona alguns gigabytes para o contexto e para o sistema operativo. Se a soma ultrapassar a memória que tens, o modelo corre na mesma, mas muito mais lentamente, porque parte do trabalho passa para o processador ou para o disco.

Por onde começar. Escolhe um modelo de 7-8 mil milhões de parâmetros quantizado a 4 bits, por exemplo, Qwen 3 8B, Llama 3.1 8B ou Gemma 3 de 12B se tiveres 16 GB. Corre em quase tudo, responde a uma velocidade razoável e é suficiente para perceberes se este modo de trabalhar te serve. Com 16 GB de memória de vídeo ou um Mac de 32 GB, podes também experimentar o gpt-oss 20B, o modelo aberto da OpenAI.

Instalação e primeiro modelo #

  1. Descarrega o programa no sítio oficial do LM Studio na versão para o teu sistema operativo e instala-o como qualquer outra aplicação.

  2. Na primeira execução, ele propõe um modelo para descarregar. Aceita ou procura um específico usando a lupa na barra lateral.

  3. Nos resultados, cada variante mostra o seu peso e se é compatível com o teu hardware. Escolhe uma que caiba na tua memória.

  4. Terminado o download, abre o chat, carrega o modelo através do menu superior e começa a escrever.

O primeiro carregamento demora algumas dezenas de segundos, porque o modelo está a ser lido para a memória. Depois, as respostas surgem de imediato.

Pesquisa de modelos no LM Studio com a lista de modelos e as opções de download da variante quantizada
A pesquisa indica quais variantes cabem na memória disponível

As definições que importam #

Ao carregares um modelo, encontras alguns parâmetros. Os três que deves ajustar são:

Comprimento do contexto. Define quanto texto o modelo consegue manter na memória. Aumentar este valor permite trabalhar com documentos longos, mas consome muito mais memória: é o parâmetro que causa mais frequentemente erros de carregamento.

Carregamento na GPU. Define que parte do modelo vai para a placa gráfica. Com uma placa dedicada, coloca-o no máximo permitido pela memória de vídeo: as respostas tornar-se-ão muito mais rápidas.

Temperatura. Regula o quão previsíveis são as respostas: valores baixos para tarefas precisas como extrair dados ou classificar, e valores mais altos para escrita criativa.

Usar com os teus próprios documentos #

A função mais útil na prática é fazer perguntas sobre os teus ficheiros: um contrato, um manual, uma coleção de notas. Arrastas o PDF para o chat, o programa extrai o texto, divide-o e passa ao modelo as partes necessárias para responder (é a técnica chamada RAG).

Chat do LM Studio com um PDF anexado e a resposta do modelo baseada no seu conteúdo

Funciona bem com documentos de dimensões normais e perguntas precisas. Com arquivos enormes ou perguntas que exijam ligar informações espalhadas por pontos distantes, as limitações tornam-se evidentes.

Para certos usos, porém, a vantagem é decisiva: nada sai do teu computador, pelo que podes analisar documentos que nunca carregarias num serviço externo.

O servidor local #

O LM Studio pode correr o modelo como um serviço no teu computador, compatível com as APIs da OpenAI, normalmente no endereço http://localhost:1234/v1. Isto significa que programas e scripts escritos para serviços online podem usar o modelo local apenas alterando o endereço. Podes também o gerir através do terminal com o comando lms.

Definições do servidor local do LM Studio com a porta 1234, CORS e carregamento de modelos sob pedido

Interessa sobretudo a quem desenvolve: podes testar uma aplicação sem gastar créditos e sem enviar dados para fora.

Alternativas #

Ollama faz o mesmo trabalho através da linha de comandos (ollama run qwen3), sendo mais adequado para quem trabalha no terminal ou quer integrá-lo em scripts e serviços. Hoje em dia já tem também uma app própria com chat, e combina perfeitamente com interfaces como a Open WebUI.

Msty, ao qual foi dedicada a primeira versão deste artigo, hoje chama-se Msty Studio: tem uma interface muito cuidada, coloca na mesma janela modelos locais e serviços online com as tuas chaves API, e inclui os Knowledge Stacks para consultares os teus documentos e o chat dividido para comparares as respostas de vários modelos. Podes começar gratuitamente, com uma licença paga para funções avançadas.

Chat do Msty com a escolha do modelo e os knowledge stacks ligados
O Msty combina modelos locais, serviços online e documentos

As soluções integradas no sistema, como os modelos da Apple Intelligence nos dispositivos Apple ou os dos PCs Copilot+ com um acelerador dedicado, dão-te menos opções de escolha, mas não precisas de instalar nada.

GPT4All e projetos semelhantes oferecem uma experiência próxima da do LM Studio, com catálogos e definições diferentes.

Perguntas frequentes #

Funciona também sem ligação à internet? #

Sim, depois de teres descarregado o modelo. A ligação só é necessária para o catálogo e atualizações. É precisamente por isso que interessa a quem trabalha com documentos confidenciais.

O quanto são piores do que os serviços online? #

Em tarefas específicas (resumir, reformular, traduzir, extrair informações de um texto), um bom modelo de 7-14 mil milhões de parâmetros desenrasca-se bem. Em raciocínios longos, perguntas que exigem muito conhecimento e código complexo, a distância em relação aos modelos dos grandes serviços continua a ser enorme.

Preciso de uma placa gráfica dedicada? #

Não, mas ajuda imenso. Sem ela, o modelo corre no processador e as respostas demoram mais tempo a chegar, embora com modelos pequenos continuem utilizáveis. Nos Mac com chips Apple o problema não existe, porque a memória unificada faz esse trabalho.

Os modelos são gratuitos? #

Aqueles com licença aberta sim, e são quase todos os que estão no catálogo. No entanto, as licenças variam de modelo para modelo: algumas (como a do Llama) impõem condições ao uso comercial, outras (Qwen, Mistral, gpt-oss) são Apache 2.0. Se precisares do modelo para trabalho, lê a licença.

Quanto espaço é necessário no disco? #

Cada modelo ocupa desde alguns gigabytes até várias dezenas. Com quatro ou cinco modelos chegas rapidamente aos 50 GB: de vez em quando abre a secção Os meus modelos e remove aqueles que já não usas.

Leia a seguir