---
title: "Cómo ejecutar modelos de IA en local con LM Studio"
description: "Instala LM Studio, elige el modelo ideal según tu memoria y úsalo sin conexión: requisitos, cuantización y primeros pasos."
url: "https://www.alemasone.com/es/ejecutar-modelos-ia-local-lm-studio/"
language: "es"
published: 2025-09-27
updated: 2026-09-20
categories: ["Software Y Herramientas"]
translations:
  it: "https://www.alemasone.com/it/modelli-llm-in-locale-lm-studio/"
  en: "https://www.alemasone.com/en/run-ai-models-locally-lm-studio/"
  fr: "https://www.alemasone.com/fr/faire-tourner-ia-local-lm-studio/"
  pt: "https://www.alemasone.com/pt/correr-modelo-ia-localmente-lm-studio/"
  de: "https://www.alemasone.com/de/ki-modelle-lokal-ausfuehren-lm-studio/"
---

# Cómo ejecutar modelos de IA en local con LM Studio

Si ejecutas un modelo de lenguaje en tu propio ordenador, los documentos no salen de ahí y no pagas ninguna suscripción. **LM Studio** es la forma más sencilla: lo instalas, eliges un modelo del catálogo y empiezas a escribir. El límite es la memoria: necesitas al menos tanta memoria como pese el archivo del modelo, más un margen.

> **Expectativas realistas.** Los modelos que se ejecutan en un ordenador doméstico son menos capaces que los de los grandes servicios online. Para resumir, reformular, clasificar, traducir y razonar sobre tus documentos van de maravilla; para tareas complejas, la diferencia con ChatGPT o Claude se nota.
>
> A partir de julio de 2025, LM Studio será gratuito también para uso empresarial, sin necesidad de solicitar licencias.

## Requisitos

| Sistema | Requisitos |
|---------|-----------|
| macOS | Solo Apple Silicon, macOS 14 o posterior, se recomiendan 16 GB de memoria |
| Windows | x64 con instrucciones AVX2 o ARM, se recomiendan 16 GB de memoria y 4 GB de memoria de vídeo |
| Linux | [Ubuntu](https://ubuntu.com/) 20.04 o posterior, distribuido como AppImage para x64 y ARM64 |

Con 8 GB de memoria funciona, pero solo con los modelos más pequeños. El salto real llega a los 16 GB, y con 32 GB puedes usar casi todo lo que tenga sentido en un ordenador personal.

En los [Mac con chip Apple](/es/virtualizacion-mac-apple-silicon-windows-linux/) la memoria es compartida entre el procesador y la gráfica, y es una gran ventaja: un Mac con 32 GB carga modelos que en un PC requerirían una tarjeta gráfica de gama alta. LM Studio en Mac también utiliza los modelos en formato **MLX**, optimizados para esos chips y que suelen ser más rápidos. En PC, si tienes una tarjeta NVIDIA, mantén actualizados los drivers.

## Cuánta memoria necesitas para cada modelo

Esa es la pregunta clave, y la respuesta depende de la **cuantización**: una técnica que reduce la precisión de los números dentro del modelo, por lo que pesa mucho menos a cambio de una pequeña pérdida de calidad.

Un modelo se identifica por el número de parámetros (7B, 14B, 32B, donde B significa miles de millones) y por el nivel de cuantización, que suele escribirse como `Q4_K_M` o similar. Cuanto más bajo sea el número después de la Q, más ligero será el archivo y más bajará la calidad.

Como referencia práctica:

| Modelo | Archivo cuantizado a 4 bits | Memoria recomendada |
|---------|-------------------------:|--------------------:|
| 3B | unos 2 GB | 8 GB |
| 7-8B | unos 4-5 GB | 16 GB |
| 14B | unos 8-9 GB | 16-24 GB |
| 32B | unos 18-20 GB | 32 GB |
| 70B | unos 40 GB | 64 GB o más |

La regla de oro: **fíjate en cuánto pesa el archivo y añade algunos gigabytes** para el contexto y para el sistema operativo. Si la suma supera la memoria que tienes, el modelo funcionará igual pero mucho más lento, porque parte del trabajo pasará al procesador o al disco duro.

> **Por dónde empezar.** Elige un modelo de 7-8 mil millones de parámetros cuantizado a 4 bits, por ejemplo Qwen 3 8B, Llama 3.1 8B o Gemma 3 de 12B si tienes 16 GB. Funciona en casi cualquier sitio, responde a una velocidad razonable y es suficiente para saber si este modo de trabajar te sirve. Con 16 GB de memoria de vídeo o un Mac de 32 GB puedes probar incluso gpt-oss 20B, el modelo abierto de OpenAI.

## Instalación y primer modelo

1. Descarga el programa desde la [web oficial de LM Studio](https://lmstudio.ai/) en su versión para tu sistema operativo e instálalo como cualquier otra aplicación.

2. Al abrirlo por primera vez, te propondrá un modelo para descargar. Acéptalo o busca uno específico con la lupa en la barra lateral.

3. En los resultados, cada variante muestra cuánto pesa y si es compatible con tu hardware. Elige una que quepa en tu memoria.

4. Una vez finalizada la descarga, abre el chat, carga el modelo desde el menú superior y empieza a escribir.

La primera carga tarda unos segundos porque el modelo se lee en la memoria. Después, las respuestas aparecen de inmediato.

![Búsqueda de modelos en LM Studio con la lista de modelos y las opciones de descarga de la variante cuantizada](interfaccia-lm-studio-modelli-caricati.png "La búsqueda indica qué variantes caben en la memoria disponible")

## Los ajustes que importan

Al cargar un modelo verás algunos parámetros. Los tres que te interesan son:

**Longitud del contexto.** Determina cuánto texto puede tener presente el modelo. Aumentarlo te permite trabajar con documentos largos, pero consume mucha más memoria; es el parámetro que suele causar los errores de carga.

**Carga en la GPU (GPU Offload).** Decide qué parte del modelo se envía a la tarjeta gráfica. Con una tarjeta dedicada, llévalo al máximo que permita tu memoria de vídeo: las respuestas serán mucho más rápidas.

**Temperatura.** Regula qué tan predecibles son las respuestas: valores bajos para tareas precisas como extraer datos o clasificar, y valores más altos para escritura creativa.

## Usarlo con tus propios documentos

La función más útil en la práctica es hacer preguntas sobre tus archivos: un contrato, un manual, una colección de notas. Arrastras el PDF al chat, el programa extrae el texto, lo divide y le pasa al modelo los fragmentos necesarios para responder (es la técnica llamada RAG).

![Chat de LM Studio con un PDF adjunto y la respuesta del modelo basada en su contenido](lm-studio-chat-con-pdf-e-risposta.png)

Funciona bien con documentos de tamaño normal y preguntas precisas. Con archivos enormes o preguntas que requieran conectar información dispersa en puntos lejanos, se notan los límites.

Sin embargo, para ciertos usos la ventaja es decisiva: **nada sale del ordenador**, así que puedes analizar documentos que nunca subirías a un servicio externo.

## El servidor local

LM Studio puede ejecutar el modelo como un servicio en tu ordenador, compatible con la API de OpenAI, normalmente en la dirección `http://localhost:1234/v1`. Esto significa que programas y scripts escritos para servicios online pueden usar el modelo local cambiando solo la dirección. Desde la terminal también puedes gestionarlo con el comando `lms`.

![Ajustes del servidor local de LM Studio con el puerto 1234, CORS y carga de modelos bajo demanda](https://www.alemasone.com/it/modelli-llm-in-locale-lm-studio/impostazioni-server-lm-studio.png)

Interesa sobre todo a los desarrolladores: puedes probar una aplicación sin gastar créditos y sin enviar datos fuera de tu equipo.

## Las alternativas

**[Ollama](https://ollama.com/)** hace el mismo trabajo desde la línea de comandos (`ollama run qwen3`), y es más adecuado para quienes trabajan en la terminal o quieren integrarlo en scripts y servicios. Hoy en día también tiene su propia aplicación con chat, y se combina con interfaces como Open WebUI.

**[Msty](https://msty.ai/)**, al que dedicamos la primera versión de este artículo, hoy se llama Msty Studio: tiene una interfaz muy cuidada, permite tener en la misma ventana modelos locales y servicios online con tus propias claves API, y cuenta con los **Knowledge Stacks** para consultar tus documentos y el **chat dividido** para comparar las respuestas de varios modelos. Puedes empezar gratis, con una licencia de pago para las funciones avanzadas.

![Chat de Msty con la selección del modelo y los Knowledge Stacks conectados](interfaccia-msty-studio-con-deepseek-r1.png "Msty combina modelos locales, servicios online y documentos")

**Las soluciones integradas en el sistema**, como los modelos de Apple Intelligence en dispositivos Apple o los de los PC Copilot+ con un acelerador dedicado, te ofrecen menos opciones pero no tienes que instalar nada.

**[GPT4All](https://github.com/nomic-ai/gpt4all)** y proyectos similares ofrecen una experiencia cercana a la de LM Studio, con catálogos e impostaciones diferentes.

## Preguntas frecuentes

### ¿Funciona también sin conexión a internet?

Sí, una vez descargado el modelo. La conexión solo es necesaria para el catálogo y las actualizaciones. Precisamente por esto le interesa tanto a quienes trabajan con documentos confidenciales.

### ¿Qué tan malos son comparados con los servicios online?

En tareas específicas (resumir, reformular, traducir, extraer información de un texto), un buen modelo de entre 7 y 14 mil millones de parámetros se defiende bien. En razonamientos largos, preguntas que requieren mucho conocimiento o código complejo, la diferencia con los modelos de los grandes servicios sigue siendo notable.

### ¿Hace falta una tarjeta gráfica dedicada?

No, pero ayuda mucho. Sin ella, el modelo funciona con el procesador y las respuestas tardan más en llegar, aunque con los modelos pequeños siguen siendo usables. En los Mac con chips Apple no hay problema, porque la memoria unificada se encarga de ese trabajo.

### ¿Los modelos son gratuitos?

Los que tienen licencia abierta sí, y casi todos los del catálogo lo son. Sin embargo, las licencias varían según el modelo: algunas (como la de Llama) imponen condiciones para el uso comercial, otras (Qwen, Mistral, gpt-oss) son Apache 2.0. Si necesitas el modelo para trabajar, lee bien la licencia.

### ¿Cuánto espacio necesito en el disco?

Cada modelo ocupa desde un par de gigabytes hasta varias decenas. Con cuatro o cinco modelos llegarás rápido a los 50 GB: de vez en cuando abre la sección **Mis modelos** y elimina los que ya no uses.
