Cómo ejecutar modelos de IA en local con LM Studio
Instala LM Studio, elige el modelo ideal según tu memoria y úsalo sin conexión: requisitos, cuantización y primeros pasos.

En esta página
Expectativas realistas. Los modelos que se ejecutan en un ordenador doméstico son menos capaces que los de los grandes servicios online. Para resumir, reformular, clasificar, traducir y razonar sobre tus documentos van de maravilla; para tareas complejas, la diferencia con ChatGPT o Claude se nota.
A partir de julio de 2025, LM Studio será gratuito también para uso empresarial, sin necesidad de solicitar licencias.
Requisitos #
| Sistema | Requisitos |
|---|---|
| macOS | Solo Apple Silicon, macOS 14 o posterior, se recomiendan 16 GB de memoria |
| Windows | x64 con instrucciones AVX2 o ARM, se recomiendan 16 GB de memoria y 4 GB de memoria de vídeo |
| Linux | Ubuntu 20.04 o posterior, distribuido como AppImage para x64 y ARM64 |
Con 8 GB de memoria funciona, pero solo con los modelos más pequeños. El salto real llega a los 16 GB, y con 32 GB puedes usar casi todo lo que tenga sentido en un ordenador personal.
En los Mac con chip Apple la memoria es compartida entre el procesador y la gráfica, y es una gran ventaja: un Mac con 32 GB carga modelos que en un PC requerirían una tarjeta gráfica de gama alta. LM Studio en Mac también utiliza los modelos en formato MLX, optimizados para esos chips y que suelen ser más rápidos. En PC, si tienes una tarjeta NVIDIA, mantén actualizados los drivers.
Cuánta memoria necesitas para cada modelo #
Esa es la pregunta clave, y la respuesta depende de la cuantización: una técnica que reduce la precisión de los números dentro del modelo, por lo que pesa mucho menos a cambio de una pequeña pérdida de calidad.
Un modelo se identifica por el número de parámetros (7B, 14B, 32B, donde B significa miles de millones) y por el nivel de cuantización, que suele escribirse como Q4_K_M o similar. Cuanto más bajo sea el número después de la Q, más ligero será el archivo y más bajará la calidad.
Como referencia práctica:
| Modelo | Archivo cuantizado a 4 bits | Memoria recomendada |
|---|---|---|
| 3B | unos 2 GB | 8 GB |
| 7-8B | unos 4-5 GB | 16 GB |
| 14B | unos 8-9 GB | 16-24 GB |
| 32B | unos 18-20 GB | 32 GB |
| 70B | unos 40 GB | 64 GB o más |
La regla de oro: fíjate en cuánto pesa el archivo y añade algunos gigabytes para el contexto y para el sistema operativo. Si la suma supera la memoria que tienes, el modelo funcionará igual pero mucho más lento, porque parte del trabajo pasará al procesador o al disco duro.
Instalación y primer modelo #
Descarga el programa desde la web oficial de LM Studio en su versión para tu sistema operativo e instálalo como cualquier otra aplicación.
Al abrirlo por primera vez, te propondrá un modelo para descargar. Acéptalo o busca uno específico con la lupa en la barra lateral.
En los resultados, cada variante muestra cuánto pesa y si es compatible con tu hardware. Elige una que quepa en tu memoria.
Una vez finalizada la descarga, abre el chat, carga el modelo desde el menú superior y empieza a escribir.
La primera carga tarda unos segundos porque el modelo se lee en la memoria. Después, las respuestas aparecen de inmediato.

Los ajustes que importan #
Al cargar un modelo verás algunos parámetros. Los tres que te interesan son:
Longitud del contexto. Determina cuánto texto puede tener presente el modelo. Aumentarlo te permite trabajar con documentos largos, pero consume mucha más memoria; es el parámetro que suele causar los errores de carga.
Carga en la GPU (GPU Offload). Decide qué parte del modelo se envía a la tarjeta gráfica. Con una tarjeta dedicada, llévalo al máximo que permita tu memoria de vídeo: las respuestas serán mucho más rápidas.
Temperatura. Regula qué tan predecibles son las respuestas: valores bajos para tareas precisas como extraer datos o clasificar, y valores más altos para escritura creativa.
Usarlo con tus propios documentos #
La función más útil en la práctica es hacer preguntas sobre tus archivos: un contrato, un manual, una colección de notas. Arrastras el PDF al chat, el programa extrae el texto, lo divide y le pasa al modelo los fragmentos necesarios para responder (es la técnica llamada RAG).

Funciona bien con documentos de tamaño normal y preguntas precisas. Con archivos enormes o preguntas que requieran conectar información dispersa en puntos lejanos, se notan los límites.
Sin embargo, para ciertos usos la ventaja es decisiva: nada sale del ordenador, así que puedes analizar documentos que nunca subirías a un servicio externo.
El servidor local #
LM Studio puede ejecutar el modelo como un servicio en tu ordenador, compatible con la API de OpenAI, normalmente en la dirección http://localhost:1234/v1. Esto significa que programas y scripts escritos para servicios online pueden usar el modelo local cambiando solo la dirección. Desde la terminal también puedes gestionarlo con el comando lms.

Interesa sobre todo a los desarrolladores: puedes probar una aplicación sin gastar créditos y sin enviar datos fuera de tu equipo.
Las alternativas #
Ollama hace el mismo trabajo desde la línea de comandos (ollama run qwen3), y es más adecuado para quienes trabajan en la terminal o quieren integrarlo en scripts y servicios. Hoy en día también tiene su propia aplicación con chat, y se combina con interfaces como Open WebUI.
Msty, al que dedicamos la primera versión de este artículo, hoy se llama Msty Studio: tiene una interfaz muy cuidada, permite tener en la misma ventana modelos locales y servicios online con tus propias claves API, y cuenta con los Knowledge Stacks para consultar tus documentos y el chat dividido para comparar las respuestas de varios modelos. Puedes empezar gratis, con una licencia de pago para las funciones avanzadas.

Las soluciones integradas en el sistema, como los modelos de Apple Intelligence en dispositivos Apple o los de los PC Copilot+ con un acelerador dedicado, te ofrecen menos opciones pero no tienes que instalar nada.
GPT4All y proyectos similares ofrecen una experiencia cercana a la de LM Studio, con catálogos e impostaciones diferentes.
Preguntas frecuentes #
¿Funciona también sin conexión a internet? #
Sí, una vez descargado el modelo. La conexión solo es necesaria para el catálogo y las actualizaciones. Precisamente por esto le interesa tanto a quienes trabajan con documentos confidenciales.
¿Qué tan malos son comparados con los servicios online? #
En tareas específicas (resumir, reformular, traducir, extraer información de un texto), un buen modelo de entre 7 y 14 mil millones de parámetros se defiende bien. En razonamientos largos, preguntas que requieren mucho conocimiento o código complejo, la diferencia con los modelos de los grandes servicios sigue siendo notable.
¿Hace falta una tarjeta gráfica dedicada? #
No, pero ayuda mucho. Sin ella, el modelo funciona con el procesador y las respuestas tardan más en llegar, aunque con los modelos pequeños siguen siendo usables. En los Mac con chips Apple no hay problema, porque la memoria unificada se encarga de ese trabajo.
¿Los modelos son gratuitos? #
Los que tienen licencia abierta sí, y casi todos los del catálogo lo son. Sin embargo, las licencias varían según el modelo: algunas (como la de Llama) imponen condiciones para el uso comercial, otras (Qwen, Mistral, gpt-oss) son Apache 2.0. Si necesitas el modelo para trabajar, lee bien la licencia.
¿Cuánto espacio necesito en el disco? #
Cada modelo ocupa desde un par de gigabytes hasta varias decenas. Con cuatro o cinco modelos llegarás rápido a los 50 GB: de vez en cuando abre la sección Mis modelos y elimina los que ya no uses.

