↓Aller au contenu
Alemasone

Faire tourner une IA en local avec LM Studio

Installez LM Studio, choisissez le modèle adapté à votre RAM et utilisez l'IA hors ligne : configuration, quantification et premiers pas.

7 min de lecture Mis à jour le
Interface de LM Studio avec un modèle chargé et une conversation en cours
Sur cette page
Si vous faites tourner un modèle linguistique sur votre ordinateur, vos documents ne quittent pas votre machine et vous n’avez aucun abonnement à payer. LM Studio est la méthode la plus simple : vous l’installez, choisissez un modèle dans le catalogue et vous commencez à écrire. La limite est la mémoire : il vous faut au moins autant de mémoire que le poids du fichier du modèle, plus une marge.

Des attentes réalistes. Les modèles qui tournent sur un ordinateur domestique sont moins performants que ceux des grands services en ligne. Pour résumer, pour reformuler, classer, traduire ou raisonner sur vos documents, ils sont parfaits ; pour les tâches complexes, la différence avec ChatGPT ou Claude se fait sentir.

À partir de juillet 2025, LM Studio sera également gratuit pour un usage professionnel, sans licence à demander.

Configuration requise #

SystèmeConfiguration requise
macOSUniquement Apple Silicon, macOS 14 ou version ultérieure, 16 Go de mémoire recommandés
Windowsx64 avec instructions AVX2 ou ARM, 16 Go de mémoire et 4 Go de mémoire vidéo recommandés
LinuxUbuntu 20.04 ou version ultérieure, distribué en tant qu’AppImage pour x64 et ARM64

Avec 8 Go de mémoire cela fonctionne, mais uniquement avec les modèles les plus légers. Le véritable confort commence à 16 Go, et avec 32 Go, vous pouvez utiliser presque tout ce qui est pertinent sur un ordinateur personnel.

Sur les Mac avec puce Apple la mémoire est partagée entre le processeur et la partie graphique, ce qui constitue un bel avantage : un Mac avec 32 Go peut charger des modèles qui nécessiteraient une carte graphique haut de gamme sur un PC. LM Studio sur Mac utilise également les modèles au format MLX, optimisés pour ces puces et généralement plus rapides. Sur PC, avec une carte NVIDIA, pensez à maintenir vos pilotes à jour.

Quelle quantité de mémoire pour quel modèle #

C’est la question cruciale, et la réponse dépend de la quantification : une technique qui réduit la précision des nombres à l’intérieur du modèle, ce qui le rend beaucoup plus léger au prix d’une légère baisse de qualité.

Un modèle s’indique par son nombre de paramètres (7B, 14B, 32B, où B signifie milliards) et par son niveau de quantification, souvent écrit sous la forme Q4_K_M ou similaire. Plus le chiffre après le Q est bas, plus le fichier est léger et plus la qualité diminue.

À titre de référence pratique :

ModèleFichier quantifié en 4 bitsMémoire recommandée
3Benviron 2 Go8 Go
7-8Benviron 4-5 Go16 Go
14Benviron 8-9 Go16-24 Go
32Benviron 18-20 Go32 Go
70Benviron 40 Go64 Go ou plus

La règle simple : regardez le poids du fichier et ajoutez quelques gigaoctets pour le contexte et le système d’exploitation. Si la somme dépasse votre mémoire disponible, le modèle tournera quand même mais beaucoup plus lentement, car une partie du travail sera transférée sur le processeur ou le disque dur.

Par où commencer. Choisissez un modèle de 7 à 8 milliards de paramètres quantifié en 4 bits, par exemple Qwen 3 8B, Llama 3.1 8B ou Gemma 3 12B si vous avez 16 Go. Il tournera sur presque tout, répondra à une vitesse raisonnable et sera suffisant pour savoir si cette méthode de travail vous convient. Avec 16 Go de mémoire vidéo ou un Mac de 32 Go, vous pouvez aussi essayer gpt-oss 20B, le modèle open source d’OpenAI.

Installation et premier modèle #

  1. Téléchargez le programme depuis le site officiel de LM Studio dans la version correspondant à votre système et installez-le comme n’importe quelle autre application.

  2. Lors du premier lancement, il vous propose un modèle à télécharger. Acceptez, ou recherchez-en un spécifique avec l’icône de loupe dans la barre latérale.

  3. Dans les résultats, chaque variante indique son poids et sa compatibilité avec votre matériel. Choisissez celle qui tient dans votre mémoire.

  4. Une fois le téléchargement terminé, ouvrez le chat, chargez le modèle depuis le menu en haut et commencez à écrire.

Le premier chargement dure quelques dizaines de secondes, car le modèle doit être lu en mémoire. Ensuite, les réponses arrivent immédiatement.

Recherche de modèles dans LM Studio avec la liste des modèles et les options de téléchargement de la variante quantifiée
La recherche indique quelles variantes rentrent dans la mémoire disponible

Les paramètres essentiels #

Lorsque vous chargez un modèle, vous trouverez certains paramètres. Il y en a trois principaux à régler.

Longueur du contexte. Détermine la quantité de texte que le modèle peut garder en mémoire. L’augmenter vous permet de travailler sur des documents longs, mais cela consomme beaucoup plus de mémoire : c’est le paramètre qui cause le plus souvent des erreurs de chargement.

Déchargement sur le GPU. Détermine la partie du modèle envoyée vers la carte graphique. Avec une carte dédiée, réglez-le au maximum de ce que votre mémoire vidéo permet : les réponses deviendront beaucoup plus rapides.

Température. Régule le degré d’imprévisibilité des réponses : des valeurs basses pour des tâches précises comme l’extraction de données ou la classification, et des valeurs plus hautes pour l’écriture créative.

L’utiliser avec vos propres documents #

La fonction la plus utile en pratique est de poser des questions sur vos fichiers : un contrat, un manuel, une collection de notes. Faites glisser le PDF dans le chat, le programme extrait le texte, le découpe et transmet au modèle les segments nécessaires pour répondre (c’est la technique appelée RAG).

Chat de LM Studio avec un PDF joint et la réponse du modèle basée sur son contenu

Cela fonctionne très bien avec des documents de taille normale et des questions précises. Avec des archives énormes ou des questions nécessitant de lier des informations éparpillées dans des sections éloignées, les limites se font sentir.

Pour certains usages, cependant, l’avantage est décisif : rien ne sort de votre ordinateur, vous pouvez donc analyser des documents que vous ne téléchargeriez jamais sur un service externe.

Le serveur local #

LM Studio peut faire tourner le modèle comme un service sur votre ordinateur, compatible avec les API d’OpenAI, généralement à l’adresse http://localhost:1234/v1. Cela signifie que les programmes et scripts écrits pour les services en ligne peuvent utiliser le modèle local en changeant simplement l’adresse. Depuis le terminal, vous pouvez également le gérer avec la commande lms.

Paramètres du serveur local de LM Studio avec le port 1234, CORS et chargement des modèles à la demande

Cela intéresse surtout les développeurs : vous pouvez tester une application sans consommer de crédits et sans envoyer de données à l’extérieur.

Les alternatives #

Ollama effectue le même travail via la ligne de commande (ollama run qwen3), et il est plus adapté à ceux qui travaillent dans le terminal ou souhaitent l’intégrer dans des scripts et services. Il dispose désormais de sa propre application avec chat, et s’associe à des interfaces comme Open WebUI.

Msty, à laquelle était dédiée la première version de cet article, s’appelle aujourd’hui Msty Studio : elle possède une interface très soignée, regroupe dans une même fenêtre modèles locaux et services en ligne avec vos clés API, et propose les Stacks de connaissances pour interroger vos documents ainsi que le chat divisé pour comparer les réponses de plusieurs modèles. L’accès est gratuit, avec une licence payante pour les fonctionnalités avancées.

Chat de Msty avec choix du modèle et stacks de connaissances connectés
Msty combine modèles locaux, services en ligne et documents

Les solutions intégrées au système, comme les modèles d’Apple Intelligence sur les appareils Apple ou ceux des PC Copilot+ dotés d’un accélérateur dédié, vous offrent moins de choix mais ne nécessitent aucune installation.

GPT4All et des projets similaires offrent une expérience proche de celle de LM Studio, avec des catalogues et des paramètres différents.

Foire aux questions #

Cela fonctionne-t-il aussi sans connexion internet ? #

Oui, après avoir téléchargé le modèle. La connexion n’est nécessaire que pour le catalogue et les mises à jour. C’est précisément pour cette raison que cela intéresse ceux qui travaillent avec des documents confidentiels.

Quelle est la différence de performance par rapport aux services en ligne ? #

Sur des tâches ciblées (résumer, reformuler, traduire, extraire des informations d’un texte), un bon modèle de 7 à 14 milliards de paramètres s’en sort très bien. Pour les raisonnements longs, les questions nécessitant de vastes connaissances et le code complexe, l’écart avec les modèles des grands services reste marqué.

Une carte graphique dédiée est-elle nécessaire ? #

Non, mais cela aide beaucoup. Sans cela, le modèle tourne sur le processeur et les réponses arrivent plus lentement, même si cela reste utilisable avec les petits modèles. Sur les Mac équipés de puces Apple, le problème ne se pose pas, car la mémoire unifiée assure ce travail.

Les modèles sont-ils gratuits ? #

Ceux sous licence ouverte le sont, et c’est presque tout le catalogue. Cependant, les licences varient d’un modèle à l’autre : certaines (comme celle de Llama) imposent des conditions sur l’utilisation commerciale, d’autres (Qwen, Mistral, gpt-oss) sont sous Apache 2.0. Si vous utilisez un modèle pour votre travail, lisez la licence.

Quel espace est nécessaire sur le disque ? #

Chaque modèle occupe de quelques gigaoctets à plusieurs dizaines de Go. Avec quatre ou cinq modèles, on atteint rapidement les 50 Go : pensez à consulter régulièrement la section Mes modèles et à supprimer ceux que vous n’utilisez plus.

À lire ensuite