↓Zum Hauptinhalt springen
Alemasone

KI-Modelle lokal ausführen mit LM Studio

Installiere LM Studio, wähle das passende Modell für deinen RAM und nutze KI offline: Anforderungen, Quantisierung und erste Schritte.

7 Min. Lesezeit Aktualisiert am
LM Studio Benutzeroberfläche mit einem geladenen Modell und einem laufenden Chat
Auf dieser Seite
Wenn du ein Sprachmodell auf deinem Computer laufen lässt, verlassen die Dokumente deinen Rechner nicht und du zahlst keine Abonnements. LM Studio ist der einfachste Weg: Du installierst es, wählst ein Modell aus dem Katalog aus und fängst an zu schreiben. Die Grenze ist der Arbeitsspeicher: Du benötigst mindestens so viel Speicherplatz, wie die Modelldatei groß ist, plus etwas Puffer.

Die richtigen Erwartungen. Modelle, die auf einem Heimcomputer laufen, sind weniger leistungsfähig als die von großen Online-Diensten. Zum Zusammenfassen, Umformulieren, Klassifizieren, Übersetzen und logischen Schlussfolgern aus deinen Dokumenten sind sie aber hervorragend geeignet; bei komplexen Aufgaben merkt man den Unterschied zu ChatGPT oder Claude deutlich.

Ab Juli 2025 ist LM Studio auch für die geschäftliche Nutzung kostenlos, ohne dass Lizenzen angefordert werden müssen.

Voraussetzungen #

SystemAnforderungen
macOSNur Apple Silicon, macOS 14 oder neuer, 16 GB RAM empfohlen
Windowsx64 mit AVX2-Befehlssatz oder ARM, 16 GB RAM und 4 GB VRAM empfohlen
LinuxUbuntu 20.04 oder neuer, als AppImage für x64 und ARM64 verfügbar

Mit 8 GB RAM funktioniert es, aber nur mit den kleinsten Modellen. Der Sprung erfolgt bei 16 GB, und mit 32 GB kannst du fast alles nutzen, was auf einem persönlichen Computer sinnvoll ist.

Auf Macs mit Apple-Chips wird der Speicher zwischen Prozessor und Grafik geteilt, was ein großer Vorteil ist: Ein Mac mit 32 GB lädt Modelle, für die ein PC eine High-End-Grafikkarte bräuchte. LM Studio auf dem Mac nutzt auch Modelle im MLX-Format, die für diese Chips optimiert und meist schneller sind. Auf einem PC mit einer NVIDIA-Karte solltest du die Treiber aktuell halten.

Wie viel Speicher braucht welches Modell #

Das ist die entscheidende Frage, und die Antwort hängt von der Quantisierung ab: einer Technik, welche die Präzision der Zahlen innerhalb des Modells reduziert, wodurch es viel weniger Speicher verbraucht – auf Kosten eines geringfügigen Qualitätsverlusts.

Ein Modell wird durch die Anzahl der Parameter (7B, 14B, 32B, wobei B für Milliarden steht) und das Quantisierungslevel angegeben, oft geschrieben als Q4_K_M oder ähnlich. Je niedriger die Zahl nach dem Q ist, desto leichter ist die Datei und desto mehr sinkt die Qualität.

Als praktischer Referenzwert:

Modell4-Bit quantisierte DateiEmpfohlener Arbeitsspeicher
3Bca. 2 GB8 GB
7-8Bca. 4-5 GB16 GB
14Bca. 8-9 GB16-24 GB
32Bca. 18-20 GB32 GB
70Bca. 40 GB64 GB oder mehr

Die Faustregel lautet: Schau, wie groß die Datei ist, und addiere ein paar Gigabyte für den Kontext und das Betriebssystem dazu. Wenn die Summe den verfügbaren Speicher übersteigt, läuft das Modell zwar trotzdem, aber viel langsamer, da ein Teil der Arbeit auf den Prozessor oder die Festplatte ausgelagert wird.

Der ideale Einstieg. Wähle ein Modell mit 7 bis 8 Milliarden Parametern, das auf 4-Bit quantisiert ist, zum Beispiel Qwen 3 8B, Llama 3.1 8B oder Gemma 3 (bei 16 GB) mit 12B. Es läuft auf fast allem, antwortet in einer angemessenen Geschwindigkeit und reicht aus, um zu testen, ob dieser Workflow etwas für dich ist. Mit 16 GB VRAM oder einem Mac mit 32 GB kannst du auch gpt-oss 20B ausprobieren, das Open-Source-Modell von OpenAI.

Installation und das erste Modell #

  1. Lade die Software von der offiziellen LM Studio Website in der Version für dein System herunter und installiere sie wie jede andere App.

  2. Beim ersten Start wird dir ein Modell zum Download vorgeschlagen. Bestätige dies oder suche über das Lupen-Symbol in der Seitenleiste nach einem spezifischen Modell.

  3. In den Suchergebnissen zeigt jede Variante an, wie groß sie ist und ob sie mit deiner Hardware kompatibel ist. Wähle eine aus, die in deinen Arbeitsspeicher passt.

  4. Sobald der Download abgeschlossen ist, öffne den Chat, lade das Modell über das Menü oben und fang an zu schreiben.

Das erste Laden dauert ein paar zehn Sekunden, da das Modell in den Speicher geladen wird. Danach erfolgen die Antworten sofort.

Modellsuche in LM Studio mit der Modellliste und den Download-Optionen für quantisierte Varianten
Die Suche zeigt an, welche Varianten in den verfügbaren Speicher passen

Die wichtigsten Einstellungen #

Wenn du ein Modell lädst, findest du einige Parameter. Die wichtigsten sind drei.

Kontextlänge (Context Length). Bestimmt, wie viel Text das Modell im Gedächtnis behalten kann. Eine Erhöhung ermöglicht die Arbeit mit langen Dokumenten, verbraucht aber deutlich mehr Speicher: Dies ist der Parameter, der am häufigsten zu Ladefehlern führt.

GPU-Offloading. Legt fest, welcher Teil des Modells auf die Grafikkarte ausgelagert wird. Bei einer dedizierten Grafikkarte kannst du den Wert so hoch setzen, wie es der Videospeicher erlaubt: Die Antworten werden dadurch viel schneller.

Temperatur (Temperature). Regelt, wie vorhersehbar die Antworten sind: Niedrige Werte für präzise Aufgaben wie Datenextraktion oder Klassifizierung, höhere Werte für kreatives Schreiben.

Nutzung mit eigenen Dokumenten #

Die nützlichste Funktion in der Praxis ist das Stellen von Fragen zu deinen Dateien: einem Vertrag, einem Handbuch oder einer Sammlung von Notizen. Ziehe die PDF einfach in den Chat; das Programm extrahiert den Text, teilt ihn auf und übergibt dem Modell genau die Teile, die für die Antwort benötigt werden (dies nennt man RAG-Technik).

LM Studio Chat mit einem angehängten PDF und der Antwort des Modells basierend auf dessen Inhalt

Das funktioniert gut bei Dokumenten normaler Größe und präzisen Fragen. Bei riesigen Archiven oder Fragen, die Informationen aus weit entfernten Stellen verknüpfen müssen, stößt man an Grenzen.

Für bestimmte Anwendungen ist der Vorteil jedoch entscheidend: Nichts verlässt deinen Computer, sodass du Dokumente analysieren kannst, die du niemals auf einen externen Dienst hochladen würdest.

Der lokale Server #

LM Studio kann das Modell als Service auf deinem Computer laufen lassen, kompatibel mit der OpenAI-API, normalerweise unter der Adresse http://localhost:1234/v1. Das bedeutet, dass Programme und Skripte, die für Online-Dienste geschrieben wurden, das lokale Modell nutzen können, indem sie lediglich die Adresse ändern. Über das Terminal kannst du ihn auch mit dem Befehl lms steuern.

Einstellungen des lokalen LM Studio Servers mit Port 1234, CORS und dem Laden von Modellen auf Anfrage

Das ist besonders interessant für Entwickler: Du kannst eine Anwendung ausprobieren, ohne Credits zu verbrauchen und ohne Daten nach außen zu senden.

Alternativen #

Ollama erledigt die gleiche Arbeit über die Kommandozeile (ollama run qwen3) und eignet sich daher besser für alle, die im Terminal arbeiten oder es in Skripte und Dienste integrieren wollen. Mittlerweile gibt es auch eine eigene App mit Chat-Funktion, die sich hervorragend mit Oberflächen wie Open WebUI kombinieren lässt.

Msty, worauf sich die erste Version dieses Artikels bezog, heißt heute Msty Studio: Es hat ein sehr ansprechendes Interface, kombiniert lokale Modelle und Online-Dienste mit deinen eigenen API-Keys in einem Fenster und bietet Knowledge Stacks, um deine Dokumente abzufragen, sowie geteilte Chats, um die Antworten mehrerer Modelle zu vergleichen. Der Einstieg ist kostenlos, für fortgeschrittene Funktionen gibt es eine kostenpflichtige Lizenz.

Msty-Chat mit Modellauswahl und verknüpften Knowledge Stacks
Msty kombiniert lokale Modelle, Online-Dienste und Dokumente

Systemintegrierte Lösungen, wie die Apple Intelligence-Modelle auf Apple-Geräten oder die auf Copilot+ PCs mit dediziertem Beschleuniger, bieten dir zwar weniger Auswahl, erfordern aber keine Installation.

GPT4All und ähnliche Projekte bieten eine Erfahrung, die der von LM Studio sehr nahe kommt, jedoch mit anderen Katalogen und Einstellungen.

Häufig gestellte Fragen #

Funktioniert es auch ohne Internetverbindung? #

Ja, sobald das Modell heruntergeladen wurde. Eine Verbindung wird nur für den Katalog und Updates benötigt. Genau deshalb ist es besonders für Leute interessant, die mit vertraulichen Dokumenten arbeiten.

Wie viel schlechter sind sie im Vergleich zu Online-Diensten? #

Bei begrenzten Aufgaben (Zusammenfassen, Umformulieren, Übersetzen, Informationen aus einem Text extrahieren) schlägt sich ein gutes Modell mit 7 bis 14 Milliarden Parametern recht gut. Bei komplexen logischen Schlussfolgerungen, Fragen, die viel Fachwissen erfordern, und kompliziertem Code bleibt der Abstand zu den Modellen der großen Cloud-Anbieter jedoch deutlich.

Brauche ich eine dedizierte Grafikkarte? #

Nein, aber es hilft sehr. Ohne Beschleunigung läuft das Modell über den Prozessor und die Antworten kommen langsamer, auch wenn kleine Modelle weiterhin nutzbar bleiben. Auf Macs mit Apple-Chips gibt es dieses Problem nicht, da der Unified Memory diese Aufgabe übernimmt.

Sind die Modelle kostenlos? #

Die Modelle mit Open-Source-Lizenz sind es, und das trifft fast alle im Katalog zu. Die Lizenzen unterscheiden sich jedoch von Modell zu Modell: Einige (wie die von Llama) stellen Bedingungen für die kommerzielle Nutzung, andere (Qwen, Mistral, gpt-oss) nutzen Apache 2.0. Wenn du das Modell beruflich einsetzen möchtest, lies dir die Lizenz durch.

Wie viel Speicherplatz wird benötigt? #

Jedes Modell belegt zwischen ein paar Gigabyte und mehreren Dutzend Gigabyte. Mit vier oder fünf Modellen sind 50 GB schnell erreicht: Schau ab und zu in den Bereich Meine Modelle und lösche diejenigen, die du nicht mehr brauchst.

Weiterlesen