KI-Modelle lokal ausführen mit LM Studio
Installiere LM Studio, wähle das passende Modell für deinen RAM und nutze KI offline: Anforderungen, Quantisierung und erste Schritte.

Auf dieser Seite
Die richtigen Erwartungen. Modelle, die auf einem Heimcomputer laufen, sind weniger leistungsfähig als die von großen Online-Diensten. Zum Zusammenfassen, Umformulieren, Klassifizieren, Übersetzen und logischen Schlussfolgern aus deinen Dokumenten sind sie aber hervorragend geeignet; bei komplexen Aufgaben merkt man den Unterschied zu ChatGPT oder Claude deutlich.
Ab Juli 2025 ist LM Studio auch für die geschäftliche Nutzung kostenlos, ohne dass Lizenzen angefordert werden müssen.
Voraussetzungen #
| System | Anforderungen |
|---|---|
| macOS | Nur Apple Silicon, macOS 14 oder neuer, 16 GB RAM empfohlen |
| Windows | x64 mit AVX2-Befehlssatz oder ARM, 16 GB RAM und 4 GB VRAM empfohlen |
| Linux | Ubuntu 20.04 oder neuer, als AppImage für x64 und ARM64 verfügbar |
Mit 8 GB RAM funktioniert es, aber nur mit den kleinsten Modellen. Der Sprung erfolgt bei 16 GB, und mit 32 GB kannst du fast alles nutzen, was auf einem persönlichen Computer sinnvoll ist.
Auf Macs mit Apple-Chips wird der Speicher zwischen Prozessor und Grafik geteilt, was ein großer Vorteil ist: Ein Mac mit 32 GB lädt Modelle, für die ein PC eine High-End-Grafikkarte bräuchte. LM Studio auf dem Mac nutzt auch Modelle im MLX-Format, die für diese Chips optimiert und meist schneller sind. Auf einem PC mit einer NVIDIA-Karte solltest du die Treiber aktuell halten.
Wie viel Speicher braucht welches Modell #
Das ist die entscheidende Frage, und die Antwort hängt von der Quantisierung ab: einer Technik, welche die Präzision der Zahlen innerhalb des Modells reduziert, wodurch es viel weniger Speicher verbraucht – auf Kosten eines geringfügigen Qualitätsverlusts.
Ein Modell wird durch die Anzahl der Parameter (7B, 14B, 32B, wobei B für Milliarden steht) und das Quantisierungslevel angegeben, oft geschrieben als Q4_K_M oder ähnlich. Je niedriger die Zahl nach dem Q ist, desto leichter ist die Datei und desto mehr sinkt die Qualität.
Als praktischer Referenzwert:
| Modell | 4-Bit quantisierte Datei | Empfohlener Arbeitsspeicher |
|---|---|---|
| 3B | ca. 2 GB | 8 GB |
| 7-8B | ca. 4-5 GB | 16 GB |
| 14B | ca. 8-9 GB | 16-24 GB |
| 32B | ca. 18-20 GB | 32 GB |
| 70B | ca. 40 GB | 64 GB oder mehr |
Die Faustregel lautet: Schau, wie groß die Datei ist, und addiere ein paar Gigabyte für den Kontext und das Betriebssystem dazu. Wenn die Summe den verfügbaren Speicher übersteigt, läuft das Modell zwar trotzdem, aber viel langsamer, da ein Teil der Arbeit auf den Prozessor oder die Festplatte ausgelagert wird.
Installation und das erste Modell #
Lade die Software von der offiziellen LM Studio Website in der Version für dein System herunter und installiere sie wie jede andere App.
Beim ersten Start wird dir ein Modell zum Download vorgeschlagen. Bestätige dies oder suche über das Lupen-Symbol in der Seitenleiste nach einem spezifischen Modell.
In den Suchergebnissen zeigt jede Variante an, wie groß sie ist und ob sie mit deiner Hardware kompatibel ist. Wähle eine aus, die in deinen Arbeitsspeicher passt.
Sobald der Download abgeschlossen ist, öffne den Chat, lade das Modell über das Menü oben und fang an zu schreiben.
Das erste Laden dauert ein paar zehn Sekunden, da das Modell in den Speicher geladen wird. Danach erfolgen die Antworten sofort.

Die wichtigsten Einstellungen #
Wenn du ein Modell lädst, findest du einige Parameter. Die wichtigsten sind drei.
Kontextlänge (Context Length). Bestimmt, wie viel Text das Modell im Gedächtnis behalten kann. Eine Erhöhung ermöglicht die Arbeit mit langen Dokumenten, verbraucht aber deutlich mehr Speicher: Dies ist der Parameter, der am häufigsten zu Ladefehlern führt.
GPU-Offloading. Legt fest, welcher Teil des Modells auf die Grafikkarte ausgelagert wird. Bei einer dedizierten Grafikkarte kannst du den Wert so hoch setzen, wie es der Videospeicher erlaubt: Die Antworten werden dadurch viel schneller.
Temperatur (Temperature). Regelt, wie vorhersehbar die Antworten sind: Niedrige Werte für präzise Aufgaben wie Datenextraktion oder Klassifizierung, höhere Werte für kreatives Schreiben.
Nutzung mit eigenen Dokumenten #
Die nützlichste Funktion in der Praxis ist das Stellen von Fragen zu deinen Dateien: einem Vertrag, einem Handbuch oder einer Sammlung von Notizen. Ziehe die PDF einfach in den Chat; das Programm extrahiert den Text, teilt ihn auf und übergibt dem Modell genau die Teile, die für die Antwort benötigt werden (dies nennt man RAG-Technik).

Das funktioniert gut bei Dokumenten normaler Größe und präzisen Fragen. Bei riesigen Archiven oder Fragen, die Informationen aus weit entfernten Stellen verknüpfen müssen, stößt man an Grenzen.
Für bestimmte Anwendungen ist der Vorteil jedoch entscheidend: Nichts verlässt deinen Computer, sodass du Dokumente analysieren kannst, die du niemals auf einen externen Dienst hochladen würdest.
Der lokale Server #
LM Studio kann das Modell als Service auf deinem Computer laufen lassen, kompatibel mit der OpenAI-API, normalerweise unter der Adresse http://localhost:1234/v1. Das bedeutet, dass Programme und Skripte, die für Online-Dienste geschrieben wurden, das lokale Modell nutzen können, indem sie lediglich die Adresse ändern. Über das Terminal kannst du ihn auch mit dem Befehl lms steuern.

Das ist besonders interessant für Entwickler: Du kannst eine Anwendung ausprobieren, ohne Credits zu verbrauchen und ohne Daten nach außen zu senden.
Alternativen #
Ollama erledigt die gleiche Arbeit über die Kommandozeile (ollama run qwen3) und eignet sich daher besser für alle, die im Terminal arbeiten oder es in Skripte und Dienste integrieren wollen. Mittlerweile gibt es auch eine eigene App mit Chat-Funktion, die sich hervorragend mit Oberflächen wie Open WebUI kombinieren lässt.
Msty, worauf sich die erste Version dieses Artikels bezog, heißt heute Msty Studio: Es hat ein sehr ansprechendes Interface, kombiniert lokale Modelle und Online-Dienste mit deinen eigenen API-Keys in einem Fenster und bietet Knowledge Stacks, um deine Dokumente abzufragen, sowie geteilte Chats, um die Antworten mehrerer Modelle zu vergleichen. Der Einstieg ist kostenlos, für fortgeschrittene Funktionen gibt es eine kostenpflichtige Lizenz.

Systemintegrierte Lösungen, wie die Apple Intelligence-Modelle auf Apple-Geräten oder die auf Copilot+ PCs mit dediziertem Beschleuniger, bieten dir zwar weniger Auswahl, erfordern aber keine Installation.
GPT4All und ähnliche Projekte bieten eine Erfahrung, die der von LM Studio sehr nahe kommt, jedoch mit anderen Katalogen und Einstellungen.
Häufig gestellte Fragen #
Funktioniert es auch ohne Internetverbindung? #
Ja, sobald das Modell heruntergeladen wurde. Eine Verbindung wird nur für den Katalog und Updates benötigt. Genau deshalb ist es besonders für Leute interessant, die mit vertraulichen Dokumenten arbeiten.
Wie viel schlechter sind sie im Vergleich zu Online-Diensten? #
Bei begrenzten Aufgaben (Zusammenfassen, Umformulieren, Übersetzen, Informationen aus einem Text extrahieren) schlägt sich ein gutes Modell mit 7 bis 14 Milliarden Parametern recht gut. Bei komplexen logischen Schlussfolgerungen, Fragen, die viel Fachwissen erfordern, und kompliziertem Code bleibt der Abstand zu den Modellen der großen Cloud-Anbieter jedoch deutlich.
Brauche ich eine dedizierte Grafikkarte? #
Nein, aber es hilft sehr. Ohne Beschleunigung läuft das Modell über den Prozessor und die Antworten kommen langsamer, auch wenn kleine Modelle weiterhin nutzbar bleiben. Auf Macs mit Apple-Chips gibt es dieses Problem nicht, da der Unified Memory diese Aufgabe übernimmt.
Sind die Modelle kostenlos? #
Die Modelle mit Open-Source-Lizenz sind es, und das trifft fast alle im Katalog zu. Die Lizenzen unterscheiden sich jedoch von Modell zu Modell: Einige (wie die von Llama) stellen Bedingungen für die kommerzielle Nutzung, andere (Qwen, Mistral, gpt-oss) nutzen Apache 2.0. Wenn du das Modell beruflich einsetzen möchtest, lies dir die Lizenz durch.
Wie viel Speicherplatz wird benötigt? #
Jedes Modell belegt zwischen ein paar Gigabyte und mehreren Dutzend Gigabyte. Mit vier oder fünf Modellen sind 50 GB schnell erreicht: Schau ab und zu in den Bereich Meine Modelle und lösche diejenigen, die du nicht mehr brauchst.

