zalar.atFOKUS KÜNSTLICHE INTELLIGENZ

04 / KI LOKAL BETREIBEN

Dein Rechner.
Deine Daten.
Deine KI.

Ein Sprachmodell muss nicht in einem Rechenzentrum laufen. Für viele Alltagsaufgaben reicht ein gut ausgestatteter Laptop oder Desktop.

Datenschutz

Bei vollständig lokaler Verarbeitung bleiben Eingaben auf deinem Gerät.

Unabhängigkeit

Modell und Version selbst wählen und Updates bewusst steuern.

Keine API-Gebühren

Lokale Inferenz kostet keine Tokens. Hardware und Strom bleiben Kostenfaktoren.

Auch offline

Nach dem Download von Modell und Laufzeit ohne Internet chatten.

Illustration eines kompakten Computers mit Prozessor und leuchtenden Datenmodulen
INTELLIGENZ AUF DEINEM GERÄTGroße Ideen brauchen
nicht immer die Cloud.
Symbolische KI-Illustration · keine konkrete Hardware-Empfehlung

DAS PASSENDE FUNDAMENT

Wie viel Hardware brauchst du?

„B“ steht für Milliarden Parameter. Für den Einstieg sind 7B- bis 8B-Modelle mit 4-Bit-Quantisierung oft ein sinnvoller Kompromiss.

Planungswerte für dichte Textmodelle, 4 Bit und moderaten Kontext (ca. 4–8K Tokens)
ModellgrößeGewichte ca.GPU-Speicher¹RAM / Unified Memory²Einordnung
7B–8B EINSTIEG4–6 GB8–12 GB16 GBChat, Zusammenfassungen, einfache Codehilfe
14B8–10 GB12–16 GB24–32 GBMehr Reserven für anspruchsvollere Aufgaben
30B–32B18–22 GB24–32 GB48–64 GBLeistungsfähiger Desktop oder große Macs
70B40–48 GB48–64+ GB64–96+ GBWorkstation; höherer Speicher- und Zeitbedarf

Eigene konservative Planungswerte, keine Mindestanforderungen oder Geschwindigkeitsgarantien. ¹ Für weitgehend vollständige GPU-Ausführung. ² Alternative bei CPU-Betrieb oder Apple Silicon; System und andere Apps brauchen Reserven. Architektur, Quantisierung, KV-Cache, Kontextlänge und parallele Anfragen verändern den Bedarf. Bei MoE-Modellen zählt für den Speicher die Gesamtzahl der Gewichte, nicht nur die Zahl aktiver Parameter.

CPU: funktioniert, braucht Zeit

Ohne passende GPU kann das Modell im Arbeitsspeicher laufen. Die Ausgabe ist häufig langsamer, insbesondere bei großen Modellen. Ein schneller Prozessor ersetzt fehlende Speicherbandbreite nicht.

GPU: VRAM ist entscheidend

Eine unterstützte Grafikkarte beschleunigt viele Rechenschritte. Passt das Modell nicht vollständig in den VRAM, können Teile im RAM verbleiben – mit möglichen Leistungseinbußen.

Apple Silicon: gemeinsamer Speicher

CPU und GPU teilen sich Unified Memory. Das kann größere Modelle ermöglichen, aber nicht der gesamte Speicher steht der KI zur Verfügung. Betriebssystem und Anwendungen benötigen ebenfalls Platz.

Orientierung zur Laufzeit: LM Studio empfiehlt 16 GB oder mehr RAM. Die konkrete Modelldatei vor dem Download prüfen.

WENIGER SPEICHER, MEHR MÖGLICHKEITEN

Quantisierung.
Die KI wird kompakter.

Modellgewichte sind Zahlen. Quantisierung speichert sie mit geringerer Genauigkeit, etwa mit 8 statt 16 Bit oder näherungsweise mit 4 Bit. Das spart Speicher und kann die Ausführung erleichtern; die Qualität kann je nach Verfahren und Aufgabe sinken.

GGUF ist ein Dateiformat, keine Bitstufe. Es bündelt Gewichte und Metadaten für kompatible Laufzeiten wie llama.cpp. Eine GGUF-Datei kann unterschiedlich quantisiert sein. „Q4_K_M“ bezeichnet beispielsweise eine verbreitete gemischte Quantisierungsvariante.

7 Milliarden Parameter · theoretisch nur Gewichte
16 Bit
14 GB
8 Bit
7 GB
4 Bit
3,5 GB

Parameter × Bits ÷ 8. Reale Dateien und der laufende Betrieb brauchen zusätzlich Platz für Metadaten, Skalierungswerte, Kontext und Laufzeit.

VOM MODELL ZUR ANWENDUNG

Das richtige Werkzeug für deinen Einstieg.

Desktop-Apps vereinfachen den Anfang. Erweiterte Oberflächen bieten mehr Kontrolle, verlangen aber auch mehr Einrichtung und Wartung.

DESKTOP · EINFACHER EINSTIEG

LM Studio

Modelle suchen, herunterladen und in einer grafischen Oberfläche nutzen. Unterstützt lokale Chats und einen lokalen API-Server. Die App ist proprietär; Modelllizenzen gelten separat.

LM Studio ansehen ↗
DESKTOP & CLI · FLEXIBEL

Ollama

Modelle lokal verwalten und per App, Kommandozeile oder API ausführen. Besonders praktisch als Basis für andere Oberflächen. Lokale und Cloud-Modelle bewusst unterscheiden.

Ollama ansehen ↗
DESKTOP · OPEN SOURCE

Jan.ai

Chat-Anwendung mit lokalen Modellen und optionalen Cloud-Anbindungen. Für Offline-Nutzung ein lokales Modell wählen; verbundene externe Anbieter verarbeiten Daten außerhalb des Rechners.

Jan ansehen ↗
SELF-HOSTED · BROWSER-UI

Open WebUI

Eine selbst gehostete Oberfläche, etwa für Ollama, mit Dokumentenfunktionen und Benutzerverwaltung. Die Oberfläche ist nicht selbst das Sprachmodell. Aktuelle Lizenz- und Brandingbedingungen prüfen.

Open WebUI ansehen ↗
FORTGESCHRITTEN · VIELE OPTIONEN

Text Generation WebUI

Das oobabooga-Projekt bietet umfassende Einstellungen für lokale Modelle und verschiedene Ladeverfahren. Heute im Repository „textgen“ weitergeführt. Geeignet, wenn du tiefer in Konfiguration und Modellbetrieb einsteigen willst.

Zum oobabooga-Projekt ↗

DEIN ERSTER LOKALER CHAT

In vier Schritten loslegen.

Ein überschaubares Modell und ein kurzer Kontext erleichtern den ersten Test.

  1. App installieren. LM Studio oder Jan von der offiziellen Website laden und die Systemanforderungen prüfen.
  2. Modell auswählen. Ein zur Laufzeit passendes 7B-/8B-Instruct-Modell in 4 Bit wählen. Lizenz und Speicherbedarf kontrollieren.
  3. Lokal laden und testen. Mit einer kurzen, unkritischen Frage starten. Speicherverbrauch und Antwortgeschwindigkeit beobachten.
  4. Offline prüfen. Nach allen Downloads die Internetverbindung trennen. Externe APIs, Websuche und Cloud-Funktionen deaktivieren.
Lokal heißt nicht automatisch privat

Cloud-Anbindungen, Erweiterungen, Synchronisierung oder Protokolle können Daten weitergeben oder speichern. Einstellungen prüfen, Gerät absichern und lokale API-Server nicht ungeschützt im Internet bereitstellen. Offline funktionieren nur die Komponenten, die vollständig auf deinem Gerät vorhanden sind.

Stand: 28. September 2026 · Quellen und weiterführendes Wissen