CPU: funktioniert, braucht Zeit
Ohne passende GPU kann das Modell im Arbeitsspeicher laufen. Die Ausgabe ist häufig langsamer, insbesondere bei großen Modellen. Ein schneller Prozessor ersetzt fehlende Speicherbandbreite nicht.
04 / KI LOKAL BETREIBEN
Ein Sprachmodell muss nicht in einem Rechenzentrum laufen. Für viele Alltagsaufgaben reicht ein gut ausgestatteter Laptop oder Desktop.
Bei vollständig lokaler Verarbeitung bleiben Eingaben auf deinem Gerät.
Modell und Version selbst wählen und Updates bewusst steuern.
Lokale Inferenz kostet keine Tokens. Hardware und Strom bleiben Kostenfaktoren.
Nach dem Download von Modell und Laufzeit ohne Internet chatten.

DAS PASSENDE FUNDAMENT
„B“ steht für Milliarden Parameter. Für den Einstieg sind 7B- bis 8B-Modelle mit 4-Bit-Quantisierung oft ein sinnvoller Kompromiss.
| Modellgröße | Gewichte ca. | GPU-Speicher¹ | RAM / Unified Memory² | Einordnung |
|---|---|---|---|---|
| 7B–8B EINSTIEG | 4–6 GB | 8–12 GB | 16 GB | Chat, Zusammenfassungen, einfache Codehilfe |
| 14B | 8–10 GB | 12–16 GB | 24–32 GB | Mehr Reserven für anspruchsvollere Aufgaben |
| 30B–32B | 18–22 GB | 24–32 GB | 48–64 GB | Leistungsfähiger Desktop oder große Macs |
| 70B | 40–48 GB | 48–64+ GB | 64–96+ GB | Workstation; höherer Speicher- und Zeitbedarf |
Eigene konservative Planungswerte, keine Mindestanforderungen oder Geschwindigkeitsgarantien. ¹ Für weitgehend vollständige GPU-Ausführung. ² Alternative bei CPU-Betrieb oder Apple Silicon; System und andere Apps brauchen Reserven. Architektur, Quantisierung, KV-Cache, Kontextlänge und parallele Anfragen verändern den Bedarf. Bei MoE-Modellen zählt für den Speicher die Gesamtzahl der Gewichte, nicht nur die Zahl aktiver Parameter.
Ohne passende GPU kann das Modell im Arbeitsspeicher laufen. Die Ausgabe ist häufig langsamer, insbesondere bei großen Modellen. Ein schneller Prozessor ersetzt fehlende Speicherbandbreite nicht.
Eine unterstützte Grafikkarte beschleunigt viele Rechenschritte. Passt das Modell nicht vollständig in den VRAM, können Teile im RAM verbleiben – mit möglichen Leistungseinbußen.
CPU und GPU teilen sich Unified Memory. Das kann größere Modelle ermöglichen, aber nicht der gesamte Speicher steht der KI zur Verfügung. Betriebssystem und Anwendungen benötigen ebenfalls Platz.
Orientierung zur Laufzeit: LM Studio empfiehlt 16 GB oder mehr RAM. Die konkrete Modelldatei vor dem Download prüfen.
WENIGER SPEICHER, MEHR MÖGLICHKEITEN
Modellgewichte sind Zahlen. Quantisierung speichert sie mit geringerer Genauigkeit, etwa mit 8 statt 16 Bit oder näherungsweise mit 4 Bit. Das spart Speicher und kann die Ausführung erleichtern; die Qualität kann je nach Verfahren und Aufgabe sinken.
GGUF ist ein Dateiformat, keine Bitstufe. Es bündelt Gewichte und Metadaten für kompatible Laufzeiten wie llama.cpp. Eine GGUF-Datei kann unterschiedlich quantisiert sein. „Q4_K_M“ bezeichnet beispielsweise eine verbreitete gemischte Quantisierungsvariante.
Parameter × Bits ÷ 8. Reale Dateien und der laufende Betrieb brauchen zusätzlich Platz für Metadaten, Skalierungswerte, Kontext und Laufzeit.
VOM MODELL ZUR ANWENDUNG
Desktop-Apps vereinfachen den Anfang. Erweiterte Oberflächen bieten mehr Kontrolle, verlangen aber auch mehr Einrichtung und Wartung.
Modelle suchen, herunterladen und in einer grafischen Oberfläche nutzen. Unterstützt lokale Chats und einen lokalen API-Server. Die App ist proprietär; Modelllizenzen gelten separat.
LM Studio ansehen ↗Modelle lokal verwalten und per App, Kommandozeile oder API ausführen. Besonders praktisch als Basis für andere Oberflächen. Lokale und Cloud-Modelle bewusst unterscheiden.
Ollama ansehen ↗Chat-Anwendung mit lokalen Modellen und optionalen Cloud-Anbindungen. Für Offline-Nutzung ein lokales Modell wählen; verbundene externe Anbieter verarbeiten Daten außerhalb des Rechners.
Jan ansehen ↗Eine selbst gehostete Oberfläche, etwa für Ollama, mit Dokumentenfunktionen und Benutzerverwaltung. Die Oberfläche ist nicht selbst das Sprachmodell. Aktuelle Lizenz- und Brandingbedingungen prüfen.
Open WebUI ansehen ↗Das oobabooga-Projekt bietet umfassende Einstellungen für lokale Modelle und verschiedene Ladeverfahren. Heute im Repository „textgen“ weitergeführt. Geeignet, wenn du tiefer in Konfiguration und Modellbetrieb einsteigen willst.
Zum oobabooga-Projekt ↗DEIN ERSTER LOKALER CHAT
Ein überschaubares Modell und ein kurzer Kontext erleichtern den ersten Test.
Cloud-Anbindungen, Erweiterungen, Synchronisierung oder Protokolle können Daten weitergeben oder speichern. Einstellungen prüfen, Gerät absichern und lokale API-Server nicht ungeschützt im Internet bereitstellen. Offline funktionieren nur die Komponenten, die vollständig auf deinem Gerät vorhanden sind.
Stand: 28. September 2026 · Quellen und weiterführendes Wissen