Lokale LLMs auf eigener Hardware: Der komplette Einstieg
Sprachmodelle wie ChatGPT laufen in der Cloud – deine Eingaben verlassen dabei dein Zuhause. Wer Wert auf Datenschutz legt, keine laufenden Abokosten will oder einfach offline arbeiten möchte, kann ein Large Language Model (LLM) auch komplett lokal betreiben. Dieser Guide zeigt, wie viel VRAM du für welches Modell brauchst, welche Tools es gibt und welche Hardware sich für welches Budget lohnt.
Warum lokal?
Drei Gründe sprechen für das eigene LLM. Erstens Datenschutz: Keine Prompts werden an fremde Server geschickt, alles bleibt auf deiner Maschine – ideal für sensible Dokumente, interne Notizen oder Kundendaten. Zweitens Kosten: Einmal Hardware kaufen, dann dauerhaft ohne Nutzungsgebühren – bei intensiver Nutzung schnell günstiger als ein Abo. Drittens Offline-Fähigkeit: Kein Internet, kein Ausfall, keine API-Limits. Dafür gilt: Lokale Modelle sind kleiner und weniger leistungsfähig als GPT-4-Klasse-Modelle – für viele Aufgaben wie Zusammenfassen, Schreiben, Übersetzen oder Code-Hilfe reichen sie aber völlig.
VRAM-Bedarf nach Modellgröße
Der wichtigste Faktor ist der Grafikspeicher (VRAM). Die Modellgröße wird in Milliarden Parametern (B) angegeben. Mit Q4-Quantisierung – dem Standardkompromiss zwischen Qualität und Größe – ergibt sich folgender grober Bedarf:
| Modellgröße | VRAM (Q4) | Beispiele |
|---|---|---|
| 7B | ≈ 6 GB | Llama 3.1 8B, Mistral 7B, Qwen 2.5 7B |
| 13B | ≈ 10 GB | Llama 3.1 13B, Qwen 2.5 14B |
| 32B | ≈ 20 GB | Qwen 2.5 32B, Llama 3.3 30B |
| 70B | ≈ 40 GB | Llama 3.3 70B, Qwen 2.5 72B |
Faustregel: Läuft das Modell vollständig im VRAM, antwortet es schnell. Passt es nicht hinein, wird ein Teil in den Arbeitsspeicher (RAM) ausgelagert und es wird spürbar langsamer – laufen lassen kann man es trotzdem.
Die Tools
Ollama ist der einfachste Einstieg: ein Befehl installiert, ein Befehl lädt ein Modell, fertig. Es verwaltet Modelle, Quantisierungen und die Ausführung automatisch – ideal für Anfänger. llama.cpp ist das zugrunde liegende C++-Projekt, das Modelle effizient auf CPU und GPU ausführt; es ist flexibler, aber technischer. Open WebUI setzt eine chatGPT-ähnliche Oberfläche auf Ollama (oder llama.cpp) und macht die lokale KI komfortabel im Browser nutzbar – inklusive Chat-Verlauf, System-Prompts und optionaler Anbindung eigener Dokumente.
Hardware nach Budget
Einstieg: Ein Mini-PC-Vergleich mit 16–32 GB RAM reicht für 7B-Modelle komplett ohne GPU (langsam, aber funktionsfähig). Alternativ eine gebrauchte AMD-RX-GPU mit 8–12 GB VRAM für flüssige 7B- bis 13B-Modelle. Mittelklasse: Eine gebrauchte RTX 3060 (12 GB) oder RTX 3090 (24 GB) ist das Preis-Leistungs-Optimum – die 3090 packt sogar 32B-Modelle. High-End: Eine RTX 4090 (24 GB) liefert maximale Geschwindigkeit für 32B- und kleinere 70B-Modelle. Detaillierte Benchmarks und Alternativen findest du im GPU-Vergleich.
Erste Schritte
So startest du in fünf Minuten:
- Installieren: Auf
ollama.comdas Installationspaket für dein Betriebssystem herunterladen und ausführen. Unter Windows, macOS und Linux läuft die Installation ohne Vorkenntnisse. - Modell laden: Im Terminal
ollama pull llama3.1eingeben – das lädt ein 8B-Modell (~5 GB). Alternativ stehen Modelle wiemistral,qwen2.5oderllama3.3:70bbereit. - Loslegen: Mit
ollama run llama3.1direkt im Terminal chatten, oder Open WebUI für die Browser-Oberfläche einrichten.
Das war's – dein erstes lokales LLM läuft bereits. Tipp: Beginne klein, teste mit einem 7B-Modell und wechsle erst dann auf größere Modelle, wenn deine Hardware es hergibt.
Fazit
Lokale LLMs sind längst kein Nischenprojekt mehr. Mit einer vorhandenen Mittelklasse-GPU oder einem kleinen Budget holst du dir ein datenschutzfreundliches, kostenloses und offline verfügbares Sprachmodell ins eigene Homelab. Der Einstieg über Ollama dauert Minuten, der Ausbau auf größere Modelle folgt dann ganz nach Hardware-Budget.
Hinweis (Disclosure): Dieser Artikel enthält Affiliate-Links zu Hardware-Produkten. Wenn du über einen dieser Links kaufst, erhalten wir unter Umständen eine Provision – für dich entstehen keine Mehrkosten. Alle Angaben zu VRAM-Bedarf und Modellen dienen der Orientierung und können je nach Quantisierung und Kontextlänge abweichen. Die vollständige Hardware-Übersicht findest du in unserem Hardware-Vergleich.