⚡ HomelabVergleich

title: "DeepSeek R1 lokal laufen lassen: GGUF, Quantisierung & VRAM erklärt"

description: "DeepSeek R1 lokal betreiben: Was ist das Reasoning-Modell, was bedeuten GGUF und Quantisierung (Q4/Q8), wie viel VRAM brauchen 8B, 14B und 70B – und wie installiert man DeepSeek R1 mit Ollama?"

slug: "deepseek-r1-lokal"

date: 2026-09-20

keywords:

- DeepSeek R1 lokal

- GGUF Quantisierung

- DeepSeek R1 VRAM

- Ollama DeepSeek

- lokale KI Reasoning


DeepSeek R1 lokal laufen lassen: GGUF, Quantisierung & VRAM erklärt

DeepSeek R1 gehört zu den meistdiskutierten Open-Source-Sprachmodellen. Anders als klassische Chatbots „denkt" es vor jeder Antwort laut nach – ein sogenanntes Reasoning-Modell. Der Clou: Man kann es komplett lokal auf dem eigenen Rechner betreiben, ohne Cloud, ohne Abo und ohne Daten, die das Haus verlassen. In diesem Artikel erklären wir, was DeepSeek R1 ist, was die Begriffe GGUF und Quantisierung bedeuten, wie viel VRAM die einzelnen Modellgrößen brauchen und wie die Installation mit Ollama in wenigen Minuten gelingt.

Was ist DeepSeek R1?

DeepSeek R1 wurde Anfang 2025 vom chinesischen Unternehmen DeepSeek veröffentlicht und sorgte vor allem deshalb für Aufsehen, weil es mit deutlich geringerem Trainingsaufwand an die Leistung etablierter Modelle heranreichte. Der entscheidende Unterschied zu herkömmlichen LLMs: R1 ist ein Reasoning-Modell. Es erzeugt vor der eigentlichen Antwort einen internen „Denkprozess" (Chain-of-Thought), in dem es das Problem Schritt für Schritt durchgeht. Das macht es besonders stark bei Mathematik, Logik, Programmierung und komplexen Aufgaben – dort, wo ein Modell mehrere Zwischenschritte braucht.

Der Haken: Das vollständige Modell ist mit 671 Milliarden Parametern riesig und für Heimanwender nicht realisierbar. Abhilfe schaffen die distillierten Versionen. Dabei wurde das Wissen von R1 in kleinere Modelle „destilliert", die auf normaler Hardware laufen: 1,5B, 7B, 8B, 14B, 32B und 70B. Für den lokalen Einsatz sind vor allem die Größen 8B, 14B und 70B relevant.

Was ist GGUF?

GGUF (GPT-Generated Unified Format) ist das Standard-Dateiformat, um große Sprachmodelle lokal auszuführen. Es wurde für das Framework llama.cpp entwickelt und bündelt alle Gewichte, die Tokenizer-Daten und die Metadaten eines Modells in einer einzigen Datei. Der Vorteil: GGUF-Dateien lassen sich direkt mit Tools wie llama.cpp, LM Studio oder Ollama laden – ohne Python-Umgebung und ohne komplizierte Konvertierung.

Ein weiterer Grund für die Beliebtheit von GGUF ist die eingebaute Unterstützung für Quantisierung. Genau darum geht es im nächsten Abschnitt.

Was ist Quantisierung? Q4, Q8 und Co. erklärt

Beim Training speichern Modelle ihre Gewichte üblicherweise mit hoher Präzision (FP16, also 16 Bit pro Wert). Das ist genau, kostet aber viel Speicher. Quantisierung reduziert die Genauigkeit dieser Zahlen, um das Modell zu verkleinern und schneller zu machen – bei möglichst geringem Qualitätsverlust.

Die gängigen Stufen werden mit einem „Q" und einer Zahl bezeichnet:

Merksatz: Je kleiner die Zahl, desto kleiner die Datei und desto geringer der Speicherbedarf – aber auch desto mehr Genauigkeit geht verloren. Für den Alltag ist Q4_K_M der bewährte Standard; wer mehr Präzision braucht und genug VRAM hat, greift zu Q8.

VRAM-Bedarf: 8B vs. 14B vs. 70B

Wie viel Grafikspeicher (VRAM) ein Modell braucht, hängt von seiner Größe und der gewählten Quantisierung ab. Als Faustregel gilt: etwa 1 GB VRAM pro 1 Milliarde Parameter bei Q4. Dazu kommen Reserven für den Kontext (die Fenstergröße).

| Modell | Q4 (ca.) | Q8 (ca.) | Empfehlung |

|---|---|---|---|

| DeepSeek R1 8B | ~5 GB | ~8 GB | Einstieg, auch auf CPU möglich |

| DeepSeek R1 14B | ~9 GB | ~14 GB | Mittelklasse-GPU (8–12 GB VRAM) |

| DeepSeek R1 70B | ~40 GB | ~70 GB | Nur mit mehreren GPUs / viel RAM |

Wer keine starke GPU hat, kann größere Modelle trotzdem teilweise über die CPU laufen lassen – das kostet dann aber spürbar Geschwindigkeit.

Installation mit Ollama (Schritt für Schritt)

Der einfachste Weg zu DeepSeek R1 ist Ollama, ein Tool, das GGUF-Modelle mit einem einzigen Befehl herunterlädt und startet.

1. Ollama installieren: Von [ollama.com](https://ollama.com) herunterladen (Windows, macOS, Linux) und installieren.

2. Modell laden: Im Terminal den gewünschten Befehl ausführen:

- ollama run deepseek-r1:8b

- ollama run deepseek-r1:14b

- ollama run deepseek-r1:70b

3. Loslegen: Nach dem Download startet direkt ein Chat. Ollama lädt automatisch eine passende Quantisierung (standardmäßig Q4).

4. Optional: Mit ollama run deepseek-r1:8b-q8_0 lässt sich gezielt eine höhere Quantisierung wählen.

Danach lässt sich das Modell auch über eine Weboberfläche wie Open WebUI oder per OpenAI-kompatibler API ansprechen.

Hardware-Empfehlung im Überblick

Fazit

DeepSeek R1 lokal zu betreiben ist dank GGUF, Quantisierung und Ollama einfacher als viele denken. Für die meisten Nutzer ist das 14B-Modell in Q4 auf einer GPU mit 12 GB VRAM der beste Kompromiss aus Qualität, Geschwindigkeit und Kosten – während das 8B-Modell einen kostenlosen, datenschutzfreundlichen Einstieg bietet. Wer das volle Reasoning-Potenzial ohne Cloud-Abhängigkeit will, findet in DeepSeek R1 einen der stärksten Open-Source-Kandidaten.