⚡ HomelabVergleich

Ollama Tutorial: Lokale LLMs ausführen (Schritt für Schritt)

Ollama ist der mit Abstand einfachste Weg, um große Sprachmodelle (LLMs) lokal auf dem eigenen Rechner laufen zu lassen — ohne Cloud, ohne Abo, ohne dass deine Daten den Rechner verlassen. Ein einziger Befehl genügt, und schon antwortet dir ein Modell wie Llama 3 oder DeepSeek-R1 auf der eigenen Hardware. Dieses Tutorial führt dich Schritt für Schritt von der Installation bis zu den ersten Modellen und zeigt, was du bei Speicher- und VRAM-Bedarf beachten musst. Falls du ganz neu im Thema bist, lohnt sich vorab unser Einstieg in lokale LLMs.

Was ist Ollama?

Ollama ist ein Kommandozeilen-Werkzeug, das Modell-Download, Verwaltung und Ausführung in einem vereint. Es kümmert sich automatisch um die passenden Quantisierungen, legt Modelle in einem lokalen Verzeichnis ab und startet im Hintergrund einen kleinen Server, über den die Modelle auch von anderen Programmen angesprochen werden können. Die Bedienung bleibt dabei denkbar simpel: Modelle herunterladen, starten, chatten — fertig. Für typische Homelab-Setups ist Ollama deshalb die erste Wahl, bevor man sich mit komplexeren Inferenz-Frameworks beschäftigt.

Installation (Windows, Linux, macOS)

Die Installation ist auf allen drei Plattformen ein Einzeiler. Für Windows und macOS lädt man den Installer von der offiziellen Website herunter und führt ihn aus — Ollama wird anschließend als Hintergrunddienst gestartet und steht im Terminal als ollama-Befehl bereit. Unter Linux genügt das offizielle Skript:

curl -fsSL https://ollama.com/install.sh | sh

Nach der Installation lässt sich mit ollama --version prüfen, ob alles korrekt läuft. Wer kein Terminal mag, kann alternativ die grafische Desktop-App nutzen, die bei Windows und macOS mitgeliefert wird. Wichtig für GPU-Nutzer: Ollama erkennt NVIDIA- und AMD-GPUs automatisch. Welche Hardware sich für lokale KI tatsächlich lohnt, erklären wir im Artikel GPU für lokale KI.

Erste Modelle: llama3, qwen, deepseek-r1

Ein guter Start sind drei Modell-Familien mit sehr unterschiedlichen Stärken. Llama 3 (Meta) ist der Allrounder für allgemeine Aufgaben und Textverarbeitung. Qwen (Alibaba) punktet vor allem bei mehrsprachigen und technischen Inhalten. DeepSeek-R1 ist ein sogenanntes Reasoning-Modell, das seine Antworten in mehrere Denkschritte zerlegt — ideal für Mathe, Logik und Coding, aber spürbar langsamer.

ollama pull, run und list

Drei Befehle decken den kompletten Alltag ab. ollama pull lädt ein Modell herunter, ollama run startet es direkt im interaktiven Chat, und ollama list zeigt alle lokal gespeicherten Modelle:

ollama pull llama3.1
ollama run llama3.1
ollama list

Ein Modell, das noch nicht lokal vorhanden ist, lädt ollama run beim ersten Aufruf automatisch nach — pull ist also optional, aber praktisch, wenn man Downloads vorab erledigen möchte. Innerhalb des Chats beendet man mit /bye, weitere Befehle zeigt /? an.

Modellgrößen und VRAM-Bedarf

Die Modellgröße ist der wichtigste Hebel für Geschwindigkeit und Speicherbedarf. Als Faustregel gilt: Ein Modell mit n Milliarden Parametern braucht in der üblichen 4-Bit-Quantisierung etwa 0,6 GB RAM pro Milliarde Parameter. Das 8-Milliarden-Modell von Llama 3 oder Qwen passt damit in rund 6 GB VRAM und läuft flüssig auf einer Mittelklasse-GPU. Die 70-Milliarden-Variante benötigt dagegen etwa 40 GB und verlangt nach einer Grafikkarte mit viel Speicher oder mehreren GPUs.

Reicht der VRAM nicht, rechnet Ollama teilweise auf der CPU weiter — das funktioniert, wird aber deutlich langsamer. DeepSeek-R1 gibt es als kleine Distillate (1,5 bis 70 Milliarden Parameter), während das vollständige Modell mit 671 Milliarden Parametern für den Heimgebrauch praktisch ausscheidet. Für den Anfang ist die 7- oder 8-Milliarden-Klasse der beste Kompromiss aus Qualität und Tempo.

Tipps für mehr Leistung

Über Umgebungsvariablen lässt sich Ollama spürbar beschleunigen. OLLAMA_FLASH_ATTENTION=1 aktiviert eine effizientere Attention-Berechnung, die vor allem bei langen Kontexten Speicher und Zeit spart. Weitere nützliche Schalter: OLLAMA_HOST und OLLAMA_PORT legen fest, auf welcher Adresse der Server lauscht — setzt man den Host auf 0.0.0.0, ist Ollama aus dem ganzen Netzwerk erreichbar. Mit OLLAMA_KEEP_ALIVE steuert man, wie lange ein Modell nach der letzten Anfrage im Speicher bleibt, und OLLAMA_NUM_PARALLEL begrenzt parallele Anfragen. Wer Modelle mit langem Kontextfenster nutzt, sollte außerdem num_ctx im Chat per /set parameter anheben.

Fazit

Ollama macht lokale Sprachmodelle so zugänglich wie nie: installieren, ollama run llama3.1 eintippen, loslegen. Wer mit einem 8-Milliarden-Modell startet, bekommt auf moderner Hardware sofort ein Gefühl dafür, was lokale KI kann — und skaliert bei Bedarf zu größeren Modellen oder einer dedizierten GPU. Genau dort lohnt der Blick in unsere GPU-Empfehlungen für lokale KI.

Hinweis: Dieser Artikel enthält keine Affiliate- oder Partner-Links. Angaben zu Modellen, Versionen und Speicherbedarf entsprechen dem Stand September 2026 und können sich durch Updates ändern. Der VRAM-Bedarf ist eine Näherung für die übliche 4-Bit-Quantisierung; tatsächliche Werte hängen von Quantisierung, Kontextlänge und Treibern ab.