RAG lokal: Eigene Dokumente mit LLMs durchsuchen
Ein Sprachmodell wie Llama, Mistral oder Qwen beantwortet Fragen aus seinem Training heraus — aber es kennt deine eigenen Dokumente nicht. Genau diese Lücke schließt RAG (Retrieval-Augmented Generation). Statt das Modell neu zu trainieren, holt RAG zum Zeitpunkt der Frage die passenden Textstellen aus deinen Dateien und gibt sie dem Modell als Kontext mit. Das Ergebnis: Antworten, die auf deinen tatsächlichen Unterlagen basieren — und zwar komplett lokal, ohne dass ein einziges Dokument in die Cloud wandert.
Was ist Retrieval-Augmented Generation?
RAG verbindet zwei Bausteine: einen Retriever, der relevante Textpassagen findet, und einen Generator (das LLM), der daraus eine Antwort formuliert. Der Ablauf ist immer gleich: Deine Dokumente werden in kleine Abschnitte (Chunks) zerlegt und als numerische Vektoren in einer Vektor-Datenbank gespeichert. Kommt eine Frage, wird sie ebenfalls in einen Vektor umgewandelt und mit den gespeicherten Abschnitten verglichen. Die ähnlichsten Stellen landen im Prompt, das Modell antwortet auf dieser Grundlage und kann dabei Quellen nennen.
Der große Vorteil gegenüber reinem Feintuning: Es ist schnell eingerichtet, kostet kaum Rechenleistung und lässt sich aktualisieren, indem du einfach neue Dateien hinzufügst. Außerdem reduzieren sich Halluzinationen spürbar, weil das Modell sich auf gelieferten Text stützen kann, statt frei zu raten.
Vektor-Datenbanken: das Gedächtnis
Das Herzstück jeder RAG-Pipeline ist die Vektor-Datenbank. Sie speichert keine Wörter, sondern mathematische Vektoren, die die Bedeutung eines Textabschnitts abbilden. Ähnliche Inhalte liegen im Vektorraum nah beieinander, sodass eine Ähnlichkeitssuche blitzschnell die relevanten Stellen liefert. Beliebte lokale Optionen sind ChromaDB (einfach, läuft in Python), Qdrant (schnell, als Docker-Container oder eingebettet), Weaviate und FAISS (eine schlanke Bibliothek von Meta). Für den Einstieg reicht ChromaDB völlig — es speichert die Daten lokal und braucht keine separate Installation.
Bevor Text in die Datenbank wandert, wird er chunkiert und embedded. Beim Chunking zerlegst du Dokumente in Abschnitte von wenigen hundert Zeichen; beim Embedding wandelt ein Modell (lokal z. B. nomic-embed-text oder all-minilm über Ollama) diese Abschnitte in Vektoren um. Die Wahl des Embedding-Modells beeinflusst die Qualität der Suche mehr als die des LLMs selbst.
Lokale Tools für RAG
Den schnellsten Weg bietet Open WebUI. Das Tool, das du ohnehin als Web-Oberfläche für Ollama nutzen kannst, bringt eine eingebaute RAG-Funktion mit: Du legst eine Wissensbasis an, lädst PDFs, Markdown- oder Textdateien hoch, und Open WebUI übernimmt Chunking, Embedding und Abruf automatisch. Anschließend kannst du im Chat gezielt gegen dieses Wissen fragen — ganz ohne eine Zeile Code.
Wer mehr Kontrolle will, greift zu Frameworks. LangChain ist das Schweizer Taschenmesser: Es orchestriert Dokumentenladung, Chunking, Embedding, Vektorspeicher und die Kette bis zur Antwort. LlamaIndex (früher GPT Index) setzt dagegen stärker auf die Datenebene und glänzt beim Indizieren und Abfragen großer Dokumentbestände. Beide lassen sich problemlos mit einem lokalen Ollama-Modell koppeln, sodass die komplette Pipeline auf deiner eigenen Hardware läuft.
Einrichtung mit Ollama
Die Grundlage ist ein lokales Modell. Wer noch keines hat, findet im Einstieg in lokale LLMs eine Schritt-für-Schritt-Anleitung. Für RAG brauchst du zusätzlich ein Embedding-Modell:
ollama pull llama3.1
ollama pull nomic-embed-text
Der einfachste Weg führt dann über Open WebUI: Installiere es als Docker-Container, verbinde es mit Ollama, und lege unter „Knowledge“ eine Wissensbasis an. Alternativ baust du eine eigene Pipeline mit Python, LangChain und ChromaDB — etwa so im Kern:
from langchain_community.document_loaders import DirectoryLoader
from langchain_community.vectorstores import Chroma
from langchain_ollama import OllamaEmbeddings, ChatOllama
docs = DirectoryLoader("dokumente/", glob="**/*.pdf").load()
store = Chroma.from_documents(docs, OllamaEmbeddings(model="nomic-embed-text"))
retriever = store.as_retriever()
# Frage -> retriever liefert Kontext -> ChatOllama antwortet
Für eine produktive RAG-Lösung genügt überraschend wenig Hardware: Ein Mini-PC mit 16 bis 32 GB RAM und eine GPU ab 8 GB VRAM reichen, um ein 7B- bis 13B-Modell samt Embedding flüssig zu betreiben. RAG selbst ist günstig, weil die Vektorsuche nur wenig Rechenzeit kostet — die Hauptlast trägt weiterhin das LLM.
Anwendungsfälle
Die Einsatzmöglichkeiten sind vielfältig. Im Homelab-Kontext durchsuchst du damit deine eigene Dokumentensammlung: Verträge, Rechnungen, Notizen oder die Markdown-Sammlung aus einem Obsidian-Vault. Fürs Studium oder die Recherche wird eine PDF-Bibliothek zur durchsuchbaren Wissensbasis, die mit Quellenangaben antwortet. Auch im Alltag hilft RAG: Bedienungsanleitungen, Versicherungsunterlagen oder die eigene Rezeptsammlung werden plötzlich in natürlicher Sprache abfragbar — und bleiben dabei vollständig auf deiner Festplatte.
Wichtig ist die Erwartungshaltung: RAG funktioniert dort am besten, wo Fakten in deinen Dokumenten stehen. Es ersetzt kein Allgemeinwissen und keine Internetsuche, sondern macht genau deinen eigenen Bestand durchsuchbar. Für vertrauliche Daten ist das der entscheidende Vorteil gegenüber Cloud-Diensten.
Fazit
RAG macht aus einem generischen lokalen LLM einen Assistenten, der deine eigenen Dokumente kennt. Mit Ollama als Modell-Server, einem Embedding-Modell wie nomic-embed-text und Open WebUI als Oberfläche steht in unter einer Stunde eine funktionierende lokale Wissensbasis. Wer individuelle Pipelines bauen will, findet in LangChain und LlamaIndex zwei ausgereifte Frameworks. Der Einstieg ist günstig, die Daten bleiben bei dir — und die Qualität der Antworten steigt dort, wo es zählt: bei deinen eigenen Inhalten.
Hinweis: Dieser Artikel enthält keine Affiliate-Links. Genannte Tools und Frameworks sind Open Source und werden unabhängig empfohlen. Angaben entsprechen dem Stand September 2026 und können sich ändern. Weiterführende Artikel: Lokale LLMs — der Einstieg und Ollama-Tutorial.