Whisper lokal: Spracherkennung ohne Cloud (Anleitung)
Sprachmemos, Meetings, Podcasts, Interviews — wer Audio automatisch in Text verwandeln will, landet meist bei Cloud-Diensten. Doch die Aufnahmen verlassen dabei dein Zuhause, und bei sensiblen Inhalten ist das ein Problem. OpenAIs Whisper löst genau das: Die Spracherkennung läuft komplett lokal auf deiner eigenen Hardware, offline und ohne laufende Kosten. Diese Anleitung zeigt, was Whisper ist, welche Modelle es gibt und wie du deine eigenen Audios transkribierst.
Was ist Whisper?
Whisper ist ein quelloffenes Sprachmodell von OpenAI, das Sprache in Text umwandelt. Anders als ChatGPT läuft es nicht als Cloud-Dienst, sondern als Modell, das du selbst herunterlädst und lokal ausführst. Es beherrscht über 90 Sprachen — darunter Deutsch, Englisch und viele weitere — und transkribiert nicht nur, sondern übersetzt auch automatisch ins Englische. Da es robust gegenüber Hintergrundgeräuschen und verschiedenen Akzenten ist, eignet es sich auch für Aufnahmen in schlechter Qualität.
Die Modelle: von tiny bis large
Whisper gibt es in fünf Größen. Die kleinen Modelle sind schnell und sparsam, die großen deutlich genauer — gerade bei schwieriger Akustik oder Fachbegriffen:
| Modell | Parameter | VRAM (ca.) | Geschwindigkeit |
|---|---|---|---|
| tiny | 39 M | ~1 GB | sehr schnell |
| base | 74 M | ~1 GB | schnell |
| small | 244 M | ~2 GB | mittel |
| medium | 769 M | ~5 GB | langsam |
| large (v3) | 1,55 Mrd. | ~10 GB | sehr langsam |
Für den Einstieg reicht small meist völlig aus: gute Genauigkeit bei überschaubarem Ressourcenbedarf. Wer maximale Qualität will, greift zu large-v3 — zahlt dafür aber mit deutlich höherem Rechenaufwand.
Installation: whisper.cpp oder faster-whisper
Zwei Wege haben sich durchgesetzt. whisper.cpp ist eine schlanke C++-Implementierung ohne Python-Abhängigkeiten und läuft selbst auf schwachen Geräten und sogar auf dem Raspberry Pi. Du klonst das Repository, kompilierst es mit make und lädst ein Modell im ggml-Format herunter — fertig. Es ist der sparsamste Weg, Whisper lokal zu betreiben.
faster-whisper ist die schnellere Alternative auf Basis von CTranslate2. Installiert wird es per pip install faster-whisper, die Nutzung ist Python-basiert und damit näher an anderen Data-Science-Workflows. faster-whisper ist bei gleicher Genauigkeit oft mehrfach schneller als die Original-Implementierung und nutzt GPUs über CUDA oder CPU mit mehreren Threads. Für die meisten Homelab-User ist faster-whisper der beste Kompromiss aus Komfort und Tempo.
Eigene Audios transkribieren
Der Ablauf ist bei beiden Tools ähnlich: Audio-Datei angeben, Modell wählen, Ergebnis als Text ausgeben. Mit whisper.cpp rufst du ./main -m models/ggml-small.bin -f meeting.wav auf und erhältst das Transkript direkt im Terminal. Mit faster-whisper lädst du das Modell im Skript, übergibst die Datei und schreibst die Segmente in eine Textdatei. Whisper verarbeitet WAV, MP3, M4A und viele weitere Formate — unter der Haube wird alles auf 16 kHz Mono heruntergerechnet. Tipp: Mit der Option --language de (bzw. dem Sprachparameter bei faster-whisper) erzwingst du die Erkennung auf Deutsch und vermeidest Fehlraten bei kurzen Aufnahmen.
Hardware-Anforderungen
Whisper läuft rein auf der CPU — eine GPU ist optional. Die tiny- und base-Modelle packt jeder moderne Rechner oder Mini-PC in Echtzeit oder schneller; für large-v3 auf CPU solltest du allerdings Geduld mitbringen. Eine GPU mit 8–12 GB VRAM beschleunigt die großen Modelle erheblich. Wer Whisper im Homelab dauerhaft betreiben will, fährt mit einem lokalen LLM-Setup gut: Dieselbe Maschine, die Sprachmodelle wie Llama bedient, transkribiert nebenbei auch deine Audios — CPU und RAM werden einfach geteilt.
Anwendungsfälle
Die Einsatzmöglichkeiten sind vielfältig: Meetings und Interviews automatisch protokollieren, Sprachmemos und Diktate in Notizen verwandeln, Podcasts und Videos für Untertitel transkribieren oder Vorlesungen durchsuchbar machen. Besonders stark ist Whisper in Kombination mit anderen lokalen Tools: Ein lokales LLM fasst das Transkript anschließend zusammen, übersetzt es oder beantwortet Fragen zum Inhalt — ganz ohne Cloud. Da alles offline passiert, eignen sich solche Pipelines auch für vertrauliche Gespräche, Kundendaten oder medizinische Aufnahmen, die du nicht an fremde Server geben willst.
Fazit
Whisper macht lokale Spracherkennung zugänglich — kostenlos, offline und datenschutzfreundlich. Mit whisper.cpp oder faster-whisper ist der Einstieg in wenigen Minuten erledigt, und schon das small-Modell liefert erstaunlich gute Transkripte. Wer seine Audios ohnehin im eigenen Homelab verarbeitet, bekommt mit Whisper ein mächtiges Werkzeug, das sich ideal mit lokalen LLMs kombinieren lässt.
Hinweis: Dieser Artikel enthält keine Affiliate- oder Partner-Links. Alle Angaben zu Modellgrößen, VRAM-Bedarf und Geschwindigkeit dienen der Orientierung und können je nach Hardware, Audiodatei und Software-Version abweichen. Whisper ist ein quelloffenes Projekt von OpenAI und steht unter der MIT-Lizenz — die Nutzung ist kostenlos. Weiterführende Infos zum lokalen Betrieb von Sprachmodellen findest du in unserem Einstieg zu lokalen LLMs.