Transkription ohne Upload: So läuft Whisper in deinem Browser
Stand:
Bei TranscriptBalance läuft die Spracherkennung Whisper direkt in deinem Browser, auf deinem eigenen Gerät. Deine Audio- und Videodateien werden nicht hochgeladen: Aus dem Internet kommen nur die Modelle, einmal heruntergeladen und dann im Browser gespeichert.
Wie läuft Whisper im Browser?
Whisper ist ein offenes Spracherkennungsmodell von OpenAI (MIT-Lizenz). TranscriptBalance führt es mit transformers.js und ONNX Runtime Web aus, zwei Bibliotheken, die KI-Modelle im Browser rechnen lassen. Dafür gibt es zwei Wege:
- WebGPU: Kann dein Browser die Grafikkarte nutzen, rechnet Whisper dort. Das ist der schnellste Weg.
- WebAssembly: Ohne WebGPU rechnet dieselbe App auf dem Prozessor, verteilt auf mehrere Kerne. Das klappt in praktisch jedem aktuellen Browser, dauert aber länger.
Welcher Weg passt, prüft die App beim Start selbst. Kann die Grafikkarte ein Modell nicht laden oder fällt sie aus, wechselt die App, wo möglich, auf den Prozessor. Deine Datei wird im Browser ausgelesen, in Ton mit 16 kHz umgewandelt, an Sprechpausen in Stücke von höchstens 28 Sekunden geteilt und Stück für Stück transkribiert. Der Live-Modus rechnet immer auf dem Prozessor, mit kleinen Modellen, damit die Grafikkarte für die KI frei bleibt.
Was wird einmal heruntergeladen?
Nie schon beim Öffnen der Seite, sondern erst, wenn du eine Funktion startest. Dann lädt dein Browser:
- das gewählte Whisper-Modell von Hugging Face. Auf dem Prozessor: Blitz 44 MB, Schnell 80 MB, Ausgewogen 252 MB. Mit WebGPU: Blitz 122 MB, Schnell 209 MB, Ausgewogen 589 MB, Präzise (large-v3-turbo) 762 MB.
- die Sprechererkennung (pyannote und WeSpeaker, zusammen rund 13 MB), wenn du sie einschaltest.
- für den Live-Modus ein eigenes deutsches Whisper-Modell (231 MB) oder für andere Sprachen Whisper base (80 MB), dazu Silero VAD (rund 2 MB), das erkennt, wann gesprochen wird.
- Gemma 3 1B (rund 0,8 GB) für die Zusammenfassung, nur wenn die eingebaute KI von Chrome sie nicht übernehmen kann.
- ONNX Runtime, die Rechen-Laufzeit, von jsDelivr, beim ersten Modellstart.
Alles landet im Speicher deines Browsers (Origin Private File System) und kommt beim nächsten Mal von dort. Die App bittet den Browser außerdem, diese Dateien nicht von selbst zu löschen. Hugging Face und jsDelivr sehen wie bei jedem Download deine IP-Adresse und welche Datei du lädst, aber keine Inhalte.
Was verlässt dein Gerät nie?
- Dein Ton: Dateien, Mikrofon und geteilter Tab- oder Bildschirm-Ton. Im Live-Modus bleibt der Ton nur im Arbeitsspeicher und wird nicht gespeichert.
- Deine Ergebnisse: Transkripte, Sprechernamen, Zusammenfassungen und gespeicherte Stunden liegen nur im Speicher deines Browsers (IndexedDB).
- Deine Exporte: TXT, Word, SRT und die anderen Formate erzeugt dein Browser direkt als Datei auf deinem Gerät.
Weil nichts davon bei uns liegt, können wir auch nichts wiederherstellen. Exportiere, was dir wichtig ist.
Wie prüfe ich das selbst?
- Öffne TranscriptBalance in Chrome, Edge oder Firefox und drück F12 (oder Rechtsklick und „Untersuchen“). Wechsle zum Tab „Netzwerk“ (in Firefox „Netzwerkanalyse“).
- Leg eine Datei ab und starte die Transkription.
- Du siehst Downloads von huggingface.co bzw. hf.co und cdn.jsdelivr.net (vor allem beim ersten Mal), Programmteile von unserer eigenen Domain und kurze Meldungen an
/api/e. Eine Anfrage, die deine Datei hochlädt, gibt es nicht.
Ein Klick auf eine /api/e-Meldung zeigt ihren Inhalt: die Art der Aktion und grobe Angaben wie Modell und auf Minuten gerundete Länge, keine Texte und keine Dateinamen.
Was geht bei optionalen Funktionen nach außen?
- Gemini mit eigenem Schlüssel (nur im Live-Modus, freiwillig, ab 18): Dann schickt dein Browser Ausschnitte der Mitschrift und deine Fragen direkt an Google, nicht an uns. Ohne Gemini nutzt der Live-Modus die eingebaute KI von Chrome auf deinem Gerät oder gar keine KI.
- Chrome-KI: Ihr Modell lädt Chrome beim ersten Mal selbst von Google (rund 4 GB). Deine Texte verarbeitet sie auf deinem Gerät.
- Kalenderlinks: Ein Klick auf „Google Kalender“ oder „Outlook“ überträgt Titel, Zeit und Beschreibung eines Termins. Die .ics-Datei bleibt auf deinem Gerät.
- Anonyme Nutzungsstatistik: Wir zählen Besuche und genutzte Funktionen, ohne Cookies, ohne gespeicherte IP-Adressen und nie mit Inhalten. Der Schalter in der App unter „Info & Lizenzen“ stoppt die Meldungen zu Funktionen. Mit Global Privacy Control oder Do Not Track sendet die App nichts, und auch dein Besuch wird nicht gezählt.
Alle Einzelheiten stehen in der Datenschutzerklärung.
Voraussetzungen und Grenzen
- Browser: WebGPU gibt es zum Beispiel in aktuellem Chrome und Edge am Computer, je nach Version und Gerät auch in anderen Browsern. Ohne WebGPU läuft alles auf dem Prozessor, außer dem Modell „Präzise“ und der Zusammenfassung mit Gemma.
- Tempo: Mit Grafikkarte ist die Transkription meist deutlich schneller als die Aufnahme lang ist. Auf schwachen Geräten ohne WebGPU kann ein genaueres Modell so lange brauchen wie die Aufnahme selbst oder länger. Die App misst das Tempo deines Geräts und empfiehlt danach ein Modell.
- Arbeitsspeicher: Der Ton wird im Arbeitsspeicher verarbeitet. Sehr lange Aufnahmen stoßen am Handy früher an Grenzen als am Computer.
- Tab offen lassen: Gerechnet wird nur, solange die Seite offen ist. Die App hält den Bildschirm wach und kann dich bei Aufträgen mit mehr als 10 Minuten Ton benachrichtigen, wenn sie fertig ist.
- Speicherplatz: Die Modelle belegen Platz auf deinem Gerät. Löscht der Browser seine Websitedaten, lädt er sie beim nächsten Mal neu.
Häufige Fragen
Ist Transkription im Browser DSGVO-konform?
TranscriptBalance bekommt deine Inhalte nie: Ton, Transkripte und Dateinamen bleiben auf deinem Gerät, es gibt keinen Server, der sie verarbeitet. Nutzt du eine Aufnahme nicht nur privat, bist aber du für den Datenschutz der Menschen darin verantwortlich. Bei Interviews oder Meetings solltest du ihr Einverständnis einholen und die Regeln deiner Hochschule oder deines Arbeitgebers beachten.
Sieht Hugging Face, was ich transkribiere?
Nein. Hugging Face liefert nur die Modelldateien aus und sieht dabei, wie bei jedem Download, deine IP-Adresse und welches Modell du lädst. Beim deutschen Live-Modell ist damit erkennbar, dass du Deutsch mitschreibst. Ton und Text gehen nie an Hugging Face.
Warum dauert der erste Start länger?
Beim ersten Mal lädt dein Browser das Whisper-Modell herunter, je nach Modell zwischen 44 und 762 MB. Danach liegt es im Speicher deines Browsers, und TranscriptBalance startet ohne erneuten Download.
Wie lösche ich Modelle und Transkripte?
In der Modellauswahl von TranscriptBalance löschst du Transkriptionsmodelle einzeln mit „Modell löschen“; „Alle löschen“ entfernt alle gespeicherten Modelldateien. Transkripte entfernst du einzeln oder mit „Neu“, gespeicherte Stunden mit „Stunde löschen“. Alles auf einmal verschwindet, wenn du in deinem Browser die Websitedaten von TranscriptBalance löschst.
Warum braucht das Modell „Präzise“ eine Grafikkarte?
„Präzise“ ist Whisper large-v3-turbo, das größte der vier Modelle in TranscriptBalance. Auf dem Prozessor wäre es für lange Aufnahmen zu langsam, deshalb bietet die App es nur mit WebGPU an. Ohne WebGPU ist „Ausgewogen“ (Whisper small) die genaueste Wahl.
Läuft auch die KI-Zusammenfassung lokal?
Im Datei-Modus ja. TranscriptBalance nutzt zuerst die eingebaute KI von Chrome (Gemini Nano) und sonst Gemma 3 1B über WebGPU, beide auf deinem Gerät. Nur im Live-Modus kannst du freiwillig Gemini mit deinem eigenen Google-Schlüssel verbinden; dann gehen Ausschnitte der Mitschrift an Google.