TranscriptBalance
App öffnen

Transkription ohne Upload: So läuft Whisper in deinem Browser

Stand:

Bei TranscriptBalance läuft die Spracherkennung Whisper direkt in deinem Browser, auf deinem eigenen Gerät. Deine Audio- und Videodateien werden nicht hochgeladen: Aus dem Internet kommen nur die Modelle, einmal heruntergeladen und dann im Browser gespeichert.

Wie läuft Whisper im Browser?

Whisper ist ein offenes Spracherkennungsmodell von OpenAI (MIT-Lizenz). TranscriptBalance führt es mit transformers.js und ONNX Runtime Web aus, zwei Bibliotheken, die KI-Modelle im Browser rechnen lassen. Dafür gibt es zwei Wege:

Welcher Weg passt, prüft die App beim Start selbst. Kann die Grafikkarte ein Modell nicht laden oder fällt sie aus, wechselt die App, wo möglich, auf den Prozessor. Deine Datei wird im Browser ausgelesen, in Ton mit 16 kHz umgewandelt, an Sprechpausen in Stücke von höchstens 28 Sekunden geteilt und Stück für Stück transkribiert. Der Live-Modus rechnet immer auf dem Prozessor, mit kleinen Modellen, damit die Grafikkarte für die KI frei bleibt.

Was wird einmal heruntergeladen?

Nie schon beim Öffnen der Seite, sondern erst, wenn du eine Funktion startest. Dann lädt dein Browser:

Alles landet im Speicher deines Browsers (Origin Private File System) und kommt beim nächsten Mal von dort. Die App bittet den Browser außerdem, diese Dateien nicht von selbst zu löschen. Hugging Face und jsDelivr sehen wie bei jedem Download deine IP-Adresse und welche Datei du lädst, aber keine Inhalte.

Was verlässt dein Gerät nie?

Weil nichts davon bei uns liegt, können wir auch nichts wiederherstellen. Exportiere, was dir wichtig ist.

Wie prüfe ich das selbst?

  1. Öffne TranscriptBalance in Chrome, Edge oder Firefox und drück F12 (oder Rechtsklick und „Untersuchen“). Wechsle zum Tab „Netzwerk“ (in Firefox „Netzwerkanalyse“).
  2. Leg eine Datei ab und starte die Transkription.
  3. Du siehst Downloads von huggingface.co bzw. hf.co und cdn.jsdelivr.net (vor allem beim ersten Mal), Programmteile von unserer eigenen Domain und kurze Meldungen an /api/e. Eine Anfrage, die deine Datei hochlädt, gibt es nicht.

Ein Klick auf eine /api/e-Meldung zeigt ihren Inhalt: die Art der Aktion und grobe Angaben wie Modell und auf Minuten gerundete Länge, keine Texte und keine Dateinamen.

Was geht bei optionalen Funktionen nach außen?

Alle Einzelheiten stehen in der Datenschutzerklärung.

Voraussetzungen und Grenzen

Jetzt im Browser transkribieren

Häufige Fragen

Ist Transkription im Browser DSGVO-konform?

TranscriptBalance bekommt deine Inhalte nie: Ton, Transkripte und Dateinamen bleiben auf deinem Gerät, es gibt keinen Server, der sie verarbeitet. Nutzt du eine Aufnahme nicht nur privat, bist aber du für den Datenschutz der Menschen darin verantwortlich. Bei Interviews oder Meetings solltest du ihr Einverständnis einholen und die Regeln deiner Hochschule oder deines Arbeitgebers beachten.

Sieht Hugging Face, was ich transkribiere?

Nein. Hugging Face liefert nur die Modelldateien aus und sieht dabei, wie bei jedem Download, deine IP-Adresse und welches Modell du lädst. Beim deutschen Live-Modell ist damit erkennbar, dass du Deutsch mitschreibst. Ton und Text gehen nie an Hugging Face.

Warum dauert der erste Start länger?

Beim ersten Mal lädt dein Browser das Whisper-Modell herunter, je nach Modell zwischen 44 und 762 MB. Danach liegt es im Speicher deines Browsers, und TranscriptBalance startet ohne erneuten Download.

Wie lösche ich Modelle und Transkripte?

In der Modellauswahl von TranscriptBalance löschst du Transkriptionsmodelle einzeln mit „Modell löschen“; „Alle löschen“ entfernt alle gespeicherten Modelldateien. Transkripte entfernst du einzeln oder mit „Neu“, gespeicherte Stunden mit „Stunde löschen“. Alles auf einmal verschwindet, wenn du in deinem Browser die Websitedaten von TranscriptBalance löschst.

Warum braucht das Modell „Präzise“ eine Grafikkarte?

„Präzise“ ist Whisper large-v3-turbo, das größte der vier Modelle in TranscriptBalance. Auf dem Prozessor wäre es für lange Aufnahmen zu langsam, deshalb bietet die App es nur mit WebGPU an. Ohne WebGPU ist „Ausgewogen“ (Whisper small) die genaueste Wahl.

Läuft auch die KI-Zusammenfassung lokal?

Im Datei-Modus ja. TranscriptBalance nutzt zuerst die eingebaute KI von Chrome (Gemini Nano) und sonst Gemma 3 1B über WebGPU, beide auf deinem Gerät. Nur im Live-Modus kannst du freiwillig Gemini mit deinem eigenen Google-Schlüssel verbinden; dann gehen Ausschnitte der Mitschrift an Google.