Audio und Video kostenlos in Text umwandeln – ohne Upload, ohne Konto

TranscriptBalance wandelt Audio- und Videodateien kostenlos und ohne Limit in Text um, direkt in deinem Browser. Die Spracherkennung Whisper läuft auf deinem eigenen Gerät: Deine Dateien werden nicht hochgeladen, und du brauchst kein Konto.

So funktioniert’s

  1. Dateien ablegen: Zieh eine oder mehrere Dateien in TranscriptBalance oder klick im Datei-Modus auf die runde Fläche, zum Beispiel MP3, M4A, WAV, MP4 oder MOV.
  2. Transkribieren: Beim ersten Mal lädt dein Browser das Sprachmodell herunter und speichert es. Gerechnet wird auf deinem Gerät, mit der Grafikkarte (WebGPU) oder dem Prozessor.
  3. Herunterladen: Speichere den Text als TXT, Word, SRT, VTT, Markdown, JSON oder CSV, auf Wunsch mit Zeitstempeln und Sprechern.

Was kann TranscriptBalance?

Live mitschreiben in Vorlesung, Seminar und Teams

Im Live-Modus entsteht der Text, während du zuhörst: aus einem Browser-Tab, vom Ton deines Bildschirms (etwa der Teams-App) oder über das Mikrofon. Im KI-Chat (Chrome-KI oder Gemini mit eigenem Schlüssel) fragst du zum Beispiel „Was habe ich verpasst?“, und Fragen aus dem Gespräch beantwortet er von selbst. Auf Wunsch wächst alle 5 Minuten eine Zusammenfassung, und nach dem Beenden trägst du erkannte Termine per Klick in deinen Kalender ein. Der Ton wird nie gespeichert.

Tab- und Bildschirm-Ton gehen in Chrome und Edge am Computer, das Mikrofon auch am Handy. Mehr dazu: Vorlesungen live mitschreiben.

Live-Modus starten

Bleiben meine Aufnahmen privat?

Ja. Dein Ton verlässt nie dein Gerät, und Transkripte liegen nur im Speicher deines Browsers. Aus dem Internet kommen nur die Modelle (von Hugging Face) und die Rechen-Laufzeit (von jsDelivr). Dazu zählen wir anonym Besuche und genutzte Funktionen, nie mit Inhalten: Die Meldungen zu Funktionen schaltest du in der App ab, und mit Global Privacy Control oder Do Not Track wird auch dein Besuch nicht gezählt. Nur wenn du im Live-Modus freiwillig Gemini verbindest, gehen Ausschnitte der Mitschrift und deine Fragen direkt an Google. Wie du das selbst prüfst: Transkription ohne Upload.

Warum ist das kostenlos?

Weil dein Gerät rechnet, braucht TranscriptBalance keine teuren Server. Es gibt kein Abo, keine Bezahlversion und keine fremde Werbung. Gebaut wird es von Jeremy Heindrichs, Student in Belgien, neben dem Studium. Wer ihn unterstützen möchte, schaut bei seinem anderen Projekt vorbei: AudioBalance, ein Windows-Programm, das Videos, Calls und Musik gleich laut macht.

Auch interessant: Interviews für die Abschlussarbeit transkribieren und kostenlose Transkription im Vergleich.

Häufige Fragen

Ist TranscriptBalance wirklich kostenlos und unbegrenzt?

Ja. Es gibt kein Abo, kein Minutenlimit und keine Begrenzung der Dateien. Die Grenze setzt nur dein Gerät: Lange Aufnahmen brauchen Zeit und Arbeitsspeicher.

Wird meine Audiodatei hochgeladen?

Nein. Dein Browser liest die Datei lokal, und Whisper transkribiert sie auf deinem Gerät. Aus dem Internet lädt er nur die Modelle. An unseren Server gehen nur anonyme Zählungen ohne Inhalte: Die Meldungen zu genutzten Funktionen schaltest du in der App unter „Info & Lizenzen“ ab; mit Global Privacy Control oder Do Not Track wird auch dein Besuch nicht gezählt.

Brauche ich ein Konto?

Nein. TranscriptBalance funktioniert ohne Anmeldung, ohne E-Mail-Adresse und ohne Cookies. Nur wer im Live-Modus freiwillig Gemini nutzt, braucht dafür ein eigenes Google-Konto und einen eigenen API-Schlüssel von Google.

Welche Browser und Geräte funktionieren?

Am schnellsten geht es mit WebGPU, zum Beispiel in aktuellem Chrome oder Edge am Computer. Ohne WebGPU rechnet TranscriptBalance auf dem Prozessor: langsamer, aber in praktisch jedem aktuellen Browser, auch am Handy oder Tablet. Ton aus einem Tab oder vom Bildschirm mitschreiben geht nur in Chrome oder Edge am Computer.

Wie genau ist die Transkription?

Das hängt von Modell, Aufnahme und Sprache ab. Bei klarer Sprache liefern die größeren Modelle meist sehr gute Texte; Dialekt, Fachbegriffe, Lärm und Durcheinanderreden führen eher zu Fehlern. Der Live-Modus nutzt kleinere Modelle, damit er mithält. Prüfe Namen, Zahlen und Zitate selbst.

Welche Sprachen erkennt TranscriptBalance?

Whisper kennt 99 Sprachen, darunter Deutsch, Englisch, Französisch, Niederländisch, Spanisch, Italienisch, Polnisch und Türkisch. TranscriptBalance erkennt die Sprache automatisch, oder du wählst sie selbst. Am besten klappt es mit weit verbreiteten Sprachen.

Wie groß oder lang darf eine Datei sein?

Eine feste Grenze gibt es nicht. Der Ton wird im Arbeitsspeicher deines Geräts verarbeitet, am Computer gehen deshalb längere Aufnahmen als am Handy. Reicht der Speicher nicht, teil die Aufnahme in kürzere Dateien. Lass den Tab offen, bis alles fertig ist.

Erkennt TranscriptBalance verschiedene Sprecher?

Ja, wenn du „Sprecher“ einschaltest. Die Erkennung läuft ebenfalls auf deinem Gerät, automatisch oder für 2 bis 6 Personen, und du kannst die Sprecher umbenennen. Reden zwei gleichzeitig, kann ein Satz falsch zugeordnet werden.

Darf ich Vorlesungen oder Teams-Meetings live mitschreiben?

Das hängt von den Regeln vor Ort ab. TranscriptBalance speichert keinen Ton, die Mitschrift enthält aber, was andere sagen. Sag den anderen vorher Bescheid, hol ihr Einverständnis ein, wo es nötig ist, und halte dich an die Regeln deiner Hochschule oder deines Arbeitgebers. In Deutschland kann es nach § 201 StGB strafbar sein, nichtöffentlich gesprochene Worte ohne Einverständnis aufzunehmen. Veröffentliche Mitschriften von Vorlesungen nicht ohne Erlaubnis.

Funktioniert TranscriptBalance offline?

Nicht vollständig. Zum Öffnen der Seite und für den ersten Download der Modelle brauchst du Internet. Danach liegen die Modelle in deinem Browser, und die Transkription rechnet auf deinem Gerät. Einen eigenen Offline-Modus gibt es aber nicht.