Interviews kostenlos transkribieren – für Bachelor- und Masterarbeit
Stand:
Mit TranscriptBalance transkribierst du Interviews für deine Bachelor- oder Masterarbeit kostenlos und ohne Minutenlimit, mit Sprechererkennung, Zeitstempeln und Export als Word-Datei. Die Aufnahme bleibt dabei auf deinem Gerät: Whisper läuft direkt in deinem Browser, nichts wird hochgeladen.
Warum Interviews lokal transkribieren?
Forschungsinterviews enthalten oft persönliche Angaben: Namen, Meinungen, manchmal Gesundheit oder Arbeitsplatz. Viele Transkriptionsdienste laden die Aufnahme dafür auf ihre Server. Bei TranscriptBalance läuft die Transkription in deinem Browser, ohne Konto. Aufnahme und Transkript erreichen keinen Server, auch nicht unseren. Es gibt also keinen Dienst, der deine Interviews in deinem Auftrag verarbeitet.
Was dein Gerät trotzdem verlässt: Beim ersten Start lädt der Browser die Modelle von Hugging Face und die Rechen-Laufzeit von jsDelivr. Diese Anbieter sehen deine IP-Adresse, aber keine Inhalte. Außerdem zählt die App anonym, welche Funktionen genutzt werden, nie Inhalte; das kannst du abschalten. Details stehen in der Datenschutzerklärung und unter Transkription ohne Upload.
Ob das für deine Arbeit reicht, legen die Vorgaben deiner Hochschule, deines Lehrstuhls oder der Ethikkommission und deine Einwilligungserklärung fest. Prüf sie oder frag dort nach. Das hier ist keine Rechtsberatung.
So gehst du vor: von der Aufnahme zum Transkript
- Aufnehmen: mit dem Smartphone, einem Diktiergerät oder als Aufzeichnung eines Online-Interviews. Gängige Audio- und Videodateien wie MP3, M4A, WAV oder MP4 funktionieren.
- Datei ablegen: Zieh eine oder mehrere Aufnahmen in TranscriptBalance.
- Einstellen: Wähl das Modell, lass die Sprache erkennen oder leg sie fest, und schalte „Sprecher“ ein. Die Zahl der Sprecher erkennt die App selbst, oder du gibst 2 bis 6 vor.
- Transkribieren: Lass den Tab offen. Bei mehr als 10 Minuten Ton fragt die App, ob sie dir per Benachrichtigung Bescheid geben darf, wenn alles fertig ist.
- Sprecher benennen: Aus „Sprecher A“ und „Sprecher B“ machst du zum Beispiel „I“ und „B1“. So stehen keine Klarnamen vor den Absätzen.
- Exportieren: als DOCX, TXT, SRT, VTT, Markdown, JSON oder CSV, mit oder ohne Zeitstempel und Sprecher. Mehrere Interviews kommen in ein Dokument oder einzeln in eine ZIP-Datei.
Welches Modell passt zu deinem Interview?
- Blitz (Whisper tiny): läuft überall, ist aber ungenau bei Dialekt.
- Schnell (Whisper base): schnell und solide, schwächer bei Fachbegriffen.
- Ausgewogen (Whisper small): sehr gute Qualität, ohne Grafikkarte langsamer.
- Präzise (Whisper large-v3-turbo): die beste Genauigkeit. Braucht eine Grafikkarte mit WebGPU und hat den größten Download.
Die App empfiehlt dir das Modell, das zu deinem Gerät passt. Jedes Modell wird einmal heruntergeladen, je nach Modell und Gerät etwa 45 bis 760 MB, und bleibt danach im Browser gespeichert. Für das Transkript deiner Arbeit nimmst du das genaueste Modell, das dein Gerät schafft.
Tipps für ein genaues Transkript
- Guter Ton zählt am meisten: ruhiger Raum, Mikrofon nah an beiden Personen, keine Musik im Hintergrund. Mach vorher eine kurze Testaufnahme.
- Sprache festlegen: Eine Datei wird in einer Sprache transkribiert. Kennst du sie, stell sie fest ein, statt sie erkennen zu lassen.
- Korrekturlesen: Hör das Interview beim Lesen noch einmal an. Prüf vor allem Namen, Fachbegriffe, Zahlen und alle Stellen, die du in der Arbeit zitierst. Namen, die im Gespräch fallen, ersetzt du dabei durch Pseudonyme.
- Transkriptionsregeln: Whisper schreibt meist einen geglätteten Text. Füllwörter wie „ähm“, Stottern und Pausen fehlen oft. Verlangt dein Regelwerk mehr, ergänzt du das von Hand.
- Sprecherwechsel prüfen: Reden zwei Personen gleichzeitig oder klingen sie ähnlich, kann die Sprechererkennung Abschnitte falsch zuordnen.
Lange Aufnahmen und viele Interviews
Es gibt kein Limit für Minuten oder Dateien. Mehrere Aufnahmen arbeitet die App nacheinander ab und zeigt dabei eine geschätzte Restzeit. Wie lange es dauert, hängt von deinem Gerät und vom Modell ab: Mit einer Grafikkarte über WebGPU geht es deutlich schneller als nur mit dem Prozessor.
Lass den Tab offen; die App hält den Bildschirm dabei wach. Wird die Arbeit unterbrochen, etwa weil der Tab geschlossen wurde, bleibt der Text bis dahin in deinem Browser gespeichert. Legst du dieselbe Datei erneut ab, macht die App nach dem letzten fertigen Abschnitt weiter. Sehr lange Dateien brauchen viel Arbeitsspeicher; auf Handys und schwachen Laptops kann das knapp werden.
Auf Wunsch schreibt eine KI auf deinem Gerät eine Zusammenfassung der Art „Interview“, 1 bis 5 Seiten lang: mit der Chrome-KI oder mit Gemma, das lokal im Browser läuft, WebGPU braucht und einmalig etwa 0,8 GB lädt. Im Datei-Modus geht dabei nichts an Gemini oder einen anderen Online-Dienst. Die Zusammenfassung ist KI-generiert; für deine Auswertung zählt das Transkript.
TranscriptBalance, aTrain oder noScribe?
aTrain von der Universität Graz und noScribe sind bekannte kostenlose Programme, die ebenfalls lokal mit Whisper transkribieren, Sprecher erkennen und für Forschungsinterviews gemacht sind. Die Unterschiede:
- Installation: aTrain und noScribe installierst du als Programm. TranscriptBalance läuft im Browser, auch auf Rechnern, auf denen du nichts installieren darfst.
- Korrigieren: noScribe hat einen eigenen Editor, in dem du beim Anhören korrigierst. TranscriptBalance hat keinen Editor; du liest im exportierten Word-Dokument Korrektur.
- Auswertung: aTrain bietet Exporte für Programme wie MAXQDA, ATLAS.ti und NVivo. TranscriptBalance liefert DOCX, TXT und andere Standardformate.
- Rechenleistung: Ein installiertes Programm kann deinen Computer voll ausnutzen. Im Browser braucht das genaueste Modell eine Grafikkarte mit WebGPU.
- Mehr als Dateien: TranscriptBalance hat zusätzlich einen Live-Modus für Vorlesungen und Meetings.
Welches Werkzeug passt, hängt von deinem Rechner und deinem Ablauf ab. Einen breiteren Überblick gibt der Vergleich kostenloser Transkription.
Interview jetzt transkribierenHäufige Fragen
Ist TranscriptBalance für Forschungsinterviews DSGVO-konform?
TranscriptBalance lädt deine Aufnahme nicht hoch, braucht kein Konto und speichert Transkripte nur in deinem Browser; kein Dienst verarbeitet deine Interviews in deinem Auftrag. Ins Internet gehen nur die Modell-Downloads von Hugging Face und jsDelivr sowie anonyme Nutzungszählungen ohne Inhalte, die du abschalten kannst. Ob das deine Anforderungen erfüllt, entscheiden die Regeln deiner Hochschule oder Ethikkommission. Das ist keine Rechtsberatung.
Wie lange dauert es, ein einstündiges Interview zu transkribieren?
Das hängt stark von deinem Gerät und dem gewählten Modell ab. Mit einer Grafikkarte über WebGPU geht es deutlich schneller als nur mit dem Prozessor, und kleinere Modelle sind schneller als große. TranscriptBalance zeigt dir während der Arbeit eine geschätzte Restzeit; teste am besten zuerst mit einer kurzen Aufnahme.
Erkennt TranscriptBalance, wer spricht?
Ja. Die Sprechererkennung läuft auf deinem Gerät, mit den Modellen pyannote und WeSpeaker. Die Zahl der Sprecher erkennt TranscriptBalance selbst, oder du gibst 2 bis 6 vor. Danach benennst du die Sprecher um, zum Beispiel in „I“ und „B1“. Bei Überlappungen oder ähnlichen Stimmen solltest du die Zuordnung prüfen.
Kann ich das Transkript in Word bearbeiten?
Ja. TranscriptBalance exportiert eine DOCX-Datei, wahlweise mit Zeitstempeln und Sprechernamen, die du in Word oder einem anderen Textprogramm korrigierst. Einen eigenen Editor hat TranscriptBalance nicht. Daneben gibt es TXT, SRT, VTT, Markdown, JSON und CSV.
Welche Dateien kann ich transkribieren?
Gängige Audio- und Videoformate wie MP3, M4A, WAV oder MP4; bei Videos wird nur die Tonspur verwendet. Was genau geht, hängt davon ab, welche Formate dein Browser lesen kann. Meldet TranscriptBalance ein Format als nicht unterstützt, wandle die Datei vorher zum Beispiel in MP3 um.
Gibt es ein Limit für Länge oder Anzahl der Interviews?
Nein. TranscriptBalance begrenzt weder Minuten noch Dateien, und mehrere Aufnahmen werden nacheinander abgearbeitet. Die Grenzen setzt dein Gerät: Sehr lange Dateien brauchen viel Arbeitsspeicher, und auf schwachen Geräten dauert es entsprechend länger.
Werden Füllwörter und Pausen mittranskribiert?
Meist nicht. Whisper, die Spracherkennung hinter TranscriptBalance, schreibt einen geglätteten Text, in dem Füllwörter wie „ähm“, Wortwiederholungen und Pausen oft fehlen. Verlangen deine Transkriptionsregeln ein ausführliches Transkript, ergänzt du diese Stellen beim Korrekturlesen von Hand.