TranscriptBalance
Ouvrir l'app

Transcription sans upload : comment Whisper fonctionne dans votre navigateur

Mis à jour le

Avec TranscriptBalance, la reconnaissance vocale Whisper tourne directement dans votre navigateur, sur votre propre appareil. Vos fichiers audio et vidéo ne sont jamais envoyés : seuls les modèles viennent d’internet, téléchargés une fois puis conservés dans le navigateur.

Comment Whisper peut-il tourner dans un navigateur ?

Whisper est un modèle ouvert de reconnaissance vocale publié par OpenAI (licence MIT). TranscriptBalance l’exécute avec transformers.js et ONNX Runtime Web, deux bibliothèques qui font tourner des modèles d’IA dans le navigateur. Deux voies sont possibles :

L’application vérifie elle-même au démarrage quelle voie convient. Si la carte graphique ne parvient pas à charger un modèle ou décroche, elle passe au processeur quand c’est possible. Votre fichier est lu dans le navigateur, converti en son à 16 kHz, découpé aux pauses en morceaux de 28 secondes au plus, puis transcrit morceau par morceau. Le mode live, lui, calcule toujours sur le processeur avec de petits modèles, pour laisser la carte graphique libre pour l’IA.

Qu’est-ce qui est téléchargé une seule fois ?

Rien à l’ouverture de la page, seulement quand vous lancez une fonction. Votre navigateur télécharge alors :

Tout est stocké dans votre navigateur (dans l’Origin Private File System) et rechargé depuis là la fois suivante. L’application demande aussi au navigateur de ne pas effacer ces fichiers de lui-même. Comme pour tout téléchargement, Hugging Face et jsDelivr voient votre adresse IP et le fichier demandé, mais aucun contenu.

Qu’est-ce qui ne quitte jamais votre appareil ?

Comme rien de tout cela n’est stocké chez nous, nous ne pouvons rien récupérer non plus. Exportez ce qui compte pour vous.

Comment le vérifier soi-même ?

  1. Ouvrez TranscriptBalance dans Chrome, Edge ou Firefox et appuyez sur F12 (ou clic droit, puis « Inspecter »). Passez à l’onglet « Réseau ».
  2. Déposez un fichier et lancez la transcription.
  3. Vous voyez des téléchargements depuis huggingface.co ou hf.co et cdn.jsdelivr.net (surtout la première fois), des parties de l’application depuis notre propre domaine et de courts messages vers /api/e. Aucune requête n’envoie votre fichier.

Un clic sur un message /api/e montre son contenu : le type d’action et des indications approximatives comme le modèle et la durée arrondie à la minute, jamais de texte ni de nom de fichier.

Qu’est-ce qui sort avec les fonctions facultatives ?

Tous les détails figurent dans la politique de confidentialité.

Prérequis et limites

Transcrire maintenant dans le navigateur

Questions fréquentes

La transcription dans le navigateur est-elle conforme au RGPD ?

TranscriptBalance ne reçoit jamais vos contenus : le son, les transcriptions et les noms de fichiers restent sur votre appareil, aucun serveur ne les traite. Si vous utilisez un enregistrement au-delà d’un usage privé, vous êtes responsable de la protection des données des personnes qu’il contient. Pour un entretien ou une réunion, demandez leur accord et respectez les règles de votre université ou de votre employeur.

Hugging Face voit-il ce que je transcris ?

Non. Hugging Face fournit seulement les fichiers des modèles et voit, comme pour tout téléchargement, votre adresse IP et le modèle demandé. Pour le modèle live allemand, cela révèle que vous transcrivez de l’allemand. Le son et le texte ne vont jamais chez Hugging Face.

Pourquoi le premier lancement est-il plus lent ?

La première fois, votre navigateur télécharge le modèle Whisper, entre 44 et 762 Mo selon le modèle. Ensuite, il reste stocké dans le navigateur et TranscriptBalance démarre sans nouveau téléchargement.

Comment supprimer les modèles et mes transcriptions ?

Dans le choix du modèle de TranscriptBalance, supprimez les modèles de transcription un par un avec « Supprimer le modèle » ; « Tout supprimer » efface tous les fichiers de modèles stockés. Retirez les transcriptions une par une ou avec « Nouveau », et les séances enregistrées avec « Supprimer la séance ». Pour tout effacer d’un coup, supprimez les données du site TranscriptBalance dans votre navigateur.

Pourquoi le modèle « Précis » exige-t-il une carte graphique ?

« Précis », c’est Whisper large-v3-turbo, le plus grand des quatre modèles de TranscriptBalance. Sur le processeur, il serait trop lent pour de longs enregistrements, c’est pourquoi l’application ne le propose qu’avec WebGPU. Sans WebGPU, « Équilibré » (Whisper small) est le choix le plus précis.

Le résumé par IA est-il lui aussi calculé en local ?

En mode fichier, oui. TranscriptBalance utilise d’abord l’IA intégrée de Chrome (Gemini Nano), sinon Gemma 3 1B via WebGPU, toutes deux sur votre appareil. Ce n’est qu’en mode live que vous pouvez connecter Gemini avec votre propre clé Google, si vous le souhaitez ; des extraits de la transcription partent alors chez Google.