Transcription sans upload : comment Whisper fonctionne dans votre navigateur
Mis à jour le
Avec TranscriptBalance, la reconnaissance vocale Whisper tourne directement dans votre navigateur, sur votre propre appareil. Vos fichiers audio et vidéo ne sont jamais envoyés : seuls les modèles viennent d’internet, téléchargés une fois puis conservés dans le navigateur.
Comment Whisper peut-il tourner dans un navigateur ?
Whisper est un modèle ouvert de reconnaissance vocale publié par OpenAI (licence MIT). TranscriptBalance l’exécute avec transformers.js et ONNX Runtime Web, deux bibliothèques qui font tourner des modèles d’IA dans le navigateur. Deux voies sont possibles :
- WebGPU : si votre navigateur peut utiliser la carte graphique, Whisper calcule dessus. C’est la voie la plus rapide.
- WebAssembly : sans WebGPU, la même application calcule sur le processeur, en répartissant le travail sur plusieurs cœurs. Cela fonctionne dans pratiquement tous les navigateurs récents, mais prend plus de temps.
L’application vérifie elle-même au démarrage quelle voie convient. Si la carte graphique ne parvient pas à charger un modèle ou décroche, elle passe au processeur quand c’est possible. Votre fichier est lu dans le navigateur, converti en son à 16 kHz, découpé aux pauses en morceaux de 28 secondes au plus, puis transcrit morceau par morceau. Le mode live, lui, calcule toujours sur le processeur avec de petits modèles, pour laisser la carte graphique libre pour l’IA.
Qu’est-ce qui est téléchargé une seule fois ?
Rien à l’ouverture de la page, seulement quand vous lancez une fonction. Votre navigateur télécharge alors :
- le modèle Whisper choisi, chez Hugging Face. Sur le processeur : Éclair 44 Mo, Rapide 80 Mo, Équilibré 252 Mo. Avec WebGPU : Éclair 122 Mo, Rapide 209 Mo, Équilibré 589 Mo, Précis (large-v3-turbo) 762 Mo.
- l’identification des locuteurs (pyannote et WeSpeaker, environ 13 Mo au total), si vous l’activez.
- pour le mode live, un modèle Whisper dédié à l’allemand (231 Mo) ou Whisper base pour les autres langues (80 Mo), ainsi que Silero VAD (environ 2 Mo), qui repère quand quelqu’un parle.
- Gemma 3 1B (environ 0,8 Go) pour les résumés, uniquement si l’IA intégrée de Chrome ne peut pas s’en charger.
- ONNX Runtime, l’environnement d’exécution, chez jsDelivr, au premier lancement d’un modèle.
Tout est stocké dans votre navigateur (dans l’Origin Private File System) et rechargé depuis là la fois suivante. L’application demande aussi au navigateur de ne pas effacer ces fichiers de lui-même. Comme pour tout téléchargement, Hugging Face et jsDelivr voient votre adresse IP et le fichier demandé, mais aucun contenu.
Qu’est-ce qui ne quitte jamais votre appareil ?
- Votre son : fichiers, micro et son partagé d’un onglet ou de l’écran. En mode live, le son reste uniquement en mémoire vive et n’est jamais enregistré.
- Vos résultats : transcriptions, noms des locuteurs, résumés et séances enregistrées restent uniquement dans le stockage de votre navigateur (IndexedDB).
- Vos exports : TXT, Word, SRT et les autres formats sont créés par votre navigateur, directement sous forme de fichier sur votre appareil.
Comme rien de tout cela n’est stocké chez nous, nous ne pouvons rien récupérer non plus. Exportez ce qui compte pour vous.
Comment le vérifier soi-même ?
- Ouvrez TranscriptBalance dans Chrome, Edge ou Firefox et appuyez sur F12 (ou clic droit, puis « Inspecter »). Passez à l’onglet « Réseau ».
- Déposez un fichier et lancez la transcription.
- Vous voyez des téléchargements depuis huggingface.co ou hf.co et cdn.jsdelivr.net (surtout la première fois), des parties de l’application depuis notre propre domaine et de courts messages vers
/api/e. Aucune requête n’envoie votre fichier.
Un clic sur un message /api/e montre son contenu : le type d’action et des indications approximatives comme le modèle et la durée arrondie à la minute, jamais de texte ni de nom de fichier.
Qu’est-ce qui sort avec les fonctions facultatives ?
- Gemini avec votre propre clé (mode live uniquement, facultatif, à partir de 18 ans) : votre navigateur envoie alors des extraits de la transcription et vos questions directement à Google, pas à nous. Sans Gemini, le mode live utilise l’IA intégrée de Chrome sur votre appareil, ou aucune IA.
- IA de Chrome : Chrome télécharge lui-même son modèle chez Google la première fois (environ 4 Go). Elle traite vos textes sur votre appareil.
- Liens d’agenda : un clic sur « Google Agenda » ou « Outlook » transmet le titre, l’heure et la description d’un rendez-vous. Le fichier .ics reste sur votre appareil.
- Statistiques d’utilisation anonymes : nous comptons les visites et les fonctions utilisées, sans cookies, sans enregistrer d’adresses IP et jamais avec du contenu. Désactiver l’option dans l’application, sous « Infos et licences », arrête les messages sur les fonctions. Avec Global Privacy Control ou Do Not Track activé, l’application n’envoie rien et votre visite n’est pas comptée non plus.
Tous les détails figurent dans la politique de confidentialité.
Prérequis et limites
- Navigateur : WebGPU est disponible par exemple dans les versions récentes de Chrome et d’Edge sur ordinateur, et dans d’autres navigateurs selon la version et l’appareil. Sans WebGPU, tout tourne sur le processeur, sauf le modèle « Précis » et les résumés avec Gemma.
- Vitesse : avec une carte graphique, la transcription est en général nettement plus rapide que la durée de l’enregistrement. Sur un appareil peu puissant sans WebGPU, un modèle plus précis peut prendre autant de temps que l’enregistrement, voire plus. L’application mesure la vitesse de votre appareil et recommande un modèle en conséquence.
- Mémoire : le son est traité en mémoire vive. Les enregistrements très longs atteignent plus vite les limites sur un smartphone que sur un ordinateur.
- Onglet ouvert : le calcul ne se fait que tant que la page est ouverte. L’application garde l’écran allumé et, pour plus de 10 minutes de son, peut vous avertir quand la tâche est terminée.
- Espace de stockage : les modèles occupent de la place sur votre appareil. Si le navigateur efface les données du site, il les retélécharge la fois suivante.
Questions fréquentes
La transcription dans le navigateur est-elle conforme au RGPD ?
TranscriptBalance ne reçoit jamais vos contenus : le son, les transcriptions et les noms de fichiers restent sur votre appareil, aucun serveur ne les traite. Si vous utilisez un enregistrement au-delà d’un usage privé, vous êtes responsable de la protection des données des personnes qu’il contient. Pour un entretien ou une réunion, demandez leur accord et respectez les règles de votre université ou de votre employeur.
Hugging Face voit-il ce que je transcris ?
Non. Hugging Face fournit seulement les fichiers des modèles et voit, comme pour tout téléchargement, votre adresse IP et le modèle demandé. Pour le modèle live allemand, cela révèle que vous transcrivez de l’allemand. Le son et le texte ne vont jamais chez Hugging Face.
Pourquoi le premier lancement est-il plus lent ?
La première fois, votre navigateur télécharge le modèle Whisper, entre 44 et 762 Mo selon le modèle. Ensuite, il reste stocké dans le navigateur et TranscriptBalance démarre sans nouveau téléchargement.
Comment supprimer les modèles et mes transcriptions ?
Dans le choix du modèle de TranscriptBalance, supprimez les modèles de transcription un par un avec « Supprimer le modèle » ; « Tout supprimer » efface tous les fichiers de modèles stockés. Retirez les transcriptions une par une ou avec « Nouveau », et les séances enregistrées avec « Supprimer la séance ». Pour tout effacer d’un coup, supprimez les données du site TranscriptBalance dans votre navigateur.
Pourquoi le modèle « Précis » exige-t-il une carte graphique ?
« Précis », c’est Whisper large-v3-turbo, le plus grand des quatre modèles de TranscriptBalance. Sur le processeur, il serait trop lent pour de longs enregistrements, c’est pourquoi l’application ne le propose qu’avec WebGPU. Sans WebGPU, « Équilibré » (Whisper small) est le choix le plus précis.
Le résumé par IA est-il lui aussi calculé en local ?
En mode fichier, oui. TranscriptBalance utilise d’abord l’IA intégrée de Chrome (Gemini Nano), sinon Gemma 3 1B via WebGPU, toutes deux sur votre appareil. Ce n’est qu’en mode live que vous pouvez connecter Gemini avec votre propre clé Google, si vous le souhaitez ; des extraits de la transcription partent alors chez Google.