Deux façons de transformer la parole en texte
Ce que fait cet outil
Speech to Text réunit deux moteurs indépendants pour un même but. Le mode temps réel s'appuie sur la Web Speech API — l'interface SpeechRecognition intégrée aux navigateurs actuels — et inscrit les mots sur la page au fil de la parole : d'abord un texte provisoire, puis une ligne définitive dès que vous marquez une pause. Le mode d'envoi de fichier charge quant à lui un modèle d'IA Whisper via Transformers.js et transcrit un enregistrement que vous possédez déjà, sans écouter le moindre micro.
Quel mode choisir
La dictée en temps réel est idéale pour saisir des idées sans les mains : notes de réunion, brouillon rapide ou pense-bête que l'on préfère dicter plutôt que taper. Elle brille lors de courtes sessions en direct, où voir le texte apparaître aussitôt entretient le rythme.
L'envoi de fichier convient mieux à un contenu déjà enregistré : un entretien, un cours, un mémo vocal ou la piste audio d'une vidéo. Une fois le téléchargement initial du modèle Whisper terminé, ce mode continue de fonctionner même hors connexion, ce qui aide pour les longs enregistrements et les tâches répétées.
Un aperçu rapide
Pour travailler en direct, choisissez votre langue dans la liste, cliquez sur Start Recording et autorisez l'accès au micro lorsque le navigateur le demande ; votre voix remplit la transcription, que vous pouvez ensuite retoucher. Pour un enregistrement, passez à File Upload, sélectionnez un modèle — Tiny pour la rapidité, Small pour une meilleure précision multilingue — et déposez un fichier MP3, WAV, MP4 ou équivalent. Une fois le modèle exécuté, le texte est prêt à copier ou à télécharger.
Compatibilité et points de vigilance
La reconnaissance en temps réel dépend du navigateur : Chrome, Edge et Safari implémentent la Web Speech API, contrairement à Firefox, où il vaut mieux passer par File Upload. Les versions récentes de Chrome peuvent installer un modèle de langue sur l'appareil et garder l'audio du micro en local ; sinon, la parole est traitée par le service vocal de l'éditeur du navigateur. La liste en temps réel propose 22 langues, tandis que Whisper en couvre plus de 99 avec détection automatique. L'envoi accepte les formats audio et vidéo courants jusqu'à 500MB ; pour une vidéo, extraire d'abord l'audio accélère le traitement et améliore le résultat.