Zwei Wege, Sprache in Text zu verwandeln
Was dieses Tool leistet
Speech to Text vereint zwei unabhängige Engines mit demselben Ziel. Der Echtzeitmodus nutzt die Web Speech API — die in aktuellen Browsern eingebaute SpeechRecognition-Schnittstelle — und schreibt die Wörter noch während des Sprechens auf die Seite: zunächst als vorläufiger Text, nach einer Pause als endgültige Zeile. Der Datei-Upload-Modus lädt dagegen ein Whisper-KI-Modell über Transformers.js und transkribiert eine bereits vorhandene Aufnahme, ohne irgendein Mikrofon abzuhören.
Wann welcher Modus passt
Das Echtzeit-Diktat eignet sich, um Gedanken freihändig festzuhalten: Besprechungsnotizen, einen schnellen Entwurf oder eine Gedächtnisstütze, die man lieber spricht als tippt. Es spielt seine Stärke in kurzen Live-Sitzungen aus, in denen der sofort erscheinende Text den Fluss hält.
Der Datei-Upload passt besser zu bereits aufgenommenem Material: ein Interview, eine Vorlesung, eine Sprachnotiz oder die Tonspur eines Videos. Sobald das Whisper-Modell den einmaligen Download abgeschlossen hat, arbeitet dieser Modus auch ohne Verbindung weiter, was langen Aufnahmen und wiederkehrenden Aufgaben zugutekommt.
Ein kurzer Durchgang
Für die Live-Arbeit wählen Sie Ihre Sprache aus der Liste, klicken auf Start Recording und erlauben den Mikrofonzugriff, wenn der Browser danach fragt; Ihre Stimme füllt das Transkript, das Sie anschließend bearbeiten können. Für eine Aufnahme wechseln Sie zu File Upload, wählen ein Modell — Tiny für Tempo, Small für höhere mehrsprachige Genauigkeit — und legen eine MP3-, WAV-, MP4- oder ähnliche Datei ab. Nach dem Durchlauf steht der Text zum Kopieren oder Herunterladen bereit.
Kompatibilität und Stolpersteine
Die Echtzeiterkennung hängt vom Browser ab: Chrome, Edge und Safari implementieren die Web Speech API, Firefox nicht — dort empfiehlt sich File Upload. Neuere Chrome-Versionen können ein Sprachmodell auf dem Gerät installieren und das Mikrofon-Audio lokal halten; andernfalls übernimmt der Sprachdienst des Browserherstellers die Erkennung. Die Echtzeitliste bietet 22 Sprachen, während Whisper über 99 mit automatischer Erkennung abdeckt. Der Upload akzeptiert gängige Audio- und Videoformate bis 500MB; bei Video beschleunigt das vorherige Extrahieren der Tonspur den Vorgang und verbessert das Ergebnis.