EZ
EZ2Conv

Sprache zu Text

Wandeln Sie Ihre Sprache in Echtzeit in Text um mit browserbasierter Spracherkennung. Transkribieren Sie auch Audio- und Videodateien mit lokaler Whisper-KI. Kostenlos, sicher und ohne Anmeldung erforderlich.

Characters
0
Words
0
Sentences
0
Duration
00:00

Transcript

You can edit the text below

Anleitung

  1. [Echtzeit] Wählen Sie den Tab "Echtzeit", wählen Sie Ihre Sprache und klicken Sie auf "Aufnahme starten"
  2. [Echtzeit] Sprechen Sie deutlich ins Mikrofon - der Text erscheint in Echtzeit während Sie sprechen
  3. [Datei-Upload] Wählen Sie den Tab "Datei-Upload", wählen Sie ein KI-Modell und laden Sie eine Audio-/Videodatei hoch
  4. [Datei-Upload] Klicken Sie auf "Transkribieren" - das KI-Modell wird beim ersten Gebrauch automatisch heruntergeladen
  5. Bearbeiten, kopieren oder laden Sie Ihre Transkription herunter, wenn Sie fertig sind

Nützliche Tipps

  • Der Echtzeit-Modus erfordert Chrome, Edge oder Safari Browser
  • Der Datei-Upload funktioniert offline nach dem Download des KI-Modells
  • Für lange Dateien bietet das 'Tiny'-Modell die schnellste Verarbeitung
  • Nur der Datei-Upload behält das Audio auf Ihrem Gerät - der Echtzeit-Modus sendet es an den Sprachdienst des Browsers, sofern keine lokale Erkennung verfügbar ist

Zwei Wege, Sprache in Text zu verwandeln

Was dieses Tool leistet

Speech to Text vereint zwei unabhängige Engines mit demselben Ziel. Der Echtzeitmodus nutzt die Web Speech API — die in aktuellen Browsern eingebaute SpeechRecognition-Schnittstelle — und schreibt die Wörter noch während des Sprechens auf die Seite: zunächst als vorläufiger Text, nach einer Pause als endgültige Zeile. Der Datei-Upload-Modus lädt dagegen ein Whisper-KI-Modell über Transformers.js und transkribiert eine bereits vorhandene Aufnahme, ohne irgendein Mikrofon abzuhören.

Wann welcher Modus passt

Das Echtzeit-Diktat eignet sich, um Gedanken freihändig festzuhalten: Besprechungsnotizen, einen schnellen Entwurf oder eine Gedächtnisstütze, die man lieber spricht als tippt. Es spielt seine Stärke in kurzen Live-Sitzungen aus, in denen der sofort erscheinende Text den Fluss hält.

Der Datei-Upload passt besser zu bereits aufgenommenem Material: ein Interview, eine Vorlesung, eine Sprachnotiz oder die Tonspur eines Videos. Sobald das Whisper-Modell den einmaligen Download abgeschlossen hat, arbeitet dieser Modus auch ohne Verbindung weiter, was langen Aufnahmen und wiederkehrenden Aufgaben zugutekommt.

Ein kurzer Durchgang

Für die Live-Arbeit wählen Sie Ihre Sprache aus der Liste, klicken auf Start Recording und erlauben den Mikrofonzugriff, wenn der Browser danach fragt; Ihre Stimme füllt das Transkript, das Sie anschließend bearbeiten können. Für eine Aufnahme wechseln Sie zu File Upload, wählen ein Modell — Tiny für Tempo, Small für höhere mehrsprachige Genauigkeit — und legen eine MP3-, WAV-, MP4- oder ähnliche Datei ab. Nach dem Durchlauf steht der Text zum Kopieren oder Herunterladen bereit.

Kompatibilität und Stolpersteine

Die Echtzeiterkennung hängt vom Browser ab: Chrome, Edge und Safari implementieren die Web Speech API, Firefox nicht — dort empfiehlt sich File Upload. Neuere Chrome-Versionen können ein Sprachmodell auf dem Gerät installieren und das Mikrofon-Audio lokal halten; andernfalls übernimmt der Sprachdienst des Browserherstellers die Erkennung. Die Echtzeitliste bietet 22 Sprachen, während Whisper über 99 mit automatischer Erkennung abdeckt. Der Upload akzeptiert gängige Audio- und Videoformate bis 500MB; bei Video beschleunigt das vorherige Extrahieren der Tonspur den Vorgang und verbessert das Ergebnis.

Häufig gestellte Fragen

Beide Engines stehen ohne Limit bereit: das Live-Diktat über die Web Speech API und die Datei-Transkription mit den Whisper-Modellen Tiny, Base und Small, für Audio oder Video beliebiger Länge. Es gibt keine Minutenabrechnung und keine Premium-Modelle hinter einer Bezahlschranke.
Das hängt vom Modus ab. Die Datei-Transkription führt ein Whisper-Modell mit Transformers.js lokal aus, sodass Aufnahme und Text das Gerät nicht verlassen. Der Echtzeitmodus nutzt die Web Speech API des Browsers, die das Mikrofon-Audio meist zur Erkennung an die Server des Herstellers sendet — außer Chrome hat das Modell auf dem Gerät installiert. EZ2Conv erhält Ihr Audio zu keinem Zeitpunkt.
Kein Konto nötig. Wählen Sie den Modus, diktieren oder laden Sie Ihre Aufnahme hoch und bearbeiten, kopieren oder speichern Sie den Text anschließend. Weder E-Mail noch persönliche Daten werden verlangt.
Chrome, Edge und Safari implementieren die für den Live-Modus nötige Web Speech API; Firefox tut das nicht. In jedem Browser funktioniert jedoch der File-Upload-Modus, da er mit Whisper transkribiert, ohne von dieser API abzuhängen.
Der Echtzeitmodus braucht das Mikrofon, um Ihre Stimme aufzunehmen, und der Browser fragt einmal danach. Lehnen Sie ab, kann dieser Modus nicht mithören — der Datei-Upload kommt jedoch ohne Mikrofon aus, weil er eine vorhandene Aufnahme liest.
Die Echtzeitliste umfasst 22 Sprachen über die Web Speech API, der Datei-Modus mit Whisper erkennt über 99 mit automatischer Erkennung. Wählen Sie die Sprache vor der Aufnahme, um die Genauigkeit zu erhöhen.