Dos formas de convertir voz en texto
Qué hace esta herramienta
Speech to Text reúne dos motores independientes con un mismo objetivo. El modo en tiempo real recurre a la Web Speech API —la interfaz SpeechRecognition presente en los navegadores actuales— y va escribiendo las palabras sobre la página mientras hablas: primero como texto provisional y, al hacer una pausa, como línea definitiva. El modo de subida de archivos, en cambio, carga un modelo de IA Whisper mediante Transformers.js y transcribe una grabación que ya tienes, sin escuchar ningún micrófono.
Cuándo usar cada modo
El dictado en tiempo real es ideal para capturar ideas con las manos libres: notas de una reunión, un borrador rápido o un recordatorio que prefieres decir antes que escribir. Rinde especialmente bien en sesiones breves y en directo, donde ver el texto al instante ayuda a mantener el ritmo.
La subida de archivos conviene más al material ya existente: una entrevista, una clase, una nota de voz o la pista de audio de un vídeo. Una vez que el modelo Whisper completa su descarga inicial, ese modo sigue funcionando incluso sin conexión, algo práctico para grabaciones largas o tareas repetidas.
Un recorrido rápido
Para trabajar en directo, elige tu idioma en el desplegable, pulsa Start Recording y concede el acceso al micrófono cuando el navegador lo solicite; tu voz llena la transcripción y luego puedes editarla. Para una grabación, cambia a File Upload, escoge un modelo —Tiny si buscas velocidad, Small para más precisión multilingüe— y arrastra un archivo MP3, WAV, MP4 o similar. Cuando el modelo termina, el texto queda listo para copiar o descargar.
Compatibilidad y detalles a tener en cuenta
El reconocimiento en tiempo real depende del navegador: Chrome, Edge y Safari implementan la Web Speech API, mientras que Firefox no, así que allí conviene usar File Upload. Las versiones recientes de Chrome pueden instalar un modelo de idioma en el dispositivo y mantener el audio del micrófono en local; de lo contrario, el habla la procesa el servicio de voz del fabricante del navegador. El desplegable en tiempo real ofrece 22 idiomas, mientras que Whisper cubre más de 99 con detección automática. La subida admite formatos de audio y vídeo habituales hasta 500MB; con vídeo, extraer antes el audio acelera el proceso y mejora el resultado.