EZ
EZ2Conv

Voz a Texto

Convierte tu voz a texto en tiempo real usando reconocimiento de voz del navegador. También transcribe archivos de audio y vídeo con IA local Whisper. Gratuito, seguro y sin necesidad de iniciar sesión.

Characters
0
Words
0
Sentences
0
Duration
00:00

Transcript

You can edit the text below

Como Usar

  1. [Tiempo real] Selecciona la pestaña "Tiempo real", elige tu idioma y haz clic en "Iniciar grabación"
  2. [Tiempo real] Habla claramente al micrófono - el texto aparece en tiempo real conforme hablas
  3. [Subir archivo] Selecciona la pestaña "Subir archivo", elige un modelo de IA y sube un archivo de audio/vídeo
  4. [Subir archivo] Haz clic en "Transcribir" - el modelo de IA se descarga en el primer uso automáticamente
  5. Edita, copia o descarga tu transcripción cuando hayas terminado con las opciones disponibles

Consejos Útiles

  • El modo tiempo real requiere el navegador Chrome, Edge o Safari
  • La subida de archivos funciona sin conexión después de descargar el modelo de IA
  • Para archivos largos, el modelo 'Tiny' ofrece el procesamiento más rápido
  • Solo la subida de archivos mantiene el audio en tu dispositivo: el modo en tiempo real lo envía al servicio de voz del navegador salvo que haya reconocimiento local disponible

Dos formas de convertir voz en texto

Qué hace esta herramienta

Speech to Text reúne dos motores independientes con un mismo objetivo. El modo en tiempo real recurre a la Web Speech API —la interfaz SpeechRecognition presente en los navegadores actuales— y va escribiendo las palabras sobre la página mientras hablas: primero como texto provisional y, al hacer una pausa, como línea definitiva. El modo de subida de archivos, en cambio, carga un modelo de IA Whisper mediante Transformers.js y transcribe una grabación que ya tienes, sin escuchar ningún micrófono.

Cuándo usar cada modo

El dictado en tiempo real es ideal para capturar ideas con las manos libres: notas de una reunión, un borrador rápido o un recordatorio que prefieres decir antes que escribir. Rinde especialmente bien en sesiones breves y en directo, donde ver el texto al instante ayuda a mantener el ritmo.

La subida de archivos conviene más al material ya existente: una entrevista, una clase, una nota de voz o la pista de audio de un vídeo. Una vez que el modelo Whisper completa su descarga inicial, ese modo sigue funcionando incluso sin conexión, algo práctico para grabaciones largas o tareas repetidas.

Un recorrido rápido

Para trabajar en directo, elige tu idioma en el desplegable, pulsa Start Recording y concede el acceso al micrófono cuando el navegador lo solicite; tu voz llena la transcripción y luego puedes editarla. Para una grabación, cambia a File Upload, escoge un modelo —Tiny si buscas velocidad, Small para más precisión multilingüe— y arrastra un archivo MP3, WAV, MP4 o similar. Cuando el modelo termina, el texto queda listo para copiar o descargar.

Compatibilidad y detalles a tener en cuenta

El reconocimiento en tiempo real depende del navegador: Chrome, Edge y Safari implementan la Web Speech API, mientras que Firefox no, así que allí conviene usar File Upload. Las versiones recientes de Chrome pueden instalar un modelo de idioma en el dispositivo y mantener el audio del micrófono en local; de lo contrario, el habla la procesa el servicio de voz del fabricante del navegador. El desplegable en tiempo real ofrece 22 idiomas, mientras que Whisper cubre más de 99 con detección automática. La subida admite formatos de audio y vídeo habituales hasta 500MB; con vídeo, extraer antes el audio acelera el proceso y mejora el resultado.

Preguntas frecuentes

Los dos motores están abiertos sin límites: el dictado en directo con la Web Speech API y la transcripción de archivos con los modelos Whisper Tiny, Base y Small, para audio o vídeo de cualquier duración. No hay medición por minutos ni modelos premium bloqueados tras un muro de pago.
Depende del modo. La transcripción por archivo ejecuta un modelo Whisper con Transformers.js de forma local, así que la grabación y su texto no salen del equipo. El modo en tiempo real usa la Web Speech API del navegador, que suele enviar el audio del micrófono a los servidores del fabricante para reconocerlo, salvo que Chrome tenga instalado el modelo en el dispositivo. EZ2Conv nunca recibe tu audio.
No hace falta ninguna cuenta. Elige el modo, dicta o sube tu grabación y después edita, copia o descarga el texto. No se pide correo electrónico ni datos personales.
Chrome, Edge y Safari implementan la Web Speech API necesaria para el modo en directo; Firefox no la incluye. En cualquier navegador, el modo File Upload sigue funcionando, porque transcribe con Whisper sin depender de esa API.
El modo en tiempo real necesita el micrófono para captar tu voz, y el navegador lo pregunta una vez. Si lo rechazas, ese modo no puede escuchar, pero la subida de archivos no requiere micrófono, ya que lee una grabación existente.
El desplegable en tiempo real incluye 22 idiomas a través de la Web Speech API, y el modo por archivo con Whisper admite más de 99 con detección automática. Selecciona el idioma antes de grabar para mejorar la precisión.