Duas maneiras de transformar fala em texto
O que esta ferramenta faz
O Speech to Text combina dois motores independentes com o mesmo objetivo. O modo em tempo real usa a Web Speech API — a interface SpeechRecognition presente nos navegadores atuais — e vai escrevendo as palavras na página enquanto você fala: primeiro como texto provisório e, quando você faz uma pausa, como linha definitiva. Já o modo de envio de arquivo carrega um modelo de IA Whisper por meio do Transformers.js e transcreve uma gravação que você já tem, sem ouvir nenhum microfone.
Quando usar cada modo
O ditado em tempo real é ótimo para registrar ideias com as mãos livres: anotações de reunião, um rascunho rápido ou um lembrete que você prefere falar a digitar. Ele se destaca em sessões curtas e ao vivo, onde ver o texto surgir na hora mantém o ritmo.
O envio de arquivo combina melhor com material já gravado: uma entrevista, uma aula, um recado de voz ou a trilha de áudio de um vídeo. Depois que o modelo Whisper conclui o download inicial, esse modo continua funcionando mesmo sem conexão, o que ajuda em gravações longas e tarefas repetidas.
Um passo a passo rápido
Para trabalhar ao vivo, escolha o idioma na lista, clique em Start Recording e conceda o acesso ao microfone quando o navegador pedir; sua voz preenche a transcrição, que você pode editar depois. Para uma gravação, mude para File Upload, selecione um modelo — Tiny para velocidade, Small para mais precisão multilíngue — e solte um arquivo MP3, WAV, MP4 ou semelhante. Terminado o processamento, o texto fica pronto para copiar ou baixar.
Compatibilidade e pontos de atenção
O reconhecimento em tempo real depende do navegador: Chrome, Edge e Safari implementam a Web Speech API, ao contrário do Firefox, onde vale usar o File Upload. As versões recentes do Chrome podem instalar um modelo de idioma no dispositivo e manter o áudio do microfone local; caso contrário, a fala é processada pelo serviço de voz do fabricante do navegador. A lista em tempo real oferece 22 idiomas, enquanto o Whisper cobre mais de 99 com detecção automática. O envio aceita formatos comuns de áudio e vídeo até 500MB; para vídeo, extrair o áudio antes acelera o processo e melhora o resultado.