把語音轉成文字的兩種方式
這個工具的作用
Speech to Text 提供兩套彼此獨立、目標相同的引擎。即時模式使用現代瀏覽器內建的 Web Speech API(SpeechRecognition 介面),在你說話的同時把文字寫到頁面上:先顯示暫定文字,停頓後再變成確定的一行。檔案上傳模式則透過 Transformers.js 載入 Whisper AI 模型,直接把你手邊的錄音轉成文字,完全不需要聆聽麥克風。
何時使用哪種模式
即時聽寫適合在不動手的情況下記下想法:會議筆記、快速草稿,或是寧可用說的備忘。文字即時出現,能在短時間的現場作業中維持節奏。
檔案上傳則更適合已經錄好的素材,例如訪談、課程、語音備忘,或影片的音軌。Whisper 模型完成第一次下載後,這個模式即使沒有連線也能繼續運作,對長錄音和重複作業都很方便。
快速操作流程
要現場使用時,從清單挑選語言,按下 Start Recording,瀏覽器詢問時允許使用麥克風;你的聲音會填入逐字稿,之後也能修改。要處理錄音時,切換到 File Upload,選擇模型——追求速度用 Tiny,追求多語準確度用 Small——再放入 MP3、WAV、MP4 之類的檔案。處理完成後,文字就能複製或下載。
支援情況與注意事項
即時辨識取決於瀏覽器:Chrome、Edge、Safari 都實作 Web Speech API,Firefox 則沒有,因此在 Firefox 建議改用 File Upload。較新的 Chrome 可以在裝置上安裝語言模型,把麥克風音訊留在本機;否則辨識會交給瀏覽器廠商的語音服務。即時清單提供 22 種語言,Whisper 則以自動偵測涵蓋超過 99 種。上傳支援常見的音訊與影片格式,上限 500MB;若是影片,先把音訊抽出來會讓處理更快、結果更好。