EZ
EZ2Conv

음성을 텍스트로

브라우저 기반 음성 인식을 사용하여 실시간으로 음성을 텍스트로 변환합니다. 무료, 안전하며 로그인이 필요 없습니다.

Characters
0
Words
0
Sentences
0
Duration
00:00

Transcript

You can edit the text below

사용 방법

  1. [실시간] "실시간" 탭을 선택하고 언어를 선택한 후 "녹음 시작" 버튼을 클릭하세요
  2. [실시간] 마이크에 대고 명확하게 말하세요. 텍스트가 실시간으로 나타납니다
  3. [파일 업로드] "파일 업로드" 탭을 선택하고 AI 모델을 선택한 후 오디오/비디오 파일을 업로드하세요
  4. [파일 업로드] "받아쓰기" 버튼을 클릭하세요. AI 모델은 첫 사용 시 자동으로 다운로드됩니다
  5. 완료되면 사용 가능한 옵션을 사용하여 받아쓰기 결과를 편집, 복사 또는 다운로드하세요

유용한 팁

  • 실시간 모드는 Chrome, Edge 또는 Safari 브라우저가 필요합니다
  • 파일 업로드는 AI 모델 다운로드 후 오프라인에서도 작동합니다
  • 긴 파일의 경우 'Tiny' 모델이 가장 빠른 처리 속도를 제공합니다
  • 오디오가 기기에 남는 것은 파일 업로드뿐입니다. 실시간 모드는 온디바이스 인식이 가능한 경우가 아니면 브라우저의 음성 서비스로 전송합니다

음성을 텍스트로 바꾸는 두 가지 방법

이 도구가 하는 일

Speech to Text에는 같은 목적을 가진 두 개의 독립 엔진이 있습니다. 실시간 모드는 최신 브라우저에 내장된 Web Speech API(SpeechRecognition 인터페이스)를 사용해 말하는 동안 화면에 글자를 써 내려갑니다. 먼저 임시 텍스트가 보이고, 말을 멈추면 확정된 문장으로 바뀝니다. 파일 업로드 모드는 Transformers.js로 Whisper AI 모델을 불러와, 이미 가지고 있는 녹음을 마이크 없이 받아씁니다.

어떤 모드를 언제 쓰나

실시간 받아쓰기는 손을 쓰지 않고 생각을 남길 때 좋습니다. 회의 메모, 빠른 초안, 타이핑보다 말이 편한 메모 같은 경우입니다. 글자가 곧바로 나타나 짧은 실시간 작업에서 흐름을 유지하기에 알맞습니다.

파일 업로드는 이미 녹음된 자료에 더 어울립니다. 인터뷰, 강의, 음성 메모, 동영상의 오디오 트랙 등입니다. Whisper 모델의 최초 다운로드가 끝나면 이 모드는 연결이 없어도 계속 동작하므로, 긴 녹음이나 반복 작업에 편리합니다.

간단한 흐름

실시간으로 쓸 때는 목록에서 언어를 고르고 Start Recording을 누른 뒤, 브라우저가 물어보면 마이크 접근을 허용합니다. 목소리가 텍스트 영역을 채우며, 나중에 편집할 수 있습니다. 녹음을 다룰 때는 File Upload로 전환해 모델을 고릅니다. 속도를 원하면 Tiny, 다국어 정확도를 원하면 Small입니다. 그런 다음 MP3, WAV, MP4 같은 파일을 올립니다. 처리가 끝나면 텍스트를 복사하거나 내려받을 수 있습니다.

지원 범위와 유의점

실시간 인식은 브라우저에 좌우됩니다. Chrome, Edge, Safari는 Web Speech API를 구현하지만 Firefox는 그렇지 않으므로, 그 경우에는 File Upload를 쓰면 됩니다. 최신 Chrome은 언어 모델을 기기에 설치해 마이크 음성을 로컬에 둘 수 있고, 그렇지 않으면 브라우저 제조사의 음성 서비스가 인식을 처리합니다. 실시간 목록은 22개 언어를 제공하고, Whisper는 자동 감지로 99개 이상을 지원합니다. 업로드는 흔한 오디오·비디오 형식을 500MB까지 받으며, 동영상은 오디오를 먼저 추출하면 처리가 빨라지고 결과도 좋아집니다.

자주 묻는 질문

두 엔진 모두 제한 없이 쓸 수 있습니다. Web Speech API를 이용한 실시간 받아쓰기와 Whisper의 Tiny·Base·Small 모델을 이용한 파일 전사이며, 오디오든 동영상이든 길이에 상관없습니다. 분당 과금이나 결제로 잠긴 프리미엄 모델은 없습니다.
모드에 따라 다릅니다. 파일 전사는 Transformers.js로 Whisper 모델을 기기 안에서 실행하므로 녹음과 그 텍스트가 기기를 벗어나지 않습니다. 실시간 모드는 브라우저의 Web Speech API를 쓰는데, 인식을 위해 마이크 음성을 제조사 서버로 보내는 경우가 많습니다(Chrome이 기기에 모델을 설치한 경우는 예외). EZ2Conv가 여러분의 음성을 받는 일은 없습니다.
계정은 필요 없습니다. 모드를 고르고 말하거나 녹음을 올린 뒤, 텍스트를 편집·복사·다운로드하면 됩니다. 이메일이나 개인정보는 요구하지 않습니다.
실시간 모드에 필요한 Web Speech API는 Chrome, Edge, Safari가 구현합니다. Firefox에는 없습니다. 다만 File Upload 모드는 이 API에 의존하지 않고 Whisper로 전사하므로 어떤 브라우저에서도 동작합니다.
실시간 모드는 목소리를 담기 위해 마이크가 필요하고, 브라우저가 한 번 확인을 요청합니다. 거부하면 이 모드는 들을 수 없지만, 파일 업로드는 이미 있는 녹음을 읽으므로 마이크가 필요 없습니다.
실시간 목록은 Web Speech API로 22개 언어를 제공하고, 파일 모드는 Whisper로 자동 감지를 통해 99개 이상을 인식합니다. 정확도를 높이려면 녹음 전에 언어를 선택하세요.