오디오를 텍스트로
어떤 영상이나 오디오 파일이든 말소리를 순수 텍스트로 전사 — Qwen3-ASR 기반
음성은 자체 서버에서 실행되는 Qwen3-ASR로 전사된 뒤 곧바로 순수 텍스트로 변환됩니다 — 타임스탬프도, 자막 서식도 없이 오직 텍스트만 남습니다. 대신 SRT/VTT 자막이 필요하신가요? AI 동영상 자막 생성기를 이용하세요.
⚠️ 완료될 때까지 이 페이지를 닫거나 새로고침하지 마세요. 결과가 사라질 수 있습니다.
💡 업로드 속도는 서버가 아니라 사용자의 네트워크 환경에 따라 달라집니다 — 연결이 느리면 진행률 표시줄이 천천히 움직일 뿐입니다. 계속 진행되니 다시 시도하거나 이중 결제를 걱정하지 않으셔도 됩니다.
ASR 엔진, 지원 언어, 정확도 참고 사항
전사는 워커에서 Qwen3-ASR로 실행되며 다음과 같은 특성이 있습니다:
- 언어 — 중국어와 영어가 가장 정확하고, 주요 유럽 언어(de/es/fr/pt/ru), 일본어, 한국어, 힌디어는 명확한 발화에서 잘 작동합니다.
- 자동 문장부호 — 쉼표, 물음표, 문장 나누기가 모델에서 나오므로 후편집 없이도 전사문을 읽을 수 있습니다.
- 숫자와 날짜 — 감지된 언어의 표기 형태로 정규화됩니다.
- 화자 분리 없음 — 여러 명이 말하는 회의는 연속된 텍스트로 전사되며, 필요하면 화자를 수동으로 표기하세요.
작업당 오디오는 최대 500 MB 또는 2시간까지이며, 처리 시간은 보통 재생 시간의 10분의 1 정도입니다. 결과는 복사 버튼과 함께 페이지에 표시되고 UTF-8 TXT로 내려받을 수 있습니다.
이용 방법
- 1
동영상이나 오디오 파일을 업로드하세요 — 형식은 상관없이 서버가 디코딩합니다.
- 2
말하는 언어를 고르거나 자동 감지로 두세요.
- 3
전사본을 복사하거나 .txt 파일로 다운로드하세요. 파일은 30분 안에 자동 삭제됩니다.
- 4
전사문을 페이지에서 복사하거나 .txt 파일로 내려받으세요. 원본 오디오는 처리 후 삭제됩니다.
발화 교체까지 알아채는 문장부호의 전사문
녹음 파일을 올리면 문장부호와 단락이 갖춰진 텍스트 — 소문자 단어의 벽이 아니라 — 를 11개 인터페이스 언어 중 하나로 받습니다.
Qwen3-ASR 엔진
AI 자막에 사용되는 것과 동일한 음성 인식이 서버에서 실행됩니다 — 인터뷰, 강의, 회의가 읽기 좋은 일반 텍스트로 돌아옵니다.
모든 형식 허용
브라우저가 디코딩할 수 없는 컨테이너 형식까지 오디오와 비디오 파일 모두 처리합니다 — 업로드하면 나머지는 서버의 트랜스코더가 맡습니다.
언어 힌트 또는 자동
정확도를 높이려면 인식기에 언어 힌트를 주고, 자동 감지를 원하면 그대로 두세요 — 전사 결과는 깨끗한 텍스트로 복사나 검색에 바로 쓸 수 있습니다.
자주 묻는 질문
AI 자막 생성 도구와 어떻게 다른가요?⌄
내부적으로는 같은 Qwen3-ASR 전사 엔진을 사용합니다 — 이 도구는 타임스탬프, 큐 번호, 자막 파일 편집기 없이 바로 순수 텍스트로 건너뜁니다. SRT/VTT/ASS 자막 파일이나 자막이 구워진 영상이 필요하다면 AI 동영상 자막 생성기를 이용하세요.
전사본은 얼마나 정확한가요?⌄
정확도는 음질, 억양, 배경 소음에 따라 달라지지만, Qwen3-ASR는 일반적인 말소리(회의, 인터뷰, 팟캐스트, 강의)를 잘 처리합니다. 소음이 매우 심하거나 여러 사람이 심하게 겹쳐 말하는 경우에는 여전히 직접 검토가 필요합니다.
제 파일은 어떻게 되나요?⌄
업로드한 파일과 전사본은 30분 안에 자동으로 삭제됩니다. 작업은 세션의 서명된 토큰으로만 접근할 수 있습니다.
누가 무엇을 말했는지 구분해 주나요?⌄
아직은 아닙니다 — 화자 분리(diarization)가 로드맵에 있습니다. 인터뷰라면 문장부호 덕분에 대부분 발화가 바뀌는 지점이 보이지만, 화자 이름이 구간에 붙지는 않습니다.
관련 도구
✦ 오디오를 텍스트로 변환하는 도구란 무엇인가요?
오디오를 텍스트로 변환하는 도구는 녹음 속 음성을 깔끔한 일반 텍스트 받아쓰기로 바꿔 줍니다. AI 자막 서비스와 동일한 Qwen3-ASR 음성 인식 엔진으로 구동되며, 타임스탬프나 서식 없는 읽기 좋은 텍스트를 돌려줍니다. 메모에 복사하고, 검색하고, 어디든 붙여 넣을 수 있는 상태입니다. 오디오 파일과 동영상 파일 모두 받으며 브라우저가 디코딩할 수 없는 형식을 포함한 모든 형식을 지원합니다. 언어 힌트(자동 감지 포함)가 인식기를 도와주고, 결과는 한 번의 클릭으로 복사하거나 텍스트 파일로 다운로드할 수 있습니다.
이 도구로 할 수 있는 일
- 📝 음성을 일반 텍스트, 서식 없는 글로 받아쓰기
- 🎬 오디오와 동영상 파일 모두, 모든 형식 지원
- 🌐 언어 힌트 선택 — 자동, 중국어, 영어, 일본어, 한국어, 스페인어, 프랑스어, 독일어, 포르투갈어, 러시아어, 힌디어
- 📋 클릭 한 번으로 필사본 복사 또는 텍스트 파일 다운로드
- 🔍 검색하고 재사용하기 쉬운 깨끗한 텍스트 생성
이런 경우에 유용합니다
- 인터뷰 녹음을 글로 된 메모로 바꾸기
- 강의를 훑어볼 수 있는 학습 자료로 변환하기
- 회의 녹음을 나중에 검색 가능하게 만들기
- 동영상 나레이션에서 텍스트를 얻어 자막이나 기사에 활용하기
오디오는 암호화된 연결을 통해 서버로 전송되어 30분 이내에 자동 삭제됩니다. 정확도는 녹음에 달려 있습니다. 배경 소음이 적고 한 사람이 또렷하게 말하는 내용은 잘 받아써지지만, 심한 노이즈, 강한 억양, 겹치는 발화는 품질을 떨어뜨립니다. 출력은 일반 텍스트뿐이며 화자 라벨이나 타임스탬프가 없습니다. 가장 좋은 결과를 얻으려면 조용한 방에서 녹음하고 한 번에 한 사람씩 말하게 하세요.
마지막 업데이트 · 2026-09-01