音訊轉文字
把任意影片或音訊中的語音轉換成純文字——基於 Qwen3-ASR
語音由運行在我們伺服器上的 Qwen3-ASR 轉錄,隨後直接轉換成純文字——沒有時間軸,沒有字幕格式,只有文字內容。需要 SRT/VTT 字幕檔?請使用 AI 影片字幕生成。
⚠️ 處理完成前請不要關閉或重新整理此頁面,否則可能無法取得處理結果。
💡 上傳速度取決於你自己的網路,和我們的伺服器無關——網路較慢時進度條走得慢屬正常現象,請耐心等候,不用重試,也不會重複扣費。
ASR 引擎、支援語言與準確度說明
轉錄由伺服器端執行 Qwen3-ASR,具備以下特性:
- 語言——中英文表現最佳;主要歐洲語言(de/es/fr/pt/ru)、日文、韓文與印地文在發音清晰時同樣好用。
- 自動標點——逗號、問號與斷句由模型產生,逐字稿不需後製即可閱讀。
- 數字與日期——依偵測到的語言轉成書面寫法。
- 無說話者辨識(diarization)——多人會議會轉成連續文字;需要時請自行標註發言者。
單次任務支援最大 500 MB 或 2 小時的音訊;一般處理時間約為音訊長度的十分之一。結果直接顯示在頁面上並附複製按鈕,也能下載成 UTF-8 TXT。
如何使用
- 1
上傳任意影片或音訊檔案——格式不限,由伺服器負責解碼。
- 2
選擇語音語言,或保持自動檢測。
- 3
複製轉錄稿,或下載為 .txt 檔案。檔案 30 分鐘內自動刪除。
- 4
直接從頁面複製逐字稿,或下載 .txt 檔案;原始音訊會在處理完成後刪除。
標點分段清晰的語音逐字稿
上傳錄音,取得已加標點、已分段的文字——而不是密密麻麻、毫無標點的一大片字牆——支援 11 種介面語言。
Qwen3-ASR 引擎
與我們的 AI 字幕同款的語音辨識在我們的伺服器上執行——訪談、講座與會議音訊都會轉成可讀的純文字。
任意音訊格式都支援
音訊與影片檔案都能處理,包括瀏覽器無法解碼的封裝格式——上傳即可,剩下的交給伺服器端轉碼器。
語言提示或自動辨識
給辨識器一個語言提示可以提高準確率,也可以讓它自動偵測——轉錄結果是乾淨的文字,可直接複製或搜尋。
常見問題
這和 AI 影片字幕生成工具有什麼區別?⌄
底層都是同一套 Qwen3-ASR 轉錄引擎——這款工具直接輸出純文字,沒有時間軸、字幕序號或字幕檔編輯器。如果你需要 SRT/VTT/ASS 字幕檔或燒錄字幕,請使用 AI 影片字幕生成。
轉錄稿的準確率如何?⌄
準確率取決於音質、口音和背景噪音,但 Qwen3-ASR 對常見語音場景(會議、採訪、播客、講座)表現良好。噪音很大或多人搶話嚴重的音訊仍需人工校對。
我的檔案會怎麼處理?⌄
上傳檔案和轉錄稿都會在 30 分鐘內自動刪除。任務只能用你會話簽發的權杖存取。
它能辨識誰說了什麼嗎?⌄
目前尚未支援——說話者辨識已在規劃中。訪談內容多半仍可靠標點看出對話交替,但片段不會標上發言者姓名。
相關工具
✦ 什麼是音訊轉文字工具?
音訊轉文字工具把錄音中的語音轉換成乾淨、純文字的逐字稿。它由運行 AI 字幕服務所用的同一套 Qwen3-ASR 語音辨識引擎驅動,輸出的是不帶時間軸、不帶格式的易讀文字——可以直接複製進筆記、搜尋或貼到任何地方。它同樣接受音訊和影片檔案,支援任意格式,包括瀏覽器無法解碼的。語言提示(或自動偵測)幫助辨識器工作,你可以一鍵複製結果,也可以下載為文字檔。
這款工具能做什麼
- 📝 將語音轉錄為純文字、無格式文字
- 🎬 同時支援音訊和影片檔案,任意格式
- 🌐 可選擇語言提示——自動、中文、英語、日語、韓語、西班牙語、法語、德語、葡萄牙語、俄語或印地語
- 📋 一鍵複製逐字稿或下載為文字檔
- 🔍 產出乾淨、易於搜尋和複用的文字
什麼時候會用到
- 把訪談錄音變成可書寫的文字筆記
- 把講座轉成可以快速瀏覽的學習材料
- 讓會議錄音事後變得可以檢索
- 從影片旁白提取文字,用於字幕或文章
你的音訊經加密通道上傳到伺服器處理,完成後自動刪除。辨識準確度取決於錄音本身:背景噪音低、單人清晰說話的內容轉寫效果很好,而噪音嚴重、口音濃重、多人同時說話都會降低品質——輸出也僅為純文字,不含說話人標籤或時間戳。想要最好的效果,請在安靜的房間錄製,並讓一個人逐句發言。
最後更新 · 2026-09-01