tomai
登入
☁️ 雲端 · AI · 點數

音訊轉文字

把任意影片或音訊中的語音轉換成純文字——基於 Qwen3-ASR

🪙 每次轉錄 5 點

語音由運行在我們伺服器上的 Qwen3-ASR 轉錄,隨後直接轉換成純文字——沒有時間軸,沒有字幕格式,只有文字內容。需要 SRT/VTT 字幕檔?請使用 AI 影片字幕生成。

ASR 引擎、支援語言與準確度說明

轉錄由伺服器端執行 Qwen3-ASR,具備以下特性:

單次任務支援最大 500 MB 或 2 小時的音訊;一般處理時間約為音訊長度的十分之一。結果直接顯示在頁面上並附複製按鈕,也能下載成 UTF-8 TXT。

如何使用

  1. 1

    上傳任意影片或音訊檔案——格式不限,由伺服器負責解碼。

  2. 2

    選擇語音語言,或保持自動檢測。

  3. 3

    複製轉錄稿,或下載為 .txt 檔案。檔案 30 分鐘內自動刪除。

  4. 4

    直接從頁面複製逐字稿,或下載 .txt 檔案;原始音訊會在處理完成後刪除。

標點分段清晰的語音逐字稿

上傳錄音,取得已加標點、已分段的文字——而不是密密麻麻、毫無標點的一大片字牆——支援 11 種介面語言。

🎧

Qwen3-ASR 引擎

與我們的 AI 字幕同款的語音辨識在我們的伺服器上執行——訪談、講座與會議音訊都會轉成可讀的純文字。

📝

任意音訊格式都支援

音訊與影片檔案都能處理,包括瀏覽器無法解碼的封裝格式——上傳即可,剩下的交給伺服器端轉碼器。

⏱️

語言提示或自動辨識

給辨識器一個語言提示可以提高準確率,也可以讓它自動偵測——轉錄結果是乾淨的文字,可直接複製或搜尋。

常見問題

這和 AI 影片字幕生成工具有什麼區別?

底層都是同一套 Qwen3-ASR 轉錄引擎——這款工具直接輸出純文字,沒有時間軸、字幕序號或字幕檔編輯器。如果你需要 SRT/VTT/ASS 字幕檔或燒錄字幕,請使用 AI 影片字幕生成。

轉錄稿的準確率如何?

準確率取決於音質、口音和背景噪音,但 Qwen3-ASR 對常見語音場景(會議、採訪、播客、講座)表現良好。噪音很大或多人搶話嚴重的音訊仍需人工校對。

我的檔案會怎麼處理?

上傳檔案和轉錄稿都會在 30 分鐘內自動刪除。任務只能用你會話簽發的權杖存取。

它能辨識誰說了什麼嗎?

目前尚未支援——說話者辨識已在規劃中。訪談內容多半仍可靠標點看出對話交替,但片段不會標上發言者姓名。

相關工具

✦ 什麼是音訊轉文字工具?

音訊轉文字工具把錄音中的語音轉換成乾淨、純文字的逐字稿。它由運行 AI 字幕服務所用的同一套 Qwen3-ASR 語音辨識引擎驅動,輸出的是不帶時間軸、不帶格式的易讀文字——可以直接複製進筆記、搜尋或貼到任何地方。它同樣接受音訊和影片檔案,支援任意格式,包括瀏覽器無法解碼的。語言提示(或自動偵測)幫助辨識器工作,你可以一鍵複製結果,也可以下載為文字檔。

這款工具能做什麼

  • 📝 將語音轉錄為純文字、無格式文字
  • 🎬 同時支援音訊和影片檔案,任意格式
  • 🌐 可選擇語言提示——自動、中文、英語、日語、韓語、西班牙語、法語、德語、葡萄牙語、俄語或印地語
  • 📋 一鍵複製逐字稿或下載為文字檔
  • 🔍 產出乾淨、易於搜尋和複用的文字

什麼時候會用到

  • 把訪談錄音變成可書寫的文字筆記
  • 把講座轉成可以快速瀏覽的學習材料
  • 讓會議錄音事後變得可以檢索
  • 從影片旁白提取文字,用於字幕或文章

你的音訊經加密通道上傳到伺服器處理,完成後自動刪除。辨識準確度取決於錄音本身:背景噪音低、單人清晰說話的內容轉寫效果很好,而噪音嚴重、口音濃重、多人同時說話都會降低品質——輸出也僅為純文字,不含說話人標籤或時間戳。想要最好的效果,請在安靜的房間錄製,並讓一個人逐句發言。

最後更新 · 2026-09-01

相關工具