tomai
登录
☁️ 云端 · AI · 点数

音频转文字

把任意视频或音频中的语音转换成纯文本——基于 Qwen3-ASR

🪙 每次转录 5 点

语音由运行在我们服务器上的 Qwen3-ASR 转录,随后直接转换成纯文本——没有时间轴,没有字幕格式,只有文字内容。需要 SRT/VTT 字幕文件?请使用 AI 视频字幕生成。

ASR 引擎、语言与准确度说明

转录由服务器端的 Qwen3-ASR 完成,特性如下:

单个任务支持最大 500 MB 或 2 小时的音频;典型耗时约为音频时长的十分之一。结果显示在页面上并附复制按钮,也可下载为 UTF-8 编码的 TXT。

如何使用

  1. 1

    上传任意视频或音频文件——格式不限,由服务器负责解码。

  2. 2

    选择语音语言,或保持自动检测。

  3. 3

    复制转录稿,或下载为 .txt 文件。文件 30 分钟内自动删除。

  4. 4

    直接从页面复制转录稿或下载 .txt 文件;原始音频在处理完成后即被删除。

转录稿自带标点与分段

上传录音,得到带标点、分好段的文本——而不是一堆连成一片的小写单词——支持 11 种界面语言。

🎧

Qwen3-ASR 引擎

与我们的 AI 字幕同款的语音识别在我们的服务器上运行——采访、讲座与会议音频都会转成可读的纯文本。

📝

任意音频格式都支持

音频和视频文件都能处理,包括浏览器无法解码的封装格式——上传即可,剩下的交给服务端转码器。

⏱️

语言提示或自动识别

给识别器一个语言提示可以提高准确率,也可以让它自动检测——转录结果是干净的文本,可直接复制或搜索。

常见问题

这和 AI 视频字幕生成工具有什么区别?

底层都是同一套 Qwen3-ASR 转录引擎——这款工具直接输出纯文本,没有时间轴、字幕序号或字幕文件编辑器。如果你需要 SRT/VTT/ASS 字幕文件或烧录字幕,请使用 AI 视频字幕生成。

转录稿的准确率如何?

准确率取决于音质、口音和背景噪音,但 Qwen3-ASR 对常见语音场景(会议、采访、播客、讲座)表现良好。噪音很大或多人抢话严重的音频仍需人工校对。

我的文件会怎样处理?

上传文件和转录稿都会在 30 分钟内自动删除。任务只能用你会话签发的令牌访问。

它能识别谁说了哪句话吗?

暂时不能——说话人分离已在计划之中。访谈类内容多数情况下仍能靠标点看清对话轮次,但段落不会附带说话人姓名。

相关工具

✦ 什么是音频转文字工具?

音频转文字工具把录音中的语音转换成干净、纯文本的转录稿。它由运行 AI 字幕服务所用的同一套 Qwen3-ASR 语音识别引擎驱动,输出的是不带时间轴、不带格式的易读文字——可以直接复制进笔记、搜索或粘贴到任何地方。它同样接受音频和视频文件,支持任意格式,包括浏览器无法解码的。语言提示(或自动检测)帮助识别器工作,你可以一键复制结果,也可以下载为文本文件。

这款工具能做什么

  • 📝 将语音转录为纯文本、无格式文字
  • 🎬 同时支持音频和视频文件,任意格式
  • 🌐 可选择语言提示——自动、中文、英语、日语、韩语、西班牙语、法语、德语、葡萄牙语、俄语或印地语
  • 📋 一键复制转录稿或下载为文本文件
  • 🔍 产出干净、易于搜索和复用的文字

什么时候会用到

  • 把采访录音变成可书写的文字笔记
  • 把讲座转成可以快速浏览的学习材料
  • 让会议录音事后变得可以检索
  • 从视频旁白提取文字,用于字幕或文章

你的音频经加密通道上传到服务器处理,完成后自动删除。识别准确度取决于录音本身:背景噪音低、单人清晰说话的内容转写效果很好,而噪音严重、口音浓重、多人同时说话都会降低质量——输出也仅为纯文本,不含说话人标签或时间戳。想要最好的效果,请在安静的房间录制,并让一个人逐句发言。

最后更新 · 2026-09-01

相关工具