音频转文字
把任意视频或音频中的语音转换成纯文本——基于 Qwen3-ASR
语音由运行在我们服务器上的 Qwen3-ASR 转录,随后直接转换成纯文本——没有时间轴,没有字幕格式,只有文字内容。需要 SRT/VTT 字幕文件?请使用 AI 视频字幕生成。
⚠️ 处理完成前请不要关闭或刷新此页面,否则可能无法获取处理结果。
💡 上传速度取决于你自己的网络,和我们服务器无关——网络较慢时进度条走得慢属正常现象,请耐心等待,不用重试,也不会重复扣费。
ASR 引擎、语言与准确度说明
转录由服务器端的 Qwen3-ASR 完成,特性如下:
- 语言——中文和英语最强;主要欧洲语言(de/es/fr/pt/ru)、日语、韩语和印地语在发音清晰时表现良好。
- 自动标点——逗号、问号和断句由模型给出,转录稿无需后期整理即可阅读。
- 数字与日期——按检出语言规范化为书面写法。
- 暂无说话人分离——多人会议会转录成连续文本;如有需要请手动标注发言人。
单个任务支持最大 500 MB 或 2 小时的音频;典型耗时约为音频时长的十分之一。结果显示在页面上并附复制按钮,也可下载为 UTF-8 编码的 TXT。
如何使用
- 1
上传任意视频或音频文件——格式不限,由服务器负责解码。
- 2
选择语音语言,或保持自动检测。
- 3
复制转录稿,或下载为 .txt 文件。文件 30 分钟内自动删除。
- 4
直接从页面复制转录稿或下载 .txt 文件;原始音频在处理完成后即被删除。
转录稿自带标点与分段
上传录音,得到带标点、分好段的文本——而不是一堆连成一片的小写单词——支持 11 种界面语言。
Qwen3-ASR 引擎
与我们的 AI 字幕同款的语音识别在我们的服务器上运行——采访、讲座与会议音频都会转成可读的纯文本。
任意音频格式都支持
音频和视频文件都能处理,包括浏览器无法解码的封装格式——上传即可,剩下的交给服务端转码器。
语言提示或自动识别
给识别器一个语言提示可以提高准确率,也可以让它自动检测——转录结果是干净的文本,可直接复制或搜索。
常见问题
这和 AI 视频字幕生成工具有什么区别?⌄
底层都是同一套 Qwen3-ASR 转录引擎——这款工具直接输出纯文本,没有时间轴、字幕序号或字幕文件编辑器。如果你需要 SRT/VTT/ASS 字幕文件或烧录字幕,请使用 AI 视频字幕生成。
转录稿的准确率如何?⌄
准确率取决于音质、口音和背景噪音,但 Qwen3-ASR 对常见语音场景(会议、采访、播客、讲座)表现良好。噪音很大或多人抢话严重的音频仍需人工校对。
我的文件会怎样处理?⌄
上传文件和转录稿都会在 30 分钟内自动删除。任务只能用你会话签发的令牌访问。
它能识别谁说了哪句话吗?⌄
暂时不能——说话人分离已在计划之中。访谈类内容多数情况下仍能靠标点看清对话轮次,但段落不会附带说话人姓名。
相关工具
✦ 什么是音频转文字工具?
音频转文字工具把录音中的语音转换成干净、纯文本的转录稿。它由运行 AI 字幕服务所用的同一套 Qwen3-ASR 语音识别引擎驱动,输出的是不带时间轴、不带格式的易读文字——可以直接复制进笔记、搜索或粘贴到任何地方。它同样接受音频和视频文件,支持任意格式,包括浏览器无法解码的。语言提示(或自动检测)帮助识别器工作,你可以一键复制结果,也可以下载为文本文件。
这款工具能做什么
- 📝 将语音转录为纯文本、无格式文字
- 🎬 同时支持音频和视频文件,任意格式
- 🌐 可选择语言提示——自动、中文、英语、日语、韩语、西班牙语、法语、德语、葡萄牙语、俄语或印地语
- 📋 一键复制转录稿或下载为文本文件
- 🔍 产出干净、易于搜索和复用的文字
什么时候会用到
- 把采访录音变成可书写的文字笔记
- 把讲座转成可以快速浏览的学习材料
- 让会议录音事后变得可以检索
- 从视频旁白提取文字,用于字幕或文章
你的音频经加密通道上传到服务器处理,完成后自动删除。识别准确度取决于录音本身:背景噪音低、单人清晰说话的内容转写效果很好,而噪音严重、口音浓重、多人同时说话都会降低质量——输出也仅为纯文本,不含说话人标签或时间戳。想要最好的效果,请在安静的房间录制,并让一个人逐句发言。
最后更新 · 2026-09-01