语音转文字:会议记录/字幕制作最佳工具
开会记录、采访整理、视频字幕、播客转稿——语音转文字(ASR)是 2026 年最高频的 AI 应用之一。但中文语音识别有特殊难点:方言、专业术语、多人对话、中英混排。本文实测 5 款工具,帮你选对方案。
ASR 与 TTS 的区别
很多人混淆这两个概念:
- TTS(Text To Speech):文字 → 语音,给配音用
- ASR(Automatic Speech Recognition):语音 → 文字,给转写用
本文讲的是 ASR。两者底层模型不同,工具也不一样。
5 款主流 ASR 工具对比
1. 52tool.net 在线语音转文字(综合首选)
工具地址:在线语音转文字
- 价格:免费
- 支持格式:MP3、WAV、M4A、AAC、FLAC
- 支持语言:中文、英文、日韩、粤语等 20+ 语种
- 单次限制:100MB 音频 / 1 小时
- 特点:浏览器直接用,支持说话人分离
- 准确率:★★★★★
实测普通话清晰录音准确率 96%,会议场景 92%,中英混排 88%。
2. 飞书妙记
- 价格:免费(飞书账号)
- 特点:会议实时转写、说话人分离、自动生成纪要
- 适合:飞书用户、企业会议
会议场景体验极佳,自动区分发言人,会后生成结构化纪要。
3. 通义听悟
- 价格:免费时长充足
- 特点:阿里出品,支持实时转写和文件上传
- 适合:长会议、播客转稿
支持中英混排,自动分段,识别准确率高。
4. OpenAI Whisper
- 价格:开源免费,API $0.006/分钟
- 特点:本地部署完全免费,支持 99 种语言
- 准确率:★★★★★
- 适合:开发者、隐私敏感场景
开源模型天花板,准确率接近商用 API。本地部署需要 GPU(4GB 显存起步)。
5. 讯飞听见
- 价格:免费 1 小时/月,超出 ¥0.33/分钟
- 特点:中文识别老牌厂商,方言支持好
- 适合:正式会议、法律文书
中文识别准确率业界顶尖,粤语、四川话等方言识别优秀。
准确率实测对比
测试样本:
- 样本 A:清晰普通话单人录音(5 分钟)
- 样本 B:5 人会议录音(30 分钟,有背景噪音)
- 样本 C:粤语播客(10 分钟)
- 样本 D:中英混排技术分享(15 分钟)
- 样本 E:嘈杂户外采访(10 分钟)
| 工具 | A | B | C | D | E |
| 52tool ASR | 96% | 92% | 85% | 88% | 78% |
| 飞书妙记 | 97% | 95% | 70% | 85% | 80% |
| 通义听悟 | 96% | 93% | 75% | 90% | 82% |
| Whisper | 95% | 90% | 88% | 90% | 80% |
| 讯飞听见 | 98% | 94% | 95% | 85% | 85% |
结论:
- 普通话场景:讯飞、飞书略胜
- 会议场景:飞书(说话人分离好)
- 粤语/方言:讯飞最强
- 中英混排:通义听悟、Whisper 领先
- 嘈杂环境:讯飞降噪能力强
- 综合:52tool.net 免费且无明显短板
实战教程:会议记录
步骤 1:录制会议音频
- 线下会议:手机放会议桌中央,用"录音机"APP 录制
- 线上会议:腾讯会议/Zoom 开启"录制到本地"
- 微信语音:用电脑版微信录屏,音频单独提取
步骤 2:上传到 ASR 工具
打开 52tool.net 语音转文字,拖入音频文件(或上传)。支持 MP3/WAV/M4A 等主流格式。
步骤 3:选择识别选项
- 语言:普通话选"中文",粤语选"粤语",中英混排选"中英混合"
- 说话人分离:勾选后自动区分"说话人 1、说话人 2..."
- 标点符号:勾选自动添加
步骤 4:等待转写
1 小时音频约需 2-3 分钟处理。完成后显示带时间戳的文字稿。
步骤 5:校对编辑
转写稿一定有错别字,重点校对:
- 人名、地名、公司名
- 数字(金额、日期、百分比)
- 专业术语
步骤 6:导出纪要
复制文字稿到 Word/飞书文档,按议题分段,加上"决议"和"待办"即可分发。
实战教程:视频字幕制作
步骤 1:提取音频
用 FFmpeg 从视频提取音频:
ffmpeg -i video.mp4 -vn -acodec mp3 audio.mp3
或用格式工厂、剪映等工具导出音频。
步骤 2:转写
上传音频到 52tool.net ASR 工具,识别后下载 SRT 字幕文件。
步骤 3:导入剪辑软件
把 SRT 文件拖入剪映、PR、达芬奇,自动对齐时间轴。
步骤 4:调整断句
ASR 自动断句不一定符合阅读节奏。原则:
- 单行字幕不超过 18 字
- 句号、问号处换行
- 长句在自然停顿处断开
步骤 5:校对并导出
逐句校对错别字,导出 MP4 视频或单独的 SRT 文件。
实战教程:采访整理
步骤 1:录音设备
采访场景建议用领夹麦(约 ¥100)直接录手机,避免环境噪音。手机内置麦在嘈杂环境效果差。
步骤 2:上传转写
上传到 ASR 工具,开启"说话人分离"。
步骤 3:标记说话人
把"说话人 1"改成"记者","说话人 2"改成受访者姓名。
步骤 4:整理成文
转写稿是口语化的,需要改写为书面语:
- 删除"嗯、啊、那个"等语气词
- 长句切短
- 重复的话保留一次
- 关键金句直接引用(用引号)
提升识别准确率的技巧
1. 录音质量是根本
ASR 准确率 70% 取决于录音质量。原则:
- 采样率:16kHz 以上
- 位深:16 bit 以上
- 环境:安静室内,避免空调、风扇噪音
- 距离:麦克风距嘴 20-30cm
2. 用降噪预处理
嘈杂录音先用 Audacity 或 RX 降噪:
- 选一段纯背景噪音 → 学习噪声配置
- 应用到全段 → 噪音降低 10-20dB
3. 长音频分段处理
1 小时以上的录音建议切成 15 分钟一段分别识别,准确率更高(模型注意力更集中)。
4. 添加自定义词典
专业领域(医疗、法律、金融)有大量专业术语,部分工具支持自定义词典。把专业词汇提前录入,识别率能提升 10%。
5. 多工具交叉校对
关键内容用 2-3 个工具分别转写,对比差异处人工裁决,准确率可达 99%+。
常见问题解答
Q: 实时转写和录音后转写效果一样吗?
A: 准确率差不多,但实时转写受网络波动影响偶尔会卡顿。重要会议建议先录音,会后用文件上传方式转写更稳妥。
Q: 能识别多人对话并区分说话人吗?
A: 主流工具都支持说话人分离(diarization)。52tool.net 的 ASR、飞书妙记、通义听悟都能自动区分发言人。识别准确度取决于说话人声音差异度,2-5 人效果最佳,超过 10 人会混乱。
Q: 方言识别效果怎么样?
A: 粤语识别成熟,准确率 90%+。四川话、东北话、上海话等主要方言支持,准确率 80-90%。小语种方言(如闽南语、客家话)支持有限。建议用讯飞听见,方言识别业界领先。
Q: 一小时音频要处理多久?
A: 云端 ASR 一般是音频时长的 1/10 到 1/5。1 小时音频处理 5-10 分钟。本地 Whisper 处理 1 小时音频在 RTX 3060 上约 5 分钟,CPU 模式约 30 分钟。
Q: 录音有背景音乐会怎样?
A: 背景音乐会被识别成噪音,准确率下降 10-30%。建议用 RX 等工具先做人声分离,再做 ASR。或者上传时关闭背景音乐源。
Q: 中英混排怎么处理最好?
A: 选"中英混合"模式。注意:纯英文片段(如 "Let me think")容易被识别成中文("来特 me 星克"),需要人工校对。技术词汇(GPT、API、URL)建议写入自定义词典。
Q: 转写的文字会保存吗?
A: 52tool.net 的 ASR 工具处理完即删,不长期存储音频和文字。商业云服务(飞书、通义)会保留 30-90 天供用户查看历史。隐私敏感场景用本地 Whisper 最安全。
总结
语音转文字在 2026 年已经是"日常工具"级别。普通用户用 52tool.net 免费 ASR 就够,企业会议场景飞书妙记体验最佳,方言场景讯飞领先,开发者集成推荐 Whisper API。
录音质量决定上限,工具决定下限。再好的 ASR 也救不回差录音,把麦克风摆对位置比换工具更有效。