中文文字转语音:10 种语言
视频配音不想自己录音、文章想做有声版、给孩子读绘本嗓子累——文字转语音(TTS)工具解决。本文详解在线 TTS 工具。
52tool 文字转语音
工具地址:文字转语音
功能
- 10+ 语言(中文、英文、日语、韩语等)
- 男女声选择
- 语速、音调调节
- 批量合成
- 输出 MP3/WAV
- 浏览器端处理
实战 1:中文转语音
输入:
文字:欢迎来到 52tool.net,这里有 356 个免费在线工具。
语言:中文(普通话)
声音:女声
语速:1.0
音调:1.0
输出:MP3 音频文件。
实战 2:英文转语音
输入:
文字:Welcome to 52tool.net, your online tools collection.
语言:English
声音:男声
语速:0.9(稍慢)
输出:英文 MP3。
实战 3:调节语速
语速:0.5(很慢,适合学习)
语速:1.0(正常)
语速:1.5(快,适合新闻)
语速:2.0(很快,适合试听)
支持的语言
| 语言 | 男声 | 女声 | 自然度 |
| 中文(普通话) | ✓ | ✓ | 优秀 |
| 中文(粤语) | ✓ | ✓ | 良好 |
| 英语(美式) | ✓ | ✓ | 优秀 |
| 英语(英式) | ✓ | ✓ | 优秀 |
| 日语 | ✓ | ✓ | 良好 |
| 韩语 | ✓ | ✓ | 良好 |
| 法语 | ✓ | ✓ | 良好 |
| 德语 | ✓ | ✓ | 良好 |
| 西班牙语 | ✓ | ✓ | 良好 |
| 俄语 | ✓ | ✓ | 良好 |
| 阿拉伯语 | ✓ | ✓ | 中等 |
| 印度英语 | ✓ | ✓ | 良好 |
实战场景
场景 1:视频配音
YouTube/B 站视频旁白:
文字:(脚本)
语言:中文
声音:女声(专业感)
语速:0.95(稍慢,便于听清)
合成后导入视频剪辑软件。
场景 2:有声文章
公众号文章转音频:
- 复制文章全文
- 粘贴到 52tool TTS
- 选择中文女声
- 合成 MP3
- 发布到喜马拉雅等音频平台
场景 3:英语学习
英文段落跟读:
文字:The quick brown fox jumps over the lazy dog.
语言:English
声音:女声
语速:0.8(慢一点便于跟读)
反复听+模仿发音。
场景 4:儿童故事
给孩子读绘本:
文字:(故事内容)
语言:中文
声音:女声(温柔感)
语速:0.9
孩子听音频看绘本,家长省嗓子。
场景 5:产品演示
软件产品演示视频:
文字:欢迎体验我们的产品,首先点击右上角...
语言:中文
声音:男声(专业感)
语速:1.0
场景 6:广告配音
短视频广告:
文字:限时优惠!双 11 全场 5 折,错过等一年!
语言:中文
声音:男声(激昂)
语速:1.2(稍快,紧迫感)
场景 7:电话客服 IVR
电话客服菜单:
文字:欢迎致电 XX 公司。1 销售咨询,2 售后服务,3 财务问题,0 转人工。
语言:中文
声音:女声
语速:0.95
场景 8:播客开场白
播客节目开场:
文字:大家好,欢迎收听《XX 播客》第 50 期,我是主持人张三...
语言:中文
声音:男声
语速:1.0
不同场景的语速建议
| 场景 | 语速 | 说明 |
| 视频配音 | 0.9-1.0 | 稍慢便于看画面 |
| 新闻播报 | 1.0-1.1 | 标准速度 |
| 学习材料 | 0.7-0.8 | 慢便于理解 |
| 广告 | 1.1-1.2 | 快节奏感 |
| 有声书 | 0.95-1.05 | 自然节奏 |
| 客服 IVR | 0.9-0.95 | 清晰可听 |
| 儿童内容 | 0.85-0.95 | 慢便于听清 |
| 紧急通知 | 1.0-1.1 | 略快 |
不同场景的声音选择
| 场景 | 推荐声音 |
| 新闻播报 | 女声(专业) |
| 视频旁白 | 女声(亲切) |
| 广告 | 男声(激昂) |
| 教育 | 女声(耐心) |
| 客服 | 女声(柔和) |
| 播客 | 男声(沉稳) |
| 儿童内容 | 女声(温柔) |
| 体育解说 | 男声(激情) |
| 纪录片 | 男声(沉稳) |
| 游戏配音 | 看角色 |
TTS 技术原理
拼接法(旧)
录制大量语音片段,按文字拼接:
- 优点:声音自然
- 缺点:录制成本高,灵活性低
参数合成法(中)
用参数模型生成语音:
- 优点:灵活
- 缺点:声音机械感
神经网络法(新)
用深度学习模型生成语音:
- 优点:自然度极高
- 缺点:计算成本高
现代 TTS 多用神经网络法。
主流 TTS 引擎
- Google TTS
- Amazon Polly
- Microsoft Azure TTS
- 百度语音
- 阿里云语音
- 腾讯云语音
- IBM Watson TTS
编程实现
JavaScript(浏览器端 Web Speech API)
function speak(text, lang = 'zh-CN') {
const utterance = new SpeechSynthesisUtterance(text);
utterance.lang = lang;
utterance.rate = 1.0; // 语速
utterance.pitch = 1.0; // 音调
utterance.volume = 1.0; // 音量
// 选择声音
const voices = speechSynthesis.getVoices();
const voice = voices.find(v => v.lang === lang);
if (voice) utterance.voice = voice;
speechSynthesis.speak(utterance);
}
speak('欢迎来到 52tool.net', 'zh-CN');
Python(百度 TTS)
# pip install baidu-aip
from aip import AipSpeech
APP_ID = 'your_app_id'
API_KEY = 'your_api_key'
SECRET_KEY = 'your_secret_key'
client = AipSpeech(APP_ID, API_KEY, SECRET_KEY)
result = client.synthesis('你好世界', 'zh', 1, {
'vol': 5,
'spd': 4,
'pit': 5,
'per': 4 # 发音人
})
with open('output.mp3', 'wb') as f:
f.write(result['audio'])
Python(gTTS,免费)
# pip install gtts
from gtts import gTTS
tts = gTTS('Hello world', lang='en')
tts.save('output.mp3')
命令行(edge-tts)
# pip install edge-tts
edge-tts --voice zh-CN-XiaoxiaoNeural --text "你好世界" --write-media output.mp3
进阶技巧
技巧 1:分段合成
长文章一次合成可能超时。分段:
text = "长文章..."
paragraphs = text.split('\n')
for i, para in enumerate(paragraphs):
tts = gTTS(para, lang='zh-CN')
tts.save(f'part_{i}.mp3')
# 用 ffmpeg 合并
# ffmpeg -i "concat:part_0.mp3|part_1.mp3|..." -acodec copy output.mp3
技巧 2:调整断句
TTS 自动断句可能不准。用标点控制:
原文:欢迎来到 52tool.net,这里有 356 个工具。
调整为:欢迎来到 52tool.net。
这里有 356 个工具。
强制断句:用句号。
技巧 3:多角色配音
对话场景用不同声音:
旁白:男声
张三:女声(年轻)
李四:女声(成熟)
需要分别合成再剪辑。
技巧 4:情感语调
部分 TTS 支持情感标记:
[happy]太好了![/happy]
[sad]真遗憾[/sad]
效果取决于引擎支持。
技巧 5:背景音乐混合
配音 + 背景音乐 → 混合
用 Audacity 等音频编辑软件。
与其他工具配合
TTS + 文字转语音
工具:文字转语音
主要工具。
TTS + 语音转文字
工具:语音转文字
反向操作:音频转文字。
TTS + 文档
工具:在线文档
文档转音频版。
TTS + 视频剪辑
工具:[视频剪辑软件]
合成音频导入视频。
常见问题
Q: 合成的语音有机械感?
A: 1) 用神经网络 TTS(如 Azure、edge-tts);2) 调整语速到 0.95-1.05;3) 加标点符号控制断句;4) 重要内容用真人配音。
Q: 中文 TTS 准确吗?
A: 主流 TTS 中文准确率 95% 以上。可能出错的:1) 多音字(如"行"读 háng 还是 xíng);2) 缩写(如 "AI" 读 "A I" 还是 "人工智能");3) 数字("2026" 读 "二零二六" 还是 "两千零二十六")。
Q: 长文本合成失败?
A: 1) 分段合成(每段 < 500 字);2) 检查网络;3) 检查文字含特殊字符。
Q: 能下载 MP3 吗?
A: 52tool 支持下载 MP3。部分浏览器原生 Web Speech API 不支持下载,需用后端 TTS 服务。
Q: 商业用途能用吗?
A: 看工具协议。52tool 免费版限个人用。商业用途用付费 TTS(Azure、阿里云等)。
Q: 工具会泄露我的文字吗?
A: 52tool TTS 在浏览器端运行(基于 Web Speech API),文字不上传服务器。敏感内容可放心使用。
常见问题解答
Q: 怎么把文章转成语音?
A: 1) 打开 52tool TTS;2) 粘贴文章文字;3) 选中文女声;4) 语速 1.0;5) 合成并下载 MP3。
Q: 怎么调整语速?
A: 在 TTS 工具中设置"语速"参数。0.5 是半速,1.0 是正常,2.0 是双倍速。
Q: 怎么让 TTS 听起来自然?
A: 1) 用神经网络 TTS 引擎;2) 加合理标点(句号、逗号);3) 调整语速到 0.95-1.05;4) 避免长句拆成短句;5) 多音字用同音字替代或加拼音标注。
Q: 怎么批量合成多段文字?
A: 1) 分段合成;2) 用脚本调用 API;3) 合并 MP3。
Q: 能模仿名人声音吗?
A: 主流 TTS 不支持模仿特定人物声音。需要 voice cloning 技术(如 ElevenLabs),但涉及版权和伦理问题。
Q: 怎么给视频配音?
A: 1) 写好脚本;2) TTS 合成音频;3) 用视频剪辑软件(剪映、PR)导入视频和音频;4) 对齐时间轴;5) 导出视频。
总结
文字转语音是内容创作者的高效工具:
- 在线 TTS → 52tool 文字转语音
- 多语言 → 10+ 语言
- 多声音 → 男女声可选
- 调语速 → 0.5-2.0
记住:TTS 适合低成本快速生成,专业内容用真人配音。神经网络 TTS 已接近真人水平。