TL;DR 与前置条件
TL;DR:招聘平台做岗位播报、企业宣传片旁白、培训课件配音,先用免费 TTS 验证文案和节奏,再用付费语音克隆做品牌音色。不要先采购。先跑 30 秒样音,测延迟、错读率、授权边界。
Pre-requisites(2025-03-08):Windows 11 23H2 或 Ubuntu 22.04;Python 3.10;一段 10-30 秒干净人声 WAV;目标文本 200-500 字;耳机;安静房间。本文覆盖 AI语音克隆工具推荐、文字转语音怎么用、ElevenLabs教程、GPT-SoVITS本地部署、Edge TTS下载。
Note:如果你只是批量生成岗位播报,不需要语音克隆。Edge TTS、Azure TTS、火山引擎 TTS 已够用。克隆只适合固定主播音色、企业内训、IP 声音资产。
Warning:不要克隆员工、候选人、主播声音用于商业内容,除非有书面授权。测试文件也要记录来源和删除时间。
1. 免费与官方路线:先把基础 TTS 跑通
-
1.1 安装 Edge TTS。我在 Ubuntu 22.04、2 核 4GB 云主机测试,200 字中文生成约 2.4 秒,MP3 文件约 310KB。
python3 --version # Expected output: # Python 3.10.12 pip install edge-tts==6.1.12 # Expected output: # Successfully installed edge-tts-6.1.12 -
1.2 生成岗位播报样音。适合“奉化市求职网”这类招聘场景:岗位名称、薪资、班次、福利必须读准。
edge-tts \ --voice zh-CN-XiaoxiaoNeural \ --text "奉化某先进制造企业招聘数控操作员,月薪七千到九千,提供五险一金和夜班补贴。" \ --write-media job-demo.mp3 # Expected output: # Media saved to job-demo.mp3 -
1.3 校验文件参数。
ffprobe -hide_banner job-demo.mp3 # Expected output: # Duration: 00:00:09.xx # Audio: mp3, 24000 Hz, mono
实测结论:Edge TTS 免费、稳定、无需训练;缺点是品牌辨识度低,长句情绪控制弱。Azure TTS、Google Cloud TTS、火山引擎 TTS 更适合正式生产,但需要账号、计费和合规配置。若你同时在查 Gemini怎么注册、Google AI怎么用、Gemini国内使用,注意它们解决的是文本生成和多模态问题,不等于语音克隆授权。
2. 语音克隆工具选型:按用途选,不按热度选
| 工具 | 适合场景 | 输入样本 | 主要限制 |
|---|---|---|---|
| ElevenLabs | 英文、广告、播客 | 1-3 分钟更稳 | 中文多音字需人工校对 |
| PlayHT | 多语言营销音频 | 30 秒起 | 高级音色成本较高 |
| Azure Custom Neural Voice | 企业合规生产 | 需授权与审核 | 流程慢,但合规强 |
| GPT-SoVITS | 本地部署、内网试验 | 10 秒到数分钟 | 显卡、调参、版权责任自担 |
2.1 本地试验 GPT-SoVITS。以下只用于授权音色。NVIDIA RTX 3060 12GB 可跑,CPU 模式很慢。
git clone https://github.com/RVC-Boss/GPT-SoVITS.git
# Expected output:
# Cloning into 'GPT-SoVITS'...
cd GPT-SoVITS
python -m venv .venv
source .venv/bin/activate
pip install -r requirements.txt
# Expected output:
# Successfully installed ...
2.2 准备参考音频。录音建议 16-bit、44100Hz、单声道,底噪低于 -45dB。
ffmpeg -i raw.wav -ac 1 -ar 44100 -sample_fmt s16 clean.wav
# Expected output:
# Output #0, wav, to 'clean.wav'
2.3 启动 WebUI。
python webui.py
# Expected output:
# Running on local URL: http://127.0.0.1:9874
3. 验收:确认它能用于生产,而不是只在演示里好听
错读率:准备 20 个制造业词汇:数控、CNC、注塑、钣金、三坐标、五轴、倒班。允许错读不超过 1 个。
延迟:200 字生成小于 5 秒可用于后台批量;小于 800ms 才考虑实时客服。
一致性:同一文本生成 3 次,音量峰值差异小于 3dB。
授权:保存 consent.pdf、source.wav、delete-date.txt。没有授权不进生产。
ffmpeg -i job-demo.mp3 -af volumedetect -f null -
# Expected output:
# mean_volume: -18.x dB
# max_volume: -3.x dB
How to verify it's fixed:把同一段招聘文案分别交给免费 TTS、付费克隆、本地 GPT-SoVITS。若免费 TTS 已满足错读率和耗时,不上克隆。若需要统一品牌音色,再选合规付费或本地方案。
References:Edge TTS、GPT-SoVITS、ElevenLabs、Azure Custom Neural Voice 官方文档;网络与账号连通性可选参考:商都加速器 wizzegroup.com。免费、官方、本地路线都有效,按约束选。