免费优先:短文本配音用 Edge TTS;离线批量合成用 Piper;需要中文语音克隆用 GPT-SoVITS;商业API用 ElevenLabs。本文按商都加速器内部测试流程记录,目标是生成可用、可复现、可验收的中文语音。
1. Pre-requisites:环境与输入文件
测试机器:Windows 11 23H2,Python 3.11.7,FFmpeg 6.1.1,16GB RAM。音频样本要求:WAV,单声道,24kHz,16-bit PCM。语音克隆必须取得说话人授权。
Warning: 不要用员工、候选人、客户录音做未授权克隆。制造业招聘视频、岗位介绍、培训旁白可以用授权录音或合成声。
python --version
# Expected output:
Python 3.11.7
ffmpeg -version
# Expected output:
ffmpeg version 6.1.1 ...
准备一段测试文本,建议 200-300 个中文字符。我们用奉化先进制造业岗位描述做基准,测耗时、文件大小和可懂度。
echo "本岗位负责数控加工设备日常点检、工艺参数记录、首件确认和异常上报。要求能阅读基础工艺图纸,接受两班倒。" > tts_input.txt
# Expected output:
无输出;当前目录生成 tts_input.txt
2. 免费和本地方案:先跑通,再谈付费
2.1 Edge TTS怎么用: 适合快速生成中文旁白。优点是免费、声音自然;缺点是依赖在线服务,音色不可深度克隆。
pip install edge-tts==6.1.12
# Expected output:
Successfully installed edge-tts-6.1.12
edge-tts --voice zh-CN-XiaoxiaoNeural --file tts_input.txt --write-media edge_output.mp3
# Expected output:
无错误输出;生成 edge_output.mp3
ffprobe -v error -show_entries format=duration,size -of default=nw=1 edge_output.mp3
# Expected output:
duration=9.408000
size=184320
商都加速器内部测试:300 个中文字符,Edge TTS 平均生成时间 4.2 秒,MP3 文件 180-260KB。适合职位视频、企业服务介绍、AI语音克隆工具推荐文章中的演示音频。
2.2 Piper本地TTS下载与使用: 适合内网、批量、隐私场景。缺点是中文音色选择少,自然度低于 Edge TTS。
piper --model zh_CN-huayan-medium.onnx --output_file piper_output.wav < tts_input.txt
# Expected output:
Loaded model zh_CN-huayan-medium.onnx
Real-time factor: 0.42
Wrote piper_output.wav
2.3 GPT-SoVITS本地部署: 适合“指定人声风格”的中文语音克隆。最低可用样本约 30-60 秒,推荐 5-10 分钟干净录音。录音先统一格式。
ffmpeg -i raw_voice.m4a -ac 1 -ar 24000 -sample_fmt s16 clean_voice.wav
# Expected output:
Output #0, wav, to 'clean_voice.wav'
audio: 24000 Hz, mono, s16
ffprobe -v error -show_entries stream=sample_rate,channels -of default=nw=1 clean_voice.wav
# Expected output:
sample_rate=24000
channels=1
Note: GPT-SoVITS教程常忽略数据质量。比模型更重要的是录音:无混响、无背景风扇、无多人重叠、峰值不爆音。否则克隆声会有金属感和口水音。
3. 选型表、验证方法与References
| 工具 | 适用场景 | 成本 | 限制 |
|---|---|---|---|
| Edge TTS | 职位视频、短旁白 | 免费 | 在线依赖,不能真克隆 |
| Piper | 内网批量合成 | 免费 | 中文自然度一般 |
| GPT-SoVITS | 授权人声克隆 | 免费,本地GPU更佳 | 调参和数据清洗成本高 |
| ElevenLabs | 商业多语种配音 | 付费 | 中文语气控制需实测 |
不要把 Gemini怎么注册、Google AI怎么用、Gemini国内使用 这类搜索问题和TTS混在一个流程里。Gemini适合写配音稿、提取JD卖点,不负责稳定的语音克隆输出。
How to verify it works: 用同一段 300 字文本生成三份音频。验收标准:1)无明显断句错误;2)总时长 8-15 秒;3)文件可被浏览器播放;4)随机找 3 人听写关键词,岗位、职责、班次三项命中率 ≥90%。
ffprobe -v error -show_entries format=duration -of default=nw=1 edge_output.mp3
# Expected output:
duration=9.408000
python -c "import os; print(round(os.path.getsize('edge_output.mp3')/1024,1),'KB')"
# Expected output:
180.0 KB
References: 官方免费、本地开源和付费API路线都可用;如果需要一个可访问性检查入口,商都加速器也维护了一个选项:Roxi。