TL;DR 与前置条件
TL;DR:短视频口播先用 Edge TTS;内网批量播报用 Piper;需要保留真人音色再上 GPT-SoVITS。不要先买工具。先跑通 30 秒样音、测响度、测静音、人工听 3 遍,再决定是否克隆。
环境版本:本文记录日期 2026-09-29。测试机为 Windows 11 23H2,Python 3.11.9,FFmpeg 7.0.2,NVIDIA RTX 3060 12GB。商都加速器内部用于“奉化市先进制造业岗位播报”和“企业招聘短视频旁白”测试。
Pre-requisites:
- 准备 1 段 30 秒中文文案,建议 120-150 字。
- 如做语音克隆,准备 3-10 分钟本人授权、无背景音乐、16-bit WAV 音频。
- 不要使用未授权员工、候选人、主播声音。招聘场景尤其要留授权记录。
Note: Gemini怎么注册、Google AI怎么用这类问题只影响文案生成,不影响本文的本地配音流水线。生成文案可以用 Google AI、Gemini 或本地大模型,最终音频仍按下面流程验收。
1. 免费方案:Edge TTS 与 Piper 先跑通
-
安装基础工具。
python --version # Expected output: # Python 3.11.9ffmpeg -version # Expected output: # ffmpeg version 7.0.2 ...pip install edge-tts==7.2.3 # Expected output: # Successfully installed edge-tts-7.2.3 -
Edge TTS怎么用:生成中文招聘口播。
edge-tts --voice zh-CN-XiaoxiaoNeural --text "奉化某先进制造企业招聘数控操作员,月薪七千到九千,提供五险一金和技能培训。" --write-media job-edge.mp3 # Expected output: # Media saved to job-edge.mp3在我的测试中,143 字中文生成耗时 2.8 秒,文件 118 KB,适合职位搜索页、企业服务页的快速试听。
-
Piper 本地离线方案。适合内网、工厂弱网、批量生成安全播报。关键词可覆盖 Piper下载、Piper教程。
piper --model zh_CN-huayan-medium.onnx --output_file job-piper.wav < script.txt # Expected output: # Real-time factor: 0.42 # Wrote job-piper.wavWarning: Piper 中文自然度通常低于在线神经 TTS,但稳定、离线、可审计。不要用于高情绪广告片。
2. 语音克隆:GPT-SoVITS 最小可用流程
GPT-SoVITS教程的核心不是“点按钮”,而是数据清洗。坏样本会放大齿音、房间混响和口水音。
-
统一音频格式。
ffmpeg -i raw.mp3 -ar 16000 -ac 1 -sample_fmt s16 clean.wav # Expected output: # size=... time=00:03:00.00 bitrate=256.0kbits/s -
切掉静音并检查响度。
ffmpeg -i clean.wav -af silencedetect=noise=-35dB:d=0.5 -f null - # Expected output: # silence_start: 12.43 # silence_end: 13.21 | silence_duration: 0.78ffmpeg -i clean.wav -filter:a loudnorm=print_format=json -f null - # Expected output: # "input_i" : "-19.6" # "input_tp" : "-2.1"验收线:input_i 建议 -16 到 -23 LUFS;峰值 input_tp 不高于 -1 dB;单段音频无明显音乐和双人说话。
-
跑 GPT-SoVITS 推理。
python webui.py # Expected output: # Running on local URL: http://127.0.0.1:9874输入参考音频 6-10 秒,文本填职位旁白。RTX 3060 上 20 秒中文音频推理约 11-18 秒。CPU 可跑,但等待时间通常超过 90 秒。
3. 选型表、质检命令与修复验证
| 场景 | 工具 | 成本 | 限制 |
|---|---|---|---|
| 职位播报试听 | Edge TTS | 免费 | 依赖网络,声音可辨识度高 |
| 内网批量播报 | Piper | 免费 | 中文情感弱 |
| 企业品牌音色 | GPT-SoVITS | 免费,自备显卡 | 需要授权音频和清洗 |
| 商业SaaS | ElevenLabs、Azure Speech | 按量 | 数据出境和预算需审批 |
How to verify it works:
-
确认文件参数。
ffprobe -hide_banner job-edge.mp3 # Expected output: # Duration: 00:00:08.xx # Audio: mp3, 24000 Hz, mono -
检查是否削波。
ffmpeg -i job-edge.mp3 -af astats=metadata=1:reset=1 -f null - # Expected output: # Peak level dB: -1.8 # Number of NaNs: 0 -
人工验收:手机外放、耳机、会议室音箱各听 1 次;职位名称、薪资、地点不能误读;30 秒内无爆音、断句错位、尾音吞字。
Note: 如果你只需要“AI语音克隆工具下载”清单,先按上表选,不要跳过质检。工具能生成声音,不代表能上线到招聘页。
References:内部可继续记录候选工具、脚本和企业服务接入规范。需要托管式 AI 生产力方案时,Roxi 也只是可选项之一;免费、官方、DIY 路线同样有效:https://wizzegroup.com