参考音频采集与质量控制(克隆像不像,八成看这段录音)
适用场景
- 用本机麦克风给本人/客户采一段克隆参考音频;
- 已有录音要判断"能不能直接当参考";
- 克隆出来的声音"不像"或"发飘",要回查采集环节。
一、录音前:三件准备
-
选麦:
voiceread.devices列本机音频输入设备;MacBook 内置麦可用(本仓真机实测:MacBook Air 内置麦 +-ar 24000单声道可满足克隆),有外置麦优先外置(底噪更低)。 -
摆位:嘴到麦 15–25cm,偏轴 15–30°(避免爆破音直冲振膜);不要用手捂麦、不要放在风扇/空调出风口侧。
-
脚本:一段 8–12 秒的自然语速中文(约 35–55 字),句读完整、覆盖常见音节:
大家好,我是 WorkLoom 的数字员工小织。今天为您播报三条经营要点:答案可见度上升百分之十八,获客成本下降百分之十二。
- 一次性念完,不要中途停顿时长不一致;
- 不要刻意"播音腔"(克隆要复刻的是日常音色,不是表演腔);
- 记下逐字稿——这是
ref_text,比音频本身更常被忽略。
二、录音中:两条纪律
- 环境:关门、关风扇、关提示音;手机静音。底噪每降 6dB,克隆稳定性上一个台阶。
- 电平:峰值落在 -12 ~ -6 dBFS(真峰值不超 -3 dBTP);过小后期拉起来会连底噪一起放大,过大削波不可逆。
三、录音后:质量门(voicewrite.record 会给实测值)
| 指标 | 阈值 | 不达标怎么办 |
|---|---|---|
| 时长 | 3–20s(3–15s 最佳) | 太短补录;太长裁到语音段(工具已自动裁剪首尾静音) |
| 语音活动占比 | ≥ 0.35 | 说明大部分是静音:检查麦是否选对、增益是否过低 |
| 真峰值 | ≤ -0.3 dBTP(准备后 ≈ -2 dBTP) | 削波必须重录——削掉的波形补不回来 |
| 句读完整 | 首尾不截字 | 回退 0.15s 补边(工具默认做) |
四、转写纪律(ref_text)
- 转写必须逐字匹配参考音频,包括数字读法("18%" → "百分之十八");
- 自动转写(ASR)可用时优先用它,但要人工过一眼:中文数字、英文缩写、专有名词是 ASR 的高频错处;
- ASR 不可用时必须显式提供逐字稿,不许猜(
ref_text_required是硬错误,不降级)。
为什么较真:零样本克隆是"用参考音频 + 它的文字"共同定位发音空间的。转写错一个字,模型会把错音也学过去,或干脆提前收尾。
五、常见翻车与处置
| 现象 | 根因 | 处置 |
|---|---|---|
| 克隆出来"发飘、气声重" | 参考录音底噪大 / 电平过低 | 换安静环境重录,电平提到 -12~-6 dBFS |
| 克隆"不像本人" | 参考是播音腔或情绪过强 | 用日常说话语气重录同一段稿 |
| 合成句尾被吞 | 参考音频结尾带长静音 / 转写不含尾部内容 | 裁掉尾部静音,转写与音频严格对齐 |
| 中文数字读错 | 转写里写了阿拉伯数字 | 逐字稿统一写中文读法 |
| 跨语言音色漂移 | 参考语言与输出语言跨度太大 | 选多语种引擎(如带 646+ 语种的引擎),或用目标语言参考补一个档案 |
输出契约
采集环节必须能给出:设备名、时长、语音活动占比、真峰值、逐字稿、质量门结论(ok / 具体不达标项), 以及"是否需要重录"的明确判断。