配音交付规范
请求边界
成功渲染素材默认接受并保留原节目声音。没有明确配音、旁白、换声或独立核验请求时,不启动 TTS、ASR、音源分离、音质测量或嘴型审核。历史台词/音色品质失败原样保留,不让组件变化重配同一成功镜头。
明确需要新声音时才进入配音工位:播报短文、给点名时间窗补旁白、按已授权档案替换明确声音段。授权、租户、许可、配额和原片只读继续生效,直接接受旧镜头不能作为新声音克隆授权。
工艺口径与参数参考
| 参数 | 播报参考 | 成片配音参考 | 当前含义 |
|---|---|---|---|
| 响度目标 | -16 LUFS | -14 LUFS | 显式请求的单次归一参数,不是默认复检阈值 |
| 真峰值目标 | -1.5 dBTP | -1.0 dBTP | 请求加工参考,不默认测成片判优劣 |
| 语音轨 | 24kHz 单声道 | 按当前引擎输出混入视频 | 回执记录实际规格 |
| 气口 | 150–250ms | 按指定时窗 | 不额外修改未请求的对白 |
| 语速建议 | 0.95–1.05× | 0.9–1.15× | 用户选择与引擎支持边界 |
| 文件 | <角色>-<用途>-vN.wav | <项目>-vN-dubbed.mp4 | 新文件、旧输入只读 |
SOP(授权 → 明确生成 → 加工回执)
- 触发为明确新声音请求;核对 profile、参考音频 SHA256、声明的说话人和授权范围。回执记录档案与许可;授权不覆盖用途时失败,不能换成未知声音绕过。
- 固定文稿、语言与逐段
start/end/text,检查实际引擎支持和参数合法性。空文稿、非法时窗、缺引擎或段处理溢出明确失败;禁止自动追加未请求台词。 - 调用
voicewrite.speak或voicewrite.dub一次;请求响度归一时执行一次实际滤镜,不用质量回读触发第二遍、静默替换或重试 TTS。 - 记录实际引擎、模型、段数、采用参数、产物时长和 SHA256;核对真实输出可读与当前文件字节。源文件与参考音频保持只读。
- 默认标注
qualityReviewed=false、质量分 null,未测 LUFS、峰值、ASR 或嘴型为空。用户明确要核验时另调独立 verify,结果不回接旧源镜的后期接受。
voice-cli speak --text "欢迎来到本店" --profile zh-xiaozhi --out narration-v2.wav --lufs -16
voice-cli dub --in film.mp4 --out dubbed-v2.mp4 --profile zh-xiaozhi --text "指定旁白" --policy keep-dialogue
显式独立核验
voicewrite.verify / voice-cli verify 可按明确请求核验台词或声音。文本比对使用标准化 Unicode 码点顺序,原有 min_match_ratio 默认 0.6 属该诊断接口;缺原稿、空转写、引擎错误或超时保持未核实,不能冒充通过。仅明确无台词可声明 speech_expected=false。
显式诊断可生成 measured/failed/unverified 等证据,不默认启动,也不据此自动重新配音、删成功素材或审批后期。语气、音色和表达仍属于用户意见,技术读取不能宣称完成这些判断。
参数边界与围栏
- 新生成声音必须已有合法 profile 与用途授权,作用域不符直接失败(G-VOICE1/G-VOICE6)。
- 输入原片、参考音频与输出不能相同,禁止覆盖它们(G-VOICE2);客户声音与档案不出授权域(G-VOICE5)。
- 时窗、语言、倍率和文件路径按实际引擎合法性检查;不得以未知字段或不支持语言冒充完成。
- G-VOICE3 保留实际加工与缺件失败,不能要求默认 ASR/响度/嘴型品质复检。
- 用户要求丢弃原声必须明确授权;默认保留节目声音,不推断已分离对白。
失败模式(症状 → 原因 → 处置)
| 症状 | 原因/首查 | 处置 |
|---|---|---|
| 档案或参考不存在 | profile、参考 SHA256 与来源记录 | 指名缺件,停止新生成 |
| 授权用途不符 | consent scope、租户与说话人 | 返回授权失败,不能降级为未知外部声音 |
| 不支持语言或引擎 | 实际配置和引擎回复 | 如实说明,不伪造支持 |
| 段溢出/请求时窗非法 | 文稿长度与 start/end | 修改明确文稿/时窗后新请求,不用自动多遍 TTS |
| FFmpeg 非零或没有产物 | 实际命令、stderr、路径权限 | 保存加工错误,未完成,不抹掉原声 |
| 用户说发音/音色不合适 | 用户反馈、原文/档案 | 点名段落和参数后本地/显式新请求,不重生成画面 |
| 原片静音或音质差 | 原节目实际流 | 默认继续后期;不据此追加旁白或启用 ASR |
输出契约
产物路径、SHA256、来源和授权档案、引擎/模型、实际时间窗、处理次数及错误必须能对回真实执行。版本只增不覆盖,采用的响度滤镜与未测诊断分开记录。缺少实际产物不能说完成,未做音质核验不能说已达音质标准。