口播精剪(talk-cutting v1)
核心命题(先读):口播的价值 = 信息 × 情绪 × 信任。追求完美会摧毁信任——
剪得越"干净",越像 AI 念稿。所以本技能的判断标准不是"顺不顺",而是"剪完之后还像不像一个真人在说话"。
三条纪律:① 只删"伤理解"的东西;② 保留"像人"的东西;③ 每个删除都要能对着台账复述理由。
适用场景
- 一条长镜头口播(随手拍、想到哪儿说到哪儿)要剪成一条或多条成片;
- 素材里有大量:语气词、长停顿、卡壳、重复、跑题、口误后自纠、笑声与叹气;
- 成片需要逐字字幕(字幕跟着说话走),并且要"有人味、能信"。
输出契约
产出 talk_cut_plan(契约 schemas/talk-cut-list.schema.json,执行器 pnpm edit:talk-cut):
| 字段组 | 内容 | 用途 |
|---|
| 决策台账 | 每条:动作(保留/删除/压缩)+ 时间码 + 理由 + 人味价值(0–1) | 返修时"为什么删这句"的唯一答案 |
| 保留/删除区间 | 升序、互不重叠、并集等于整条素材 | 时间轴生成与时长核算 |
| 指标 | 语气词保留率、停顿保留率、人味信号保留数、平滑风险 | 人味护栏判定(G-TK6) |
| 拆分候选 | 低分话题块(题目/起止/理由) | 多片拆分,不硬删素材 |
| 备注 | 目标时长偏离、平滑风险告警 | 人审与后续版本 |
3. 留删决策树(阈值表,可直接执行)
| 对象 | 分级 | 处置 | 阈值 | 理由 |
|---|
| 语气词·填充(嗯/呃/啊) | 短促 | 保留 | 时长 <0.25s | 短促语气词是口语节奏 |
| 语气词·填充 | 常规 | 删除 | ≥0.25s 且不在保护窗 | 无信息填充 |
| 语气词·填充 | 连续重复 | 只留第一次 | 间隔 ≤0.25s | 连说三遍是卡壳 |
| 语气词·语篇连接(然后/其实/就是) | — | 默认保留 | 可删性 <0.5 | 删了句子会断气 |
| 停顿·换气 | <0.65s | 保留 | — | 呼吸感 |
| 停顿·思考 | 0.65–1.2s | 压缩到 0.5s | — | 留思考痕迹,去拖沓 |
| 停顿·死停 | >1.2s | 压缩到 0.4s | — | 死停掉完播 |
| 停顿·保护窗口内 | 任意 | 保留到 0.75s | 峰值/自纠前后 1.5s | 留白比剪干净更有感染力 |
| 重复·单字/卡壳 | 连续 ≥2 次 | 只留最后一次 | — | 卡壳不带信息 |
| 重复·修辞强调 | 一口气复述 | 保留全部 | 间隔 ≤0.5s | 强调是表达 |
| 重复·整句重启 | 同句重说 | 留更完整的一次 | 窗口 3.5s | 重录不带信息 |
| 口误自纠 | 错句 + 纠正 | 两者都留,压缩中间死停 | 提示词命中 | "真人在想"的证据 |
| 跑题话题块 | 块评分 <0.35 | 列为拆分候选 | 密度/峰值/完整度综合 | 拆成独立片子,不硬删 |
保护窗口优先级:自纠 > 笑点 > 情绪峰值 > 修辞强调。先圈保护窗口,再在剩余区间上删除——
人味保护永远优先于剪辑洁癖。
4. 人味配额(不是口号,是可算的下限)
| 指标 | 口径 | 默认下限 | 说明 |
|---|
| 语气词保留率 | 保留数 / 检出总数 | ≥0.20 | 跌破说明"比真人说话还干净" |
| 停顿保留率 | 保留秒数 / 原停顿秒数 | ≥0.15 | 全剪光会失去呼吸感 |
| 保护窗内保留 | 自纠/笑点/峰值内的语气词与停顿 | 100% | 优先于任何删除规则 |
| 平滑风险 | 语气词删除率 0.4 + 停顿删除率 0.3 + 语速平铺 0.2 + 跳切无遮盖 0.1 | <0.70 | ≥0.70 触发告警 |
跌破下限时:先做下限补偿(按可删性从低到高恢复语气词、恢复句间停顿);确要更紧凑,必须人审显式放行(G-TK6)。
决策原则(含阈值与失败关闭)
- 先保护后删除:自纠、笑点、情绪峰值、修辞强调先划保护窗口;保护窗内的语气词与停顿默认保留。
- 不剪断半句话:删除端点必须落在词边界或停顿两端;整句要么留要么删(残留 <25% 视为残句,硬失败)。
- 删得越干净越可疑:语气词保留率与停顿保留率跌破下限且无人审放行时拒绝出片(G-TK6)。
- 跳切必须遮盖:同机位跳切用推近(1.08–1.15)或切镜;遮盖覆盖率低于 50% 挂起复核(G-TK7)。
- 失败关闭:逐字稿精度非词级、素材指纹缺失、授权未登记——任一存在即拒绝出轴,不静默降级。
打法库(场景 → 动作序列 → 判据)
- 主线·单条精剪:读逐字稿与情绪曲线 → 圈保护窗口 → 逐项决策(语气词/停顿/重复/自纠/跑题)→ 人味下限复核 → 切段与字幕 → 出轴(判据:硬项全过 + 人味下限达标)。
- 分支·素材能拆多条:按话题块分组 → 每片子挑一个钩子句与一个落点 → 分别出轴(判据:每条片子有独立主题与峰值,互不重复用句)。
- 分支·口播很拖但信息密:优先删死停与卡壳,不动语气词与换气停顿;用推近遮盖补偿节奏(判据:信息点保留 100%、平滑风险 <0.7)。
- 分支·情绪段落(哭/笑/激动):放长单段、保留呼吸与笑声、不切碎;峰值后必须留回落(判据:峰值段平均段长 ≥ 相邻段 ×1.5)。
- 分支·返修点名单句:定位该句 → 只重跑该句涉及区间的决策与相邻段 → 时间轴走新版本(判据:改动范围可复述、旧版本保留)。
SOP(每步带触发/回执/失败路径)
- 触发(逐字稿与情绪画像完成)→ 圈保护窗口并逐项决策 → 回执:决策台账 + 保留/删除区间 + 人味指标;失败:逐字稿精度非词级或素材指纹缺失即拒绝出轴(fail-closed)。
- 触发(决策台账就绪)→ 人味下限复核与补偿 → 回执:补偿清单(恢复了哪些语气词/停顿)与最终指标;失败:仍低于下限且无人审放行即挂起,不出片。
- 触发(指标达标)→ 切段、生成时间轴与逐字字幕 → 回执:段表 + 字幕 + 跳切遮盖清单;失败:删除端点未对齐词边界或出现残句即回退重排,不带着残句出轴。
关键指标(含基准与护栏)
| 指标 | 口径 | 基准/阈值 | 类型 | 来源 |
|---|
| 语气词保留率 | 保留数 / 检出总数 | ≥0.20(低于需人审放行) | 护栏 | 剪取回执 |
| 停顿保留率 | 保留秒数 / 原停顿秒数 | ≥0.15(低于需人审放行) | 护栏 | 剪取回执 |
| 平滑风险 | 加权合成(见 §4) | <0.70 | 质量 | 剪取回执 |
| 删除端点合规率 | 落在词边界/停顿上的端点 / 全部端点 | 100% | 护栏 | 口播质检 |
| 残句率 | 保留比例 <25% 的句子 / 全部被部分删除的句子 | 0 | 护栏 | 口播质检 |
| 跳切遮盖覆盖率 | 有景别变化的跳切边界 / 全部跳切边界 | ≥50%(低于挂起复核) | 质量 | 时间轴校验 |
失败模式(症状 → 检测器 → 处置)
| 症状 | 检测器 | 处置 |
|---|
| 成片像 AI 念稿 | 平滑风险 ≥0.70 或语气词保留率 <0.20 | 触发人味下限补偿;仍不达标则挂人审(G-TK6) |
| 跳帧感明显 | 跳切遮盖覆盖率 <50% | 给跳切段加推近或改切镜,必要时插入空镜/贴纸 |
| 剪出半句话 | 残句检测(保留 <25%) | 整句保留或整句删除,不许留残句 |
| 观众觉得"没说完" | 时间轴源轨回跳或段落顺序错 | 恢复源轨单调顺序,重排后重出轴 |
| 素材里的话被改写 | 字幕与逐字稿逐字比对不一致 | 回退成逐字原文;要改写必须先取授权(G-TK1) |
| 一条片子塞进太多主题 | 章节数超上限或块评分两极分化 | 拆成多条片子,各自一个主题与峰值 |
5. 自检清单