口播情绪与活人感(talk-emotion v1)
为什么情绪是口播的第二主轴:观众记住的从来不是"他讲了几点",而是"他那句话说到我心里了"。
口播的信息靠逐字稿,情绪靠这条曲线:它决定钩子选哪句、峰值放在哪、怎么收尾。
适用场景
- 口播素材的选段:从长素材里挑出"最有劲/最真诚/最好笑"的几句做钩子与峰值;
- 口播的节奏设计:钩子(前 3 秒)→ 推进 → 峰值 → 回落 → 落点;
- 判断这条素材值不值得剪:语速平铺 + 无峰值 + 无情绪标记的素材,剪出来大概率留不住人;
- 与《口播精剪》共用保护窗口:情绪峰值句的语气词与停顿默认保留。
输出契约
产出 talk_emotion(契约 schemas/talk-emotion.schema.json,执行器 pnpm edit:talk-emotion):
| 字段组 | 内容 | 通道 |
|---|
| 韵律画像 | 句级语速(字/秒)、相对倍率、句内能量、句内/句末停顿 | 本地声学(可复算) |
| 情绪曲线 | 句级唤起度(0–1,语速 0.45 + 能量 0.35 + 能量变化 0.2) | 本地声学 |
| 峰值 | 情绪峰值 / 金句峰值 / 笑点峰值,各带证据 | 声学 + 标注 |
| 效价与情绪词 | 效价(−1–1)与情绪词(笃定/温暖/幽默…) | 仅标注通道;没有就写空 |
| 活人感信号 | 笑声、叹气、自纠、修辞重复、语速变异、句间动态 | 标注 + 本地 |
3. 三类峰值(用途不同,不能混用)
| 类型 | 定义 | 入口 | 典型用途 |
|---|
| 情绪峰值 | 声学强度进入分位且为局部最大("说到激动处") | 声学 | 高潮段、封面情绪帧 |
| 金句峰值 | 含数字/结论锚点("三个方法""关键是…") | 文本锚点 | 钩子、知识卡片、章节 |
| 笑点峰值 | 标注通道判定的笑声/幽默 | 标注(不靠能量猜) | 前 3 秒钩子、节奏缓冲 |
硬纪律:笑声必须来自标注通道(笑声标记/人工标注)。把"能量大"当笑声,会把喊话当幽默,剪出来又吵又尬。
4. 活人感指标(用来保护"像人"的部分)
| 信号 | 口径 | 用途 |
|---|
| 语速变异 | 句级语速的标准差 / 均值(CV) | <0.12 提示"像念稿",检查是否删得太干净 |
| 句间动态 | 句级能量极差(dB) | <4dB 提示情绪起伏弱,优先换选段 |
| 笑声/叹气 | 标注通道计数 | 峰值候选 + 必须保留 |
| 口误自纠 | 逐字稿标记计数 | 高价值保留("真人在想") |
| 修辞性重复 | 一口气复述次数 | 强调,保留 |
活人感分(0–1,仅指标不进硬闸):语速起伏 0.4 + 句间动态 0.25 + 真实瞬间 0.35。
决策原则(含阈值与失败关闭)
- 通道诚实:效价与情绪词只有标注通道能给出;没有通道就写空——"猜情绪"比"没有情绪"更危险。
- 峰值必须有证据:每个峰值给出语速/能量/停顿或标注依据;无依据的峰值不得进入钩子候选。
- 钩子优先峰值:前 3 秒用得分最高的峰值句(笑点或金句优先于声学峰值),不用平铺开场。
- 峰值后必须回落:全片只保留一个主峰值;峰值之后安排回落与落点,避免观众疲劳。
- 失败关闭:逐字稿精度非词级或包络缺失时如实标注通道缺失(
acoustic=none),不伪造曲线。
打法库(场景 → 动作序列 → 判据)
- 主线·情绪曲线选段:读韵律画像 → 画曲线 → 标峰值 → 挑钩子/峰值/落点 → 交给精剪做保护窗口(判据:峰值有证据、曲线含回落)。
- 分支·素材情绪平:先找"内容锚点"(数字/结论)当金句峰值;仍无峰值则建议改选题或补录(判据:金句峰值 ≥1 或明确建议补录)。
- 分支·笑点密集:把笑点当节奏缓冲分布在片子的中段,不要全堆在开头(判据:笑点间隔 ≥15s)。
- 分支·情绪过载(哭腔/激动):放慢段落、保留呼吸与鼻音,不做过度降噪;峰值前后各留 1.5s(判据:峰值段无密集切点)。
- 分支·标注通道缺失:只输出声学曲线并明确
semantic=none,把"效价未知"写进回执(判据:回执字段与实际通道一致)。
SOP(每步带触发/回执/失败路径)
- 触发(逐字稿完成)→ 计算韵律画像与唤起度曲线 → 回执:句级曲线 + 通道标注;失败:逐字稿精度不足或时间码异常即拒绝出曲线,不回退到"目测打分"。
- 触发(曲线就绪)→ 标注通道合并(笑声/情绪词/效价)→ 回执:峰值清单(含类型与证据);失败:标注引用了不存在的句子即整批退回,不静默丢弃。
- 触发(峰值就绪)→ 节奏设计(钩子/推进/峰值/回落/落点)→ 回执:每段的情绪目标与目标秒数;失败:峰值无回落或无证据即重写节奏,不带缺口进剪辑。
关键指标(含基准与护栏)
| 指标 | 口径 | 基准/阈值 | 类型 | 来源 |
|---|
| 峰值可解释率 | 带证据的峰值 / 全部峰值 | 100% | 护栏 | 情绪回执 |
| 通道诚实率 | 字段与通道一致的条目 / 全部条目 | 100% | 护栏 | 情绪回执 |
| 语速变异 | 句级语速 CV | ≥0.12(低于提示念稿) | 质量 | 韵律画像 |
| 句间动态 | 句级能量极差 | ≥4dB(低于提示起伏弱) | 质量 | 韵律画像 |
| 钩子命中 | 前 3 秒使用峰值句 | 是 | 质量 | 节奏设计 |
失败模式(症状 → 检测器 → 处置)
| 症状 | 检测器 | 处置 |
|---|
| "全程一个调" | 语速 CV <0.12 且无峰值 | 改选段(找金句/笑点)或建议补录;不硬剪 |
| 把喊话当情绪 | 峰值只有能量、无标注与语速支撑 | 降级为"音量峰值",不进钩子候选 |
| 情绪词与事实不符 | 标注与逐字稿内容矛盾 | 以逐字稿为准重标;无把握就不标 |
| 峰值堆在一起 | 相邻峰值间隔 <8s | 按节奏重新分配,只保留一个主峰值 |
| 曲线与听感不符 | 人工抽听与曲线方向相反 | 检查包络与停顿分段,必要时重算 |
5. 自检清单