Communitygithub.com

geniusdapeng-collab/WorkLoom-video-edit

高光与关键帧挖掘官方套件(v2):用多信号加权 + 缺陷惩罚的可解释模型,从长素材中定位真正值钱的区间与三类关键帧(情绪峰值/动作峰值/构图最优),并对齐语音气口与音乐节拍。含评分公式、场景权重档案、去重规则与复核清单。

WorkLoom-video-edit とは?

WorkLoom-video-edit is a Claude Code agent skill that 高光与关键帧挖掘官方套件(v2):用多信号加权 + 缺陷惩罚的可解释模型,从长素材中定位真正值钱的区间与三类关键帧(情绪峰值/动作峰值/构图最优),并对齐语音气口与音乐节拍。含评分公式、场景权重档案、去重规则与复核清单。.

対応~Claude Code~Codex CLI~Cursor
npx skills add https://github.com/geniusdapeng-collab/WorkLoom-video-edit/tree/HEAD/bundles/video-edit/skills/highlight-mining

お気に入りのAIに質問する

このエージェントスキルを事前に読み込んだ状態で新しいチャットを開きます。

ドキュメント

高光与关键帧挖掘(highlight-mining v2)

1. 定位

高光不是"模型觉得好看",而是可解释的多信号结论:每一个高光条目都要能回答"为什么是这几秒"。 本技能产出 highlight_pick[] 与 keyframe_candidate[],是剪辑脚本选镜的第一优先级素材池。

2. 信号层(确定性,免费,可复现)

信号计算口径归一化说明
语音强调词级音量 × 基频变化 × 语速变化(相对该说话人基线的 z-score)0–1重音、情绪上扬、强调句
音频能量短时能量包络(20ms 窗 / 200ms 跳步)在该镜内的峰值分位0–1掌声、笑声、音乐高潮、撞击声
运动强度光流幅度均值(镜头内分位)0–1动作峰值;过高转惩罚而非加分
人脸与表情人脸框面积占比 + 表情强度分类分0–1有人脸的近景更值钱
视觉显著性中心区对比/色彩饱和度相对值 + 主体占比0–1画面"抓眼"程度
语义价值多模态模型给的"信息/情绪价值"分(0–1)0–1唯一需要模型的信号
稀缺性同片内该画面特征的逆频率(越独特越高)0–1防止同一道菜/同一个动作反复出现

惩罚项(单列,不混入正向分):抖动 shake、失焦 blur、遮挡 occlusion、重复 repetition。

3. 评分公式(可复现)

base   = w_speech·speechEmphasis + w_audio·audioEnergy + w_motion·motion
       + w_face·faceExpression + w_salience·visualSalience + w_semantic·semanticValue
       + w_novelty·novelty
score  = clamp(base − (0.5·shake + 0.6·blur + 0.4·occlusion + 0.7·repetition), 0, 1)

场景权重档案(weights.profile)

profilespeechaudiomotionfacesaliencesemanticnovelty适用
knowledge0.300.050.050.050.150.300.10知识/科普/教学
travel0.100.150.150.100.250.100.15旅行/Vlog
review0.250.100.100.150.150.200.05产品评测
drama0.200.150.150.300.100.050.05剧情/情绪
talking0.350.050.050.250.050.200.05口播/访谈

权重是默认美学基线,可按项目覆盖;覆盖必须写入回执(谁改的、为什么),因为它们直接影响选镜结果。

4. 三类关键帧(各司其职,不混用)

类型定义选择规则典型用途
情绪峰值帧 emotion_peak情绪/表情张力最大的那一帧表情强度分位 ≥0.9 且该帧清晰度 ≥0.6,且不处于眨眼/张嘴过渡帧封面、情绪点、字幕锚点
动作峰值帧 action_peak动作完成或运动最大的那一帧光流峰值且前后各 3 帧无不稳定;优先"动作落点"(手势结束/物品放稳)转场、卡点、定格
构图最优帧 composition_best单看最好看的一帧稳定 ≥0.8、主体清晰、画面安全边距(标题/字幕区无遮挡)、三分或中心构图封面底图、缩略图、静态展示

封面候选规则:优先 composition_best,若账号是人物向则优先 emotion_peak(人脸占比 ≥8% 且不遮挡);两者都缺时明确报"无合格封面帧",不用次优模糊帧凑数。

5. 切点对齐规则(高光"能剪"才算高光)

  1. 语音气口对齐:区间端点必须先贴近句末停顿(≥120ms 静音);落在句子中间的音节一律外扩到词边界。
  2. 节拍对齐:若该片有 BGM 节拍网格,端点优先吸附到最近节拍(±80ms 内),供卡点剪辑使用。
  3. 镜头边界对齐:区间必须完整落在某个镜头内;跨镜头的高光要拆成两条(便于分别选择与转场)。
  4. 安全边距:情绪峰值取帧时刻避开首末 0.3s(进场/出场不稳),除非该镜时长 <1s。

6. 去重与多样性

  • 相似度判据:画面直方图距离 + 语义标签重合度 + 时间邻近度(同镜内 <1.5s 视为同一候选)。
  • 同一"事件"(同一动作的同一次完成)只保留分数最高的一条;被合并的候选写入 repetition 惩罚说明。
  • 一组高光内至少覆盖 2 种 kind(例如情绪峰值 + 信息节点),避免全片都是同一类画面。

7. 输出契约

遵循 schemas/highlight-pick.schema.json 与 schemas/keyframe-candidate.schema.json:

  • 每条高光带 score 与分信号明细 signals、惩罚 penalties、权重档案、evidence[]、confidence。
  • 每个关键帧带 kind、帧级 timecode、frame、reasons[]、技术指标与 usage[]。
  • 分数低于 0.45 的候选不进入主池(可留在"备选池",供素材缺口时兜底)。

决策原则(含阈值与失败关闭)

  1. 分数必须可复算:回执里给出权重、信号值与惩罚项,复算偏差 >0.01 即视为口径不一致,重算后再输出。
  2. 质量门槛先于打分:清晰度 <0.5 或稳定度 <0.4 的候选直接出池(不允许"高分掩盖糊帧")。
  3. 端点必须能剪:高光端点落在句末停顿(≥120ms)或节拍点(±80ms)上;落不进就外扩到词边界,不许切在音节中间。
  4. 失败关闭:无合格关键帧时如实报 gaps,默认不使用次优帧(allowFallback=false)。
  5. 去重优于堆量:同镜内峰值间隔 <1.5s 视为同一事件;主池候选分数下限 0.45。

打法库(场景 → 动作序列 → 判据)

  • 主线·多信号融合:信号归一化 → 加权求和 → 扣惩罚 → 端点对齐 → 去重(判据:Top-10 人工认可率 ≥70%)。
  • 分支·人像向内容:提高 faceExpression 权重并把 emotion_peak 关键帧提到封面首选(判据:封面可用率 ≥60%)。
  • 分支·风景/空镜向:提高 visualSalience 与 novelty,动作峰值帧退居次选(判据:同片画面重复率 ≤15%)。
  • 分支·长素材(>30min):先按 20s 分段配额筛候选,再全局排序,防"开头通吃"(判据:候选时间分布覆盖全片 ≥60%)。

SOP(每步带触发/回执/失败路径)

  1. 触发(镜头理解完成)→ 读取信号表与镜头清单 → 回执:候选池(含分项信号);失败:信号缺失(如无人脸信号)时按 0 计并在回执标注,不臆造分数。
  2. 触发(候选池就绪)→ 打分与惩罚计算 → 回执:每条高光的 signals/penalties/weights/score;失败:权重档案未知或信号越界即报错,不静默钳制。
  3. 触发(打分完成)→ 关键帧选择与去重 → 回执:三类关键帧 + gaps + 合并记录;失败:门槛未过时输出缺口清单交人审,不用次优帧凑数。

关键指标(含基准与护栏)

指标口径基准/阈值类型来源
高光认可率人审认可的高光 / Top-10≥70%质量人工抽检
关键帧可用率可用关键帧 / 三类应有帧数≥60%质量人工抽检 + 技术门槛
端点合规率落在停顿/节拍/镜头边界内的端点 / 全部端点100%护栏对齐校验器
重复候选率被判重复合并的候选 / 总候选≤10%质量去重回执
复算一致率复算分数一致的条目 / 抽查条目100%护栏复算脚本

失败模式(症状 → 检测器 → 处置)

症状检测器处置
高光全是开头 10 秒候选时间分布统计按时长分段配额,并提高 novelty 权重
选出的"高光"是抖动片段清晰度/稳定度门槛未过加 shake 惩罚;清晰度 <0.5 直接出池
封面帧全是糊的composition_best 门槛未生效强制清晰度 ≥0.7、稳定 ≥0.8,否则报缺口
两条高光其实是同一动作去重阈值过松收紧时间邻近度(同镜 <1.5s 合并)+ 提高重复惩罚
模型给分全在 0.9 以上打分未校准用同片分位标定替代绝对值,并在回执记录标定方式

8. 自检清单

  • 每个高光端点都落在镜头边界内且贴近语音气口或节拍点
  • 分数可复算:用回执里的权重与信号值能算出同一个 score
  • 惩罚项与正向分分列,未被"平均掉"
  • 三类关键帧都有候选(或明确说明该类无合格帧及原因)
  • 无重复事件;同事件只保留最高分
  • 每条都带证据帧与置信度(G-ED4)

Individual skills in this repo

This repo contains 20 individual skills — each has its own dedicated page.

geniusdapeng-collab/WorkLoom-video-edit

配乐交付规范官方套件:原节目默认来源、显式独立分轨授权、单次实际混音、曲目许可与字节证据,完整平台/电平/选段工艺参数和用户返修归因。成功源镜不经声音品质复检,不按余量/可闻度/卡点分数自动重试或降级;绑定 G-BGM0..G-BGM5,卸载即撤销。

geniusdapeng-collab/WorkLoom-video-edit

曲库与许可合规官方套件(随 bundles/ai-video 分发):无版权曲库怎么接、许可白名单与商用红线、TASL 署名怎么出、AI 生成音乐的许可陷阱(MusicGen 权重 CC-BY-NC)、自算作曲为什么是默认路径。安装后被 BGM 配乐师调用;绑定围栏 G-BGM0..G-BGM5,卸载即撤销。

geniusdapeng-collab/WorkLoom-video-edit

配乐定调官方套件(随 bundles/ai-video 分发):题材×场景×情绪→调式/调性/BPM/和弦/配器/结构的选型法,含 32 个题材配方(16 既有 + T-15 新增 16)、速度决策(配方 BPM vs 剪辑点反推)、禁忌清单与"允许不配"。安装后被 BGM 配乐师调用;绑定围栏 G-BGM0..G-BGM5,卸载即撤销。

geniusdapeng-collab/WorkLoom-video-edit

人声分离纪律官方套件(随 bundles/ai-video 分发):什么时候真需要分轨、两档引擎链(demucs/audio-separator → ffmpeg 中心声道近似)、质量等级与诚实标注、单声道与失败处理、与 UVR/Spleeter 的关系。安装后被 BGM 配乐师调用;绑定围栏 G-BGM0..G-BGM5,卸载即撤销。

geniusdapeng-collab/WorkLoom-video-edit

SRT/ASS、字体解析、实际烧录与文字扩展轨的完整执行纪律;默认一次处理、原片原声保持,核对时间轴和真实产物,不抽帧评审可现度或循环选优;遵守 G-SUB 围栏的原片、字体、权限和执行回执约束。

geniusdapeng-collab/WorkLoom-video-edit

摄影知识库调用技能(随 bundles/ai-video 分发):19 篇九章式摄影知识(光学/景别/运镜/光线/色彩/材质/天气/风格/情绪),每篇第六章是「意图→提示词」核心调用区。用于写镜头提示词前定光圈/焦距/景别/光位/色调/材质,把参数意图翻译成画面语言。绑定制片与摄影指导岗位及围栏 G-KB0–G-KB4;卸载即撤销。

geniusdapeng-collab/WorkLoom-video-edit

调色交付规范官方套件:Rec.709 本地加工、平台派生、滤镜和来源证据、真实产物哈希、版本回滚与用户反馈归因。成功渲染素材默认接受,保留完整参数与工艺参考,未测画面品质如实为空,实际缺件、授权或加工失败保持阻断;绑定 G-COL0..G-COL4,卸载即撤销。

geniusdapeng-collab/WorkLoom-video-edit

调色执行纪律官方套件(随 bundles/ai-video 分发):规格读取、明确校正与风格配方、单次请求加工、多镜参考匹配、来源和输出字节留痕,保留目标值与 profile 工艺知识。成功源镜默认接受,独立诊断不接入品质否决或自动重做;绑定 G-COL0..G-COL4,卸载即撤销。

geniusdapeng-collab/WorkLoom-video-edit

题材、场景、情绪与平台到单次调色配方的选型方法;保留题材表、参数建议、操作流程与失败诊断,成功渲染素材默认进入后期,不以画面评分复核或重做。

geniusdapeng-collab/WorkLoom-video-edit

多镜色彩一致性官方套件:指定参考镜、逐镜派生曝光和色度校正、完整批次结果、原片只读与当前字节证据。保留参考选择与诊断残差的工艺知识,成功源镜默认接受,成片不以残差、肤色或主观跳变自动拒绝重做;绑定 G-COL0..G-COL4,卸载即撤销。

geniusdapeng-collab/WorkLoom-video-edit

评论三级分流 SOP 官方套件(随 bundles/ai-video 分发,F8.1 官方套件级):评论采集→意图分类→三级分流(夸赞 auto/咨询 review/负面 review+告警/敏感 block)、投诉维权关键词必审+告警、外发回执落账。安装后被评论区运营调用;绑定围栏 G10,卸载即撤销(F8.2/L8.3)。

geniusdapeng-collab/WorkLoom-video-edit

封面设计官方套件:按明确标题、主视觉镜号/时刻、平台与账号字体色板一次本地合成,保留字号、安全区、人物布局和标题工艺知识。成功源镜默认接受,不调用模型选帧或整图质量评审,不做 PSNR/墨迹投票自动重做;实际来源、字体、请求和产物失败明确,绑定 G-MAT1/G-SUB3。

geniusdapeng-collab/WorkLoom-video-edit

封面设计知识库(cover-kb)调用技能。为封面设计师岗位提供「平台规范 / 账号定位 / 题材映射 / 钩子公式 / 构图工艺」的结构化检索与注入纪律(14 篇九章式,确定性检索,无向量库)。绑定围栏 G-SUB2/G-SUB3/G-MAT1;卸载即撤销封面 know-how 注入能力。

geniusdapeng-collab/WorkLoom-video-edit

母版、旁挂字幕、软轨、封面、变体、工程与清单的完整交付纪律;含产物表、变体设计、执行参数、来源哈希与逐层失败 SOP。按声明配方实际执行,保留来源与真实错误,不以差异评分、声音质量或默认增强模型再次拒收素材;绑定 G-DLV0..G-DLV9,供后期交付与封面岗位调用。

geniusdapeng-collab/WorkLoom-video-edit

返修闭环官方套件:反馈归因、层影响分析、基础工程版本/SHA 前置条件、独占版本认领、本地增量重合成与复用证据。保留完整反馈表、并发冲突和存储失败 SOP;成功镜头默认接受,组件或旧品质失败不重新生成,点名新生成保持 G8/G-DLV5,绑定 G-DLV4..G-DLV7。

geniusdapeng-collab/WorkLoom-video-edit

导演评审官方套件(随 bundles/ai-video 分发,F8.1 官方套件级):6 问评审 + 5 维评分 + 硬阻断打回、事实红线一票否决、跨集连贯性校验,含硬阻断优先级/平均分不得掩盖短板/事实红线以 confirmed 字段为准等决策原则、四种评审形态打法、五步 SOP 与失败模式表。安装后被连贯审查官调用;绑定围栏 G6,卸载即撤销(F8.2/L8.3)。

geniusdapeng-collab/WorkLoom-video-edit

字体许可合规官方套件(字幕师专业套件):OFL-1.1/Apache-2.0/厂商免费商用三类白名单判定、OFL 四条义务(可商用/禁单售/改后改名/保留声明)、不做子集化的理由、客户自备商用字体的登记口径、证据留痕与围栏 G-SUB5 对应关系。安装后被字幕师调用;绑定围栏 G-SUB1/G-SUB5,卸载即撤销。

geniusdapeng-collab/WorkLoom-video-edit

字体选型官方套件(字幕师专业套件):场景×语言硬过滤、五维加权打分(作品类型/BGM节奏/粗细/艺术气息/气质关键词)、账号视觉锤锁定、中英混排搭配、上位提示词气质命中、否决项与"允许报告无合适字体"。安装后被字幕师调用;绑定围栏 G-SUB0/G-SUB1/G-SUB3/G-SUB5,卸载即撤销。

geniusdapeng-collab/WorkLoom-video-edit

情报五站方法论官方套件(随 bundles/ai-video 分发,F8.1 官方套件级):采集/评价/竞品/核验/装订五站流水,含决策原则(无源不入库/置信度三级/域名去重/冲突不仲裁)、实物 8 路与服务 6 路两套打法、五步 SOP(每步带回执与失败路径)、关键指标护栏与失败模式表。安装后被情报科五站与调研员调用;绑定围栏 G1,卸载即撤销(F8.2/L8.3)。

geniusdapeng-collab/WorkLoom-video-edit

原声 program、显式签章分轨与配乐的来源、策略、时间轴和一次混流方法;默认保留原声,不自动分离或测声音品质,真实非法分轨与混流失败明确停止。

関連スキル