Communitygithub.com

Athena314159/durian-daifuku-video-prompt-skills

Codex skills for source-video prompt extraction, Jimeng shot remixing, and physically consistent durian daifuku insertion.

O que é durian-daifuku-video-prompt-skills?

durian-daifuku-video-prompt-skills is a Codex agent skill that codex skills for source-video prompt extraction, Jimeng shot remixing, and physically consistent durian daifuku insertion.

Funciona com~Claude CodeCodex CLI~Cursor
npx skills add Athena314159/durian-daifuku-video-prompt-skills

Perguntar na sua IA favorita

Abre um novo chat com esta habilidade de agente já pré-carregada.

Documentação

提取视频prompt skill

把原视频作为人物、动作、表演、空间关系、声源和镜头节奏的事实源;把用户发回的新版口播作为最终语言事实源。先交接原口播,再锁定角色与镜头空间,确认短分镜后编译内部事实文件。full_delivery 的用户侧最终交付只有一个原生可编辑 Word DOCX;TXT、JSON、Markdown、审核表和图片清单都只是内部构建材料,不得替代或陪同最终 DOCX 交付。

图文双任务边界

用户要求“双 Agent、图文 Agent、开两个对话、一个跑图一个跑文”时,由 $jimeng-video-remix-director 作为唯一总控,完整执行其 图文双任务自动创建规则。本 Skill 被作为文任务启动且首条指令含机器值 branch_role=text 时,只负责文字线,绝不能再开任务;“文任务”只是用户界面中的中文说明,不能替换这个机器值。被图任务间接调用时只提供必要的源视频事实,也不能开任务。标题必须由总控的确定性脚本生成,禁止自行命名。

双任务虽然只把 JSON handoff 交给总控,但它们是用户可见任务。可编辑原口播和图线各阶段图片都不受“中间产物不展示”限制:文任务完成转写后必须直接贴出纯净可复制正文和带时间码核对稿;图任务从首张源图或换品候选核验通过起就在 commentary 用绝对本地路径直接嵌入可点击图片,约 25%/50%/75%/100% 只展示新增图或联系表,最终按 SRC、再按 ADD 逐张嵌入。未完成 QA 的生成图标“候选、未批准”;视觉 QA 通过后标“视觉已审、待用户确认”。总控必须镜像完整逐图总览并取得用户明确确认,记录绑定全部顺序/SHA-256 的 gallery_receipt 后,图片才可标 user_approved、handoff 才可 ready_for_merge、Word 才可导出。禁止只报 handoff、JSON、联系表或文件路径。用户在文任务补充新版口播、在图任务补充产品参考时,只允许把该输入结构化通知 controller_thread_id,由总控更新锁和重新派工;不得让用户手工在多个任务之间搬运路径或重新解释上下文。阶段图库不是最终项目文件;full_delivery 的用户最终交付仍只有唯一 DOCX。

最小执行原则

继承 $jimeng-video-remix-directorsource_intakediagnose_onlyfirst_frame_onlyprompt_onlyfull_delivery 档位。本 Skill 只执行当前档位必需的转写、角色锁、分镜、编译与导出;不为未请求的 Word、换脸、商业权利、跨项目搜索或 3000–4000 字长 Prompt 预先花费时间和 Token。

prompt_only 文线仍必须输出完整 canonical story/role/shot/action/audio/product handoff,并通过既有文本 lint;分支 TXT 和聊天手写稿都不是总控可交付 Prompt。只有总控把 handoff 合入项目、运行 pipeline.py compile 并取得 review/prompt_delivery_receipt.json 后,才允许称为 Prompt 交付完成。

source_intake 只完成视频元数据、完整源分镜、准确首帧、原口播/字幕、说话人和可观察六层事实。没有新版口播是该阶段的预期状态,写为 source_readynext_required_inputs=[revised_script],不得写成 partialblocked 或错误。没有明确换品指令时使用 target_product_mode=preserve_source_product,原视频中的源产品就是当前身份/包装参考,不要求另一张“目标产品参考图”;只有用户明确要求换成别的产品而又没有提供/批准参考时,才记录 next_required_inputs=[target_product_reference],仍不得把已完成的源片阶段称为失败。缺目标人物参考、换脸授权或商业发布授权同样只影响后续修改/发布,不阻止原片视觉与口播 intake,也不得写成该阶段 blocker。

必读路由

  • 完整任务使用当前 $jimeng-video-remix-director 作为项目与首帧底座。
  • 任一镜头出现榴莲大福时,读取当前 $durian-daifuku-five-states 的产品规格、参考图角色和所需视频状态链。
  • 目标产品为黄油脆丝棒时,完整读取 references/products/butter-crisp-stick.md,并按其资产路由查看实际像素;不要读取或注入榴莲大福状态。
  • 用户要求“给XX镜头做掰开画面”、掰断、酥脆掉渣或展示掰开横截面时,再完整读取 references/products/butter-crisp-break-case.md,把案例的单根受力、一次脆断、克制掉渣、橙金同色不规则互补断面写入指定镜头;禁止写成两根完整棒分离或平整切面。
  • 目标产品是其他食品时,先查看用户参考图并建立项目级临时规格;未获用户明确要求前,不把临时规格写回 Skill 知识库。
  • 进入角色识别、表演细化或内容审核时,完整读取 references/semantic-role-performance-gate.md
  • 编译和导出时读取 references/output-contract.md
  • 换脸、换产品、换包装、换场景、补图、重拆镜或重做 Word 前,先做当前项目的最小资产盘点。只有用户要求复用/点名历史项目,或当前项目缺必要资产时,才扩展建立跨项目 planning/asset_reuse_plan.json 并运行 audit_asset_reuse.py
  • 用户反馈“脸没换过来、像把头装在身体上、头太小、越改越脏、改好后放回分镜、Prompt 不足 3000 字、Word 与 TXT 接不上”或同类症状时,完整读取 references/remake-recovery-playbook.md,先归类根因再返工。
  • 修改本 Skill 或导演 Skill 前,必须执行 $jimeng-video-remix-director/references/skill-change-governance.md 的候选、版本、黄金回归、发布与回滚门;禁止直接修改 live Skill。

不要把待审核产品规范称为正式批准版。内部可以使用状态编号做路由,用户交付中的“产品形态”必须使用中文。

1. 触发与输入状态

明确说出本 Skill 名称或等价视频改款指令时立即启动,不再询问是否使用。

有视频、没有新版口播

先完成并在当前用户可见回复中直接提交:

  1. 纯净可编辑的原口播/字幕稿;
  2. 带时间码、原声、画面字幕、初步说话人键和声源的核对稿。

禁止先用一句“handoff 路径”结束任务;保存 JSON 不能替代把正文贴给用户。请用户在同一对话直接修改并发回。等待期间可以分析元数据、镜头、动作、人物、手口占用和准确首帧;不得预做产品级深度像素 QA、完整 Prompt 或 Word。阶段完成后写 source_ready,等待用户修订属于正常状态,不属于阻断。

有视频和新版口播

仍提取原片文本作为说话人、节奏和表演证据。先展示新旧映射,再进入角色锁定和短分镜。

缺视频

可以整理口播,但不得声称复刻原片。请求补充视频。

2. 原口播交接

  • 先判断画面文字和人物实际语言,再决定 ASR 语言。产品名、国名、包装外文和文件名不得作为口播语种证据;例如“印尼小鸡面”不能推出人物说印尼语。
  • 证据顺序为:用户明确说明 → 连续可见字幕文字体系与人物口型 → 自动语种检测分数 → 音频模型候选。全片已有清晰、连续、可逐句读取的中文字幕时,优先直接转写字幕并以原音/口型辅助,不为追求更强 ASR 临时安装大型依赖或长时间等待模型。
  • ASR 与可见字幕冲突时保留两路事实并标置信度;不得先下载另一语种模型再试错。只对字幕缺口或声源归属不清的短段做定点音频识别。
  • 保留原话、口头语、重复、停顿、语气词和可能的口音线索。
  • 分开记录听到的语音与画面字幕;不让二者静默互相纠正。
  • 听不清时写 [听不清 00:00.000],不猜词。
  • 原片说话人先使用不可变键 A/B/C,不要立即替换成男生、女生、老板或顾客。
  • 记录每句的时间、说话人键、屏内/镜外/电话初判和证据来源。
  • 同时检查原片是否真的存在可分析的人声。只有音乐、环境声或无声时,明确写“原片无人声口音证据”,不要假装听到了口音。
  • 即使口音证据不足,也要为用户之后发回的替换口播提出一个具体可执行的口音与讲话风格创作方案,并在对话中主动告知;该方案不是原片事实,不需要为了“证据不足”留空。

3. 强制角色与镜头空间锁

这是完整 Prompt 前的阻断关卡。建立 planning/role_lock.json,至少包含:

  • 不可变 speaker_id:A/B/C;
  • 用户称呼:男生、女生、店员等;
  • 全片可见范围:始终画面中、始终镜头后、部分出镜;
  • 是否持机;
  • 叙事关系:送礼者、收礼者、喂食者、咬食者等;
  • 每句原口播和新版口播的说话人;
  • 声音方式;
  • 用户明确纠正与证据。

证据优先级:

  1. 用户明确纠正;
  2. 原声与可见口型、时间同步;
  3. 人物动作、持机视角和手部来源;
  4. 原字幕说话人提示;
  5. 对话语义逻辑。

不得只凭体型、发型、服装或一句对话猜性别。对话逻辑只能辅助,不能覆盖用户或声画证据。

出现以下任一情况时,先用一句话向用户确认,禁止编译:

  • A/B 与男女映射不确定;
  • 同一人被同时标为屏内和全程镜外;
  • 持机者、送礼者、收礼者关系冲突;
  • 新版口播改变了谁吃、谁喂、谁评价,但说话人没有同步确认。

锁定后每个分镜必须继承空间不变量。例如“女生始终镜头后”意味着不能为展示喂食而生成女生侧脸、嘴部、身体、影子、镜面倒影或自拍角度。只能用镜外声音、持机反应、空闲手、画面人物的视线和产品状态变化表达她的存在。

3.5 人物库、产品库与历史成品复用锁

人物参考只锁身份,绝不锁场景

  • 人物库优先保存透明背景的头部与完整发型抠图;人物层只允许控制脸部身份、五官比例、肤色、发际线和发型。
  • 每一镜的原视频首帧是背景、房间、家具、服装、首饰、身体姿势、手势、机位、焦距、光线、景深和遮挡关系的唯一权威。
  • 禁止继承人物库全景参考中的沙发、墙面、窗户、植物、桌椅、服装、首饰、姿势、光线或构图。人物参考仍有背景时,换脸前必须抠除背景,或只遮罩脸部与头发区域。
  • 发现环境朝人物库照片漂移时,标记 AVATAR_BACKGROUND_LEAKAGE,拒收并从该镜自己的原片首帧加透明人物抠图重生。
  • 内置人物 AV-002 固定命名为“男性1”,身份参考为 $jimeng-video-remix-director/assets/avatars/male-1/male1_turnaround.png。该图只提供脸型、五官、发际线和头部结构;不得继承黑色无袖服装、白底、站姿或纯黑发色。用户要求保留原视频头发时,发型与发色必须逐镜继承源帧;当前红围裙黄油脆丝棒项目为深色发根、棕金/浅金挑染短发,改成纯黑触发 AVATAR_HAIR_OVERRIDE_MISMATCH。同框女性人物、眼镜、手势、产品、包装和盘子必须保持不变。

在角色锁之后、任何首帧编辑或生图之前,分别检查:

  • 人物/换脸库:目标 avatar ID、肖像授权、镜头范围、face reference 与历史批准换脸帧;未选择或未授权时保持原人物。
  • 产品/包装库:目标 product ID、当前唯一产品规范、状态、包装版本、参考资产与历史批准换产品帧;参考图只负责声明的身份/结构,不直接冒充分镜成品。
  • 场景/分镜成品库:source-first、美观/动作候选、approved-first、旧分镜成品、旧 Word 内嵌图与 manifest。

把三层资产写入 planning/asset_reuse_plan.json,按新 S 编号重新映射。人物、产品状态、包装数量、场景、构图、动作语义、画幅、字幕水印和像素 QA 匹配时优先复用;只为缺失、损坏、授权不符、无法安全整理画幅或内容审核不合格的镜头补生。人物与产品同时替换时分别绑定 avatar 与 product 资产,并记录交叉像素保护区;不得以整图通过替代任一层单独审核。

重拆镜、改 Prompt、改文件名、换输出目录或重做 Word 不是重新生图理由。用户明确要求复用历史动作/美观候选时,先记录授权并按批准帧标准提升,再进入 Word;保留原文件,不在历史成品上叠修。

4. 逐句台词锁

为每句新版口播建立六联表:

原句 | 说话人键与用户称呼 | 声源 | 是否需要可见口型 | 动作主语 | 同步视觉证据

规则:

  • 用户新版口播原文不得擅自润色或增加卖点。
  • 若为了新的动作逻辑需要换说话人、换句序或改变含义,先列出原因并请求用户确认。
  • 每句既单独列在 【口播稿】,也写入对应时间段的叙事动作。
  • 咬合和闭口咀嚼占用嘴部期间,吃食者不得屏内说完整口播。原片若没有可见吞咽或吃后反应,不得为了模板完整强制补写;产品离嘴、原片可见的闭口咀嚼结束且口型重新可清楚发音后,可以立即接新版屏内口播,不必等待一个虚构的吞咽或满足反应。
  • 吃食后马上说话时,把“最后一个不可说话动作段”和“第一句可说话动作段”分别标时,禁止让二者重叠;画外音不受吃食者口型占用限制,但仍须保持说话人和声源事实正确。
  • 镜外现场对白不是广告旁白;写明它来自镜头后的真实人物。

5. 原片动作与人物—动作—物体表

原片每个分镜和每个主要动作都必须:

  • 原样复刻;
  • 或用产品替换后的合法动作等价复刻。

完整交付禁止删除原分镜。即使用户要求删减水词、限制词或压缩 Prompt,也只压缩文字,不删除 source_shot_inventory 中的任何源分镜、动作或对应分镜图。

先建立不可变 source_shot_inventory。每个原分镜必须保存唯一 source_shot_id、原片绝对起止时间、可见动作、原始首帧和对应批准分镜图;原分镜不得因不足四秒、台词变短、Prompt 字数、镜头数量或生成平台时长而从清单中消失。用户没有明确授权时,source_shot_inventory 中任一项未映射、未做图或未进入 Word 都属于删除原分镜。

按30秒吃食计数、黄油脆丝棒纯手掰开或用户明确要求补入的新镜头不写进原片 inventory,也不得冒充 SRC。它们在 generation_shot_map 使用唯一 inserted_shot_id=ADD…、空 source_shot_ids,并保存生成镜内时间、新增理由、节奏锚点、源片参考 ID/帧、可编辑分镜描述、口播和独立批准图。新增吃食事件的 eating_plan.occurrences[].inserted_shot_id 必须命中同一生成镜的 ADD。

作为双任务中的文任务时,先按派工信封区分阶段。execution_tier=source_intake 使用 $jimeng-video-remix-director/references/schemas/source_intake_handoff.schema.json,直接携带可复制 transcript.editable_text、时间段、语言证据、下一阶段 pending_inputs 和强制内联回复字段;不得伪造尚未锁定的 SRC/ADD/S,也不得使用 partial/blocked 表示正常等待新版口播。execution_tier=full_delivery 才输出版本化 text-handoff-v2.0 JSON,不得用聊天摘要、对齐表或只有 S 级摘要的 JSON 代替。完整交接必须携带 execution_tier=full_delivery / locked_semantic_hash / shot_map_sha256 / collections / status / completed_* / blocked_items / artifacts 与完整 source_units / inserted_units / generation_shot_map / eating_plan / break_plan;其中 collections.shot_ids / source_shot_ids / inserted_shot_ids / unit_ids 必须逐项等于总控锁定的 S/SRC/ADD/混合单元顺序。每个 SRC/ADD 都保留自己的源片或生成时间、可编辑分镜描述、本单元口播、完整六层源片证据和 packaging_evidence;ADD 还保留新增理由、节奏锚点和源片参考。每个生成镜用 generation_timecode / unit_ids / source_shot_ids / inserted_shot_ids 固定完整归属,不能用自然语言重新对齐。eating_plan 的每个事件必须有独立 event_group_id / shot_id / unit_id / timeline_timecode,一个吃食事件不能因有三张图或三行记录就计成三次;30秒规则指三个非连续节奏事件,不是每次事件配三张图。break_plan 的每次人物出镜或纯手掰开都精确绑定一个 unit,并保留同一根、一次脆断、3–8粒克制掉渣、互补断面和声音同步证据。JSON Schema 见 references/schemas/text_handoff.schema.json,交付总控前必须运行 python3 scripts/validate_text_handoff.py <text_handoff.json> --locked-shot-map <locked_shot_map.json>;v2 不允许缺省锁校验。locked_semantic_hashshot_map_sha256 必须相同,并且都只来自只读锁文件中的 source_duration_seconds / source_units / inserted_units / generation_shot_map / eating_plan / break_plan 六项语义载荷;旧 v1、漏单元、时码/描述/口播/六层/包装缺失、吃食或掰开绑定畸形均不得合并。

该交接只是文分支的版本化输入包,不是第二套可独立改写分镜的事实源。总控用锁定的 SRC/ADD 把它们固定映射到导演项目的 source_manifest.source_shots / shots[].source_units / shots[].inserted_units / eating_plan.occurrences / break_plan.occurrences,并把图任务同 ID 的批准资产写入对应 delivery_asset_ids。归一化后的导演项目是编译和 Word 导出的唯一事实源;文任务不得另建对齐表,也不得要求第三个 Agent 重新对齐。

每拍记录:

人物 | 身体部位 | 动作 | 物体 | 起始状态 | 终止状态 | 视线目标 | 原片时间 | 生成镜内时间

特别检查:

  • 持机手和空闲手;
  • 承重手、操作手、递物手;
  • 说话、张嘴、咬食、闭口咀嚼、吞咽;
  • 同一颗产品的位置、数量、破损状态;
  • 盘装产品逐根实例的中心位置、长轴方向、上下层级、交叉点、露出端、遮挡比例和盘沿关系;
  • 包装、手机、餐具、卡片等道具占用;
  • 黄油脆丝棒外盒的 15 × 15 × 4.5 cm 三轴比例、同框多盒同尺寸和接触阴影;
  • 前置动作是否完成后才出现后续结果。

不要限制不冲突的动作数量。只有资源互斥、因果跳步或时间无法执行时拆镜。

源帧若带黑框或平台式模糊补边,先按 $jimeng-video-remix-director 的“黑框、模糊补边与全分镜覆盖闸门”清洗并保存裁框报告,再把清洗帧作为首帧编辑目标。全片总览、硬切/动作关键帧总览、准确首帧总览和逐镜候选的 S 编号必须完全覆盖;不得只分析或生成产品特写而漏掉人物镜头。所有手持、盘装、桌放和盒装目标产品都必须有可见的物理承重、接触遮挡及一致接触阴影;空气缝、穿模或无支撑悬浮均阻断批准。

6. 视频核心与同步视觉证据

先用一句话写清整条视频真正要表达什么,再写每镜叙事作用。产品展示必须服务于故事关系,不能替代人物关系。

每句卖点都要有同期可见证据:

  • 软糯:接触、浅而平滑的压痕、短暂停留、松力、柔和恢复;
  • 满馅:合法咬口、撕口或断面,焦点落到皮馅关系;
  • 好吃:合法吃食后真实微反应,或明确是喂食前推荐;
  • 数量:同框可数的包装或产品;
  • 被记住:人物从产品转向对方的视线与情绪变化。

7. 叙事优先的活人感六层

六层不是六个独立填空栏、六段通用模板或六组限制词,而是帮助模型理解原片人物表演因果的六个观察维度。先把镜头当成一段完整叙事理解,再把适用六层融入同一条动作和情绪曲线;禁止先分栏凑字、再把内容机械拼接。

写任何人物 Prompt 前,先完成一次内部导演推理:原片发生了什么 → 人物当时在回应谁/什么 → 起始心理状态 → 可见或可听触发 → 人物此刻想完成什么 → 情绪如何转折 → 这个镜头最终让观众感受到什么。事实与推断分开:动作、声源、口型和像素是事实;意图与情绪含义是带证据的推断。推断必须能回指原片时间、视线、表情、动作或声音,不能凭广告套路虚构。

可复制 Prompt 固定使用 narrative-six-layer-v1。先用连续自然语言写一段 原片叙事复原,明确人物关系、触发、意图、情绪弧和镜头落点;再按镜内时间把六层写进具体 action beat。人物商业镜必须补齐 persona_drive / primary_emotion / secondary_emotions / undertone / residue / commercial_turn / evidence_basis / creative_enhancement,并把馋意、惊喜、回味、较真、亲近、信任或分享冲动翻译成眼神、五官、身体、手、呼吸和声音的可见变化;只写“自然、克制、真实、平稳”直接失败。原片事实与获用户授权的增强分轨,SRC 不允许 template_supplement。完整规则见 角色、空间与活人感语义门

动作节拍必须从镜内 0.00 秒连续覆盖到镜头结束,每拍写唯一 ID、触发、具体情绪词、可见变化、声音变化、产品变化、镜头响应和下一动作。超过 2 秒继续拆分,除非原片有可证明的持续保持并写 hold_reason。拿起、掰裂、两半分离、展示断面、咬下、离嘴、闭口咀嚼和恢复说话不能塞入一个长拍;吃食/掰断计划必须逐阶段回指 action beat ID。六层内部只写正向、可拍摄、可观察、带主语和时间的执行内容,不写“不要、禁止、不得、避免、不能、不出现”等限制句。不可见或不适用的层保留在内部证据对象中,但从可复制 Prompt 省略。

每个有人物的动作段都必须检查以下六层;只输出本镜适用且有依据的层,不用空泛“自然、开心、惊喜”替代。

  1. 情绪与触发:准确情感、强度、因为什么发生变化。
  2. 视线轨迹:先看谁/什么、何时移开、何时回到对方;镜外人物存在时写“镜头后人物的眼睛位置”。
  3. 五官微反应:眉峰、眼睑、瞳孔方向、鼻翼、嘴角、下巴;吞咽只在原片确实可见时写入,不把它当成每次吃食的必选结尾。
  4. 身体和手部准备:肩颈、重心、手指受力、手腕、换手、衣料与道具惯性。
  5. 呼吸与停顿:吸气、呼气、换气、欲言又止、四分之一秒或半拍停顿。
  6. 声音与口语:音色、音量、语速、起音、重音、尾音、笑意、连读、口语化和口音证据。

六层表演覆盖

  • 六层的价值是解释“为什么这样看、为什么此刻动、情绪怎样随动作变化”,不是罗列器官。每层必须服务本镜叙事职责和同一条情绪弧。
  • 先写完整的 触发 → 意图 → 准备 → 主动作 → 感官反馈/微反应 → 情绪落点 → 下一拍,再检查六层是否覆盖;不得把同一动作拆成六段互不衔接的句子。
  • 只写本镜可观察、与动作因果直接相关的层;正脸不可见时不虚构视线或五官,静物产品镜头不补人物表演。
  • 每个动作段覆盖适用层,不复制通用“活人感模板”、不为达到比例凑字。身份锁、产品尺寸、包装文字、摄影参数和负面词不冒充表演。
  • source_performance_layers 是内部证据账本;可复制 Prompt 使用由证据推导出的正向导演语言,不输出 observed / not_visible / template_supplement / confidence / gap_reason 等审计字段。
  • 一条六层描述必须至少包含 人物主语 + 触发/时间 + 可见或可听变化 + 对下一动作的作用。只写“眼神自然、表情开心、动作真实、呼吸平稳”视为缺失。
  • 表演字符数 / Prompt 主体字符数 / 表演占比 默认只是诊断信息,不设 40%–50% 硬门。只有用户或特定交付契约明确指定该范围时才阻断。

把口音与讲话风格分成两种来源:

  • 原声观察:原片有人声且能辨认时,根据音高、语速、平翘舌、前后鼻音、卷舌、语气词、连读、吞音和地域倾向写具体观察。
  • 创作提案:原片无人声、太短或证据不足时,仍选择一个适合人物、地域氛围、关系与情绪的具体方案。至少写明地域口语方向或明确语音特征、语速、重音、尾音、语气词/连读和情绪变化;标注“创作提案,不是原片口音识别结论”。

在短分镜前先在对话中提交:

【本次口音与讲话方案】
来源:原声观察 / 创作提案(不是原片口音识别结论)
人物A:<具体地域口语方向或语音特征 + 节奏 + 重音尾音 + 情绪变化>
人物B:<具体方案>
采用原因:<与人物年龄、关系、场景和视频节奏的匹配>

证据不足时直接给出推荐方案并继续,不必先让用户选择;若用户提出不同方向,再按用户意见锁定。禁止在对话、短分镜、总 TXT 和逐镜 TXT 中使用“沿用原片生活口语节奏”“沿用原片生活口语风格”“沿用原片口语节奏”“保持原片口语感”等泛化占位表达。不能只写“自然生活口语”“接地气地说”,必须给生成模型可执行的声音特征。可以提出轻微北方、川渝、江浙、广府等口语方向,但避免夸张模仿、刻板笑料和不必要的身份断言。

每段按一条连续叙事链写:

原片情境 → 触发 → 人物意图 → 视线变化 → 动作准备 → 主动作 → 感官反馈/微反应 → 情绪落点 → 停顿/换气 → 下一动作

场景同时写清空间、生活物件、光线、环境声、手机持握和对焦反应。保留真实小失误、重复起音和调整动作,但不把活人感写成低画质或失控表演。

口播覆盖、动作互动与喘息门

  • 只有用户明确要求“每镜都有口播”时,才禁止纯音乐/环境声/拟音镜头。默认允许由有意义的视觉动作、拟音或短停顿承担节奏,不为填满音轨增写口播。
  • 口播可在语义标点、情绪转折、对方反应以及咬下、闭口咀嚼、吞咽、掰断、撕袋等口部或高受力动作处留出功能性停顿。短换气通常为四分之一拍至半拍;咬、嚼、咽和关键拟音可按原片证据留出更完整的动作窗口。停顿期间画面仍须由视线、手部、产品状态、拟音或微反应推进,禁止人物和物体都无变化的死空气。
  • 有人物或可见手部的镜头不得只站定/坐定介绍产品或只做口型。每镜至少形成 触发 → 准备 → 主动作或互动 → 可见反应 → 过渡;互动可以是拿、递、接、开、取、转、指、掰、咬、闭口咀嚼、吞咽、回看对方或回应镜外人,不要求不停做大幅动作。
  • 先保留原片及用户批准成片的句间呼吸、动作窗口和剪辑节奏,再计算实际可说时段。新版口播若塞不下,优先在自然语义点重分句、把口部冲突段改为画外音或按原切点拆镜;不得仅提高语速、抹掉喘息或让人物边吃边说。
  • 吃食表演必须逐帧观察原片的真实张口幅度、咬入阻力、产品离嘴速度、闭口咀嚼次数、腮部运动、碎屑、手部承托、视线和声音,再写成可执行 Prompt。不得为了“更香”套入原片没有的固定吞咽、点头、闭眼、满足笑或“嗯~”;可以加强原片已经存在的可见食欲信号,但不能改变动作事实。
  • 已启用“每镜有口播”契约时才拒绝 SHOT_WITHOUT_SPOKEN_SCRIPT;人物只站定介绍时拒绝 STATIC_PERSON_INTRO_WITHOUT_INTERACTION,口播挤掉必要喘息时拒绝 BREATHLESS_SPEECH_PACKING

8. 产品替换协同

先按用户明确目标选择且只选择一个产品规范。不同产品的形态、状态、包装、断面、掉屑和吃法不得互相继承。

榴莲大福

按当前五形态 Skill 内部路由选择状态;只注入本镜需要的规则。

用户交付中使用中文名称:

  • 完整未破、摆盘或手持展示;
  • 人物咬食与自然断开过程;
  • 双手按压并建立撕口;
  • 自然咬口、手撕或明确刀切断面;
  • 同一颗形成的两半展示。

不得在用户 TXT 的“产品形态”字段使用 V1–V5wholebittenperson_eating 等内部标签。

黄油脆丝棒

references/products/butter-crisp-stick.md 选择本镜所需的完整体、包装、开袋、掰断、断面、咬食或碎屑规则;用户交付只写中文产品状态。涉及课堂分享时,只有用户明确授权才新增教室场景,并锁定儿童数量、粉色书包、递接手、独立包装数量和合法咬食链。

黄油脆丝棒的实体片状脆丝覆盖层、橙金色、直挺脆硬、同色疏松断面和少量局部碎屑是产品不变量。脆丝必须是有独立厚度、遮挡、缝隙、微投影和轮廓凸出的实体碎片,不是光滑橙色棒体上的贴图、印刷图案、划痕、浅浮雕、压花或均匀卷曲细线。禁止把它生成成面包糠炸物、肉松、椰蓉、威化、软面包、流心或拉丝食品。

9. 包装与用户参考图

先查看实际像素,再声明参考图只承担什么、禁止继承什么。

尺度模式:只能选择一种

每次涉及产品或包装尺寸的生成、编辑与 QA,先在生成包中声明且只声明一个 scale_mode

  • physical_consistency:默认模式。按实体事实锁定盒体 15 × 15 × 4.5 cm、单根 12 × 2.5 × 1 cm(正面目标 4.8:1)、同平面物理比 0.80,并结合透视审核。
  • relative_pixel_resize:仅当用户明确要求“基于某张原图缩小/放大百分比”时启用。把用户指定的原始批准帧设为唯一尺寸基准,以线性宽高倍率描述对象,例如盒子缩小 20% 写为 0.80、脆丝棒缩小 10% 写为 0.90;面积倍率不得冒充线性倍率。

两种模式互斥。启用 relative_pixel_resize 时,15 cm12 cm0.80 只保留为产品元数据,不得再写进本轮生图硬约束或作为画面投影尺寸验收值;不得同时要求“相对原图缩放百分比”和“按其他镜头/实体比例校正画面大小”。其他镜头只能承担身份、材质、形状、包装印刷或结构职责,绝不能承担当前镜头的视觉尺寸职责。用户最新的明确尺寸指令覆盖旧轮次与项目默认值。

原视频中的旧食品和旧包装默认只是动作/位置参考。一旦规格与目标不同,写入 source_scale_role=pose_only_incompatible_scale,不得同时要求完全保持原产品边界框/指间距/包装堆放密度又执行目标实体尺寸。画面不出现外盒时不写 12:15=0.80;目标包装无法按真实规格容纳进原纸箱/桌面区域时,触发 SOURCE_CONTAINER_CAPACITY_CONFLICT 并调整容器、数量或景别,不得缩放目标包装强塞。

百分比返工必须记录:唯一源帧、每类对象的原始边界框、目标线性倍率、保持 1.00 的不变量和结果边界框。只有执行了确定性的蒙版几何变换并完成像素测量,才能声称“精确缩小 X%”;纯生成式编辑只能写“目标倍率约为 X”,并须因明显过缩、欠缩、镜头缩放、人物比例变化或物体拓扑改变而拒收,禁止伪报精确百分比。

黄油脆丝棒尺寸前置闸门

  • 外盒装量与可见姿态锁:一盒必须且只能装6包,盒内占位为每层3包、上下2层,六包长轴沿盒体15 cm纵深方向;同层三包并排宽度约13.5 cm,上下两层合计厚度约4 cm。3×2 只描述盒内占位,不代表开口俯视时六条完整袋身平码;在尚未取出产品的满盒状态,从15×4.5 cm窄侧开口应主要看到6个自然错位、略斜搭靠且前后遮挡的锯齿热封袋端,袋身向盒内延伸。把六条完整袋身画成同一平面平行阵列或敞口展示托盘,标记 BOX_POUCH_LAYOUT_MISMATCH。开盒时即使被手或上层遮挡,总数仍为6;从满盒取出1包后盒内只剩5包并自然回落。第7包、十几包密排、少于动作状态应有数量或自动补包均标记 BOX_POUCH_COUNT_MISMATCH 并拒收。
  • 人物参考隔离锁:人物库资产只能提供脸型、五官、发型和表情。目标背景、家具、服装、身体、手势、构图、机位和光线只能来自同编号原视频首帧;人物参考图内的沙发、墙面、窗、植物、旧产品、字幕和暖光一律不得进入生成帧。优先使用由用户原图确定性裁切的透明身份图,禁止使用会改变五官的生成式抠图;发生背景泄漏标记 AVATAR_BACKGROUND_LEAKAGE,五官未匹配标记 AVATAR_IDENTITY_MISMATCH,均须返工。

在提取口播、角色锁或短分镜完成后、任何首帧改图和完整 Prompt 编译前,先为每个出现黄油脆丝棒或其外盒的镜头写入 尺度模式:。未声明或不是唯一合法值时,停止该镜生成;不得把尺寸留到视频 Prompt 或事后审核再补。

  • physical_consistency:每镜完整 Prompt 必须同时写入单根约 12 × 2.5 × 1 cm、正面目标长宽比 4.8:1 且成品必须落在 4:1–5:1、侧面厚宽比约 0.40、外盒 15 × 15 × 4.5 cm、正面 1:1、盒厚约 0.3 边长;当产品与盒面同平面且朝向可比时,写入 12:15 = 0.80。跨景深时,必须写明先作透视校正,禁止裸像素硬比。
  • relative_pixel_resize:完整 Prompt 只绑定用户指定的唯一原始批准帧、对象目标线性倍率和 1.00 不变量;不得再把 12:150.80 或其他镜头的实体投影比例写成当前画面硬约束。

在 TXT 导出前运行 scripts/lint_prompt_txt.py,并显式选择 --stage text_branch--stage full_delivery_precompile--stage full_delivery_postexport,禁止靠缺省参数猜当前阶段。黄油脆丝棒镜头只要出现 SCALE_MODE_UNDECLAREDPRODUCT_PACKAGE_SCALE_LOCK_MISSINGSCALE_MODE_COLLISION,不得编译为生成包,也不得进入图生视频。

包装外观、文字、结构、尺寸、盒数、单盒装量未确认时不得臆造。黄油脆丝棒零售外盒已由用户明确确认为 15 × 15 × 4.5 cm,所有出现该外盒的镜头必须继承 1:1 正方形正面和约 0.3 边长的盒厚;不得退回“尺寸未确认”或只写“橙色方盒”。用户确认实体包装印刷后,将它列为无字幕规则的明确例外;参考图水印、手套、背景和拍摄构图不自动继承。

逐镜包装对象实行存在性白名单:先从该镜 source_first_frame 枚举外盒、独立袋、透明托盒和裸产品的数量与位置,再决定替换对象。原片没有零售外盒的镜头,产品规范和跨镜通用段落不得凭空注入外盒;原片只有裸产品时只换裸产品,原片有内包装时才允许出现独立袋或透明托盒。任何新增包装对象触发 UNAUTHORIZED_PACKAGE_INJECTION 并阻断交付。

黄油脆丝棒独立袋的当前唯一尺寸为 15 × 4.5 × 2 cm,正投影约 3.33:1;袋内固定包含透明浅边单根托盒,物理分层为 外层金色膜袋 → 中层透明托盒 → 内层12 × 2.5 × 1 cm脆丝棒。托盒没有实测值时只写包含不等式,不臆造精确厘米数。开袋动作必须先撕膜袋、再让托盒连同产品滑出、最后从托盒取出产品。

产品形态 必须枚举首帧和镜内实际可见的全部产品与包装状态,不能只写盘中裸产品却漏掉画面里的外盒。若批准首帧出现一盒、两盒或三盒,而 产品形态 和本镜专项 Prompt 没有相同盒数、尺寸和状态,先修正事实表,禁止依赖通用“包装与文字边界”段落蒙混通过。

黄油脆丝棒出现裸产品时,细节.jpg 必须承担实体片状表面结构职责。首帧生成包必须实际绑定该参考资产,不能只在文字中写“产品知识库负责”。若图生视频平台只允许上传一张首帧,先把批准首帧中的产品按 细节.jpg 修到合格,再进入视频;不得指望视频 Prompt 从错误首帧恢复材料结构。

批准首帧前,把每个裸产品裁成原尺寸局部,与 细节.jpg 同尺度并排查看。必须同时看见片状碎片顶面、侧边厚度、前后遮挡、翘边、窄缝、微投影和少量轮廓凸出;任一产品变成光滑基底上的图案、浅浮雕或细线纹,均不得标记为批准首帧。

10. 分镜与时间

  • 依据原片硬切、动作闭环、说话人、声音方式、产品状态、台词语义和平台时长切镜。
  • 先完整提取原片每一个 source_shot_id,再编排独立生成镜头。原片分镜与生成分镜不是一对一时,使用 generation_shot_map 显式保存映射,不能靠标题或聊天说明推断。
  • generation_shot_map 中非新增条目只映射 SRC;新增条目必须用唯一 ADD,不能给它编造原片时间。总控锁定的 SRC/ADD 都必须在图、文 handoff 和最终 Word 中有同 ID 记录。
  • 原片不足 4.00秒 的分镜不得删除,也不得单独丢给平台生成不足四秒的片段;与时间相邻、空间连续、动作因果可衔接的源分镜合并为一个不少于 4.00秒 的连续生成镜头。合并后仍逐项保存每个 source_shot_id、绝对时间、动作和各自批准分镜图,并在 Word 同一生成镜章节中全部列出。禁止合并不相邻源分镜、颠倒顺序或用一张图冒充多个源分镜。
  • 不设置脱离项目的固定五秒上限。story_plan.json 必须按原视频动作长度、口播容量和实际平台能力声明本项目生成镜最短/最长值;为保留相邻短源分镜而形成的较长连续生成镜,只要动作、语速和平台时长分别通过即可,不能为了缩短时长删除其中任一源分镜。
  • 通常每镜 2–3 句;动作逻辑优先。
  • 长句原则上约 50 个汉字,在自然停顿处分句,不改变原意。
  • 完整编译前逐镜计算 口播有效字符数 / 实际可说时段 / 计划语速。有效字符只计汉字、字母和数字;实际可说时段必须扣除屏内人物的入口、咬合、闭口咀嚼、吞咽、必要换气、纯拟音和无声观察,不得直接拿整镜时长冒充。
  • 默认屏内口播不得超过 5.0 字/秒,画外音不得超过 5.5 字/秒;用户或平台另有明确标准时记录覆盖值。超过门槛时优先按语义与动作闭环拆镜,其次延长总时长,禁止靠吞字、删除原文、口型滞后或字幕补词放行。
  • 单镜最长值以 story_plan.json 的项目级声明为准;未声明不得完整编译。单镜超过3个台词句段,或同镜混入两个以上不能由同一动作闭环承担的价格、材质、吃后体验、家庭证明、行动号召职责时,原则上拆镜;若它是为了保留相邻短源分镜的连续生成合并,则保留全部源分镜与动作,只在生成镜内部按 action beat 分段,不得删镜。
  • 先完成正确拆镜;仅当长度契约已明确启用时,再对每个独立镜头执行 Prompt 3000–4000 字要求。禁止为减少长 Prompt 数量或满足字符下限合并本应独立的动作。
  • planning/story_plan.json 必须同时保存原视频总时长、完整 source_shot_inventorygeneration_shot_map、生成镜最短/最长值、屏内/画外音语速上限、每镜分镜描述和新版口播锚点;任一字段缺失不得进入完整编译。
  • 每个生成镜必须写 分镜描述:以原片所含源分镜的画面、动作顺序和剪辑节奏为底,根据新版口播的实际容量重新分配镜内秒数。分镜描述不是抽象标题,必须写清对应源分镜、人物/物体动作、画面变化、口播落点和合并原因。
  • 只有用户或目标平台明确要求时,完整编译才启用每镜 3000–4000 个非空白字符的长度契约,并把正文优先压在 3000–3300 安全区。未明确启用时同时关闭下限与上限,优先用最短的可执行 Prompt;不传 --enforce-prompt-length / --min-prompt-chars / --max-prompt-chars
  • 只有真正发送给生成模型的可执行内容进入 Prompt 主体:首帧/身份、原片叙事复原、镜内时间动作、由证据推导的正向六层表演、手嘴道具占用、产品关键物理、摄影声音和最少必要纠错项。原片证据审计字段、审核过程、版本说明、统计方法、参考职责说明和跨镜重复知识不得混入复制区。
  • Word 中“即梦可复制 Prompt”必须是一个边界清楚的独立区域;口播、原片证据、审核记录和字符统计放在区域外,不能让用户复制整页时误带入。
  • 把长度用于补齐原片叙事、逐时动作、触发—意图—情绪弧、正向六层、手口道具占用、产品物理、摄影灯光和声音;禁止复制句子、同义反复、罗列与本镜无关的负面词或虚构不可观察细节凑字数。
  • Prompt 固定采用 叙事导演稿 → 逐时动作 → 正向表演与情绪弧 → 产品/手口物理 → 摄影与声音 → 最小纠错附录。六层不得单独堆成通用尾巴,也不得每镜复制同一组六层原则。
  • 负面纠错句只允许处理本镜真实高风险冲突、用户已指出错误或平台必需边界;先改写为正向目标,仍无法消歧时才进入末尾 最小纠错附录。负面句字符默认不得超过 Prompt 主体的 15%,也不能计入六层或表演字符。超过时先删通用限制、同义排除和跨镜知识,不能靠增加正向水词稀释比例。
  • 字符数按去除全部空白后的 Prompt 主体计算,不包含标题、元数据、口播稿、原片证据和审核记录;导出标题中的字符数必须与程序实算一致。
  • 压缩顺序:先删除跨镜通用解释、证据说明和同义排除词,再合并摄影与连续性,最后压缩重复技术句;不得先删除人物触发、动作因果、产品关键物理或嘴手资源冲突。表演占比按用户锁定范围对最终复制稿复算。
  • 允许删去水词、重复限制词和与本镜无关的通用知识,但每镜必须先锁 核心主体 / 核心动作 / 核心产品 / 适用六层;压缩后这些核心事实仍须出现在可复制 Prompt 中。删词不能造成主体换人、原片动作遗漏、产品状态丢失或人物表演层缺失。
  • 保存原片绝对时间;每个独立生成镜头从 0.00秒 重算。
  • 标题优先使用本镜口播核心;无口播时用简短动作摘要。

30 秒以上视频的非连续吃食事件

  • 当原视频总时长达到或超过 30.00秒 时,先完整保留并统计原片真实吃食事件,再按 target=max(source_count, 3)inserted=max(0, 3-source_count) 计算;occurrences 行数必须等于 target,计划中的 source/inserted/target 三个计数字段必须与实际行数一致。
  • 先把原片中时间连续、属于同一次入口/咬合/离嘴/咀嚼的多个切换镜归并为一个 source_eating_event 并计数。原片已有三个或以上事件时不得额外补吃;原片已有四次就保留四次、target=4、inserted=0,不能把真实事件删成三个。
  • “非连续”只约束新增吃食的置入:若相同或相邻生成镜的一对事件中至少有一个 origin=inserted,必须隔开一个非吃食节奏拍;原片两个真实吃食事件即使相邻也不得为了形式非连续而删除、改序或伪改来源。
  • 新增吃食事件在短分镜 authoring 中可记录 narrative_section,正式 v2 handoff 必须把口播锚点归一化为 script_anchor,并同时记录 event_group_id / unit_id / timeline_timecode / rhythm_anchor / non_contiguous_event=true,保持人物、场景、产品状态与前后镜可衔接。required_phases 只使用 v2 的 approach / bite / fracture / withdraw / closed_mouth_chew / speech_transition;只复刻原片可见或用户明确批准的阶段,不强制补原片没有的吞咽或吃后反应。
  • 三个吃食事件是全片三个分散节奏点,不是同一镜的三张连续图片,也不是强制连续三镜。

导出前的节奏审核表必须逐镜列出:镜头ID | 台词句段数 | 有效字符数 | 实际可说时段 | 字/秒 | 单镜时长 | 声源 | 口部冲突 | 处理结论,并汇总总时长、平均镜长、最长单镜和最高语速。只报告 Prompt 字数与表演占比不构成节奏审核。

11. 两阶段确认

短分镜阶段

先提交:

  • 新旧口播对应;
  • 角色与镜头空间锁;
  • 逐句台词六联表;
  • 原片动作对应;
  • 台词—视觉证据;
  • 中文产品形态;
  • 手口与道具占用;
  • 核心叙事和情绪曲线;
  • 短分镜卡。

角色、空间和动作主语未锁定时不得进入长 Prompt。

完整编译阶段

用户确认短卡后,按输出契约在内部工作目录生成并校验:

  • 完整逐分镜Prompt.txt
  • shots/S001_标题.txt 等逐镜 TXT;
  • 人物角色锁定表.txt
  • 内容语义审核报告.txt
  • planning/role_lock.json
  • 即梦逐镜视频Prompt.docx:按 $jimeng-video-remix-director/references/word-delivery-contract.md 输出。每镜必须嵌入对应的批准首帧,并将目标人脸参考(若有)和产品参考图的用途、可复制 Prompt、口播和审核结论关联到同一镜头编号。

总文件、逐镜文件和 Word 中的同一镜 Prompt 必须一致。Word 不是聊天稿的排版版:它只能由已校验的总 TXT / 逐镜 TXT 编译,并在渲染逐页检查后交付。

用户侧 outputs/ 只保留并交付最终 .docx。内部 TXT、JSON、Markdown、manifest、审核报告、渲染页、对齐清单和图片目录不发给用户,也不在最终回复中逐项罗列;它们只用于阻断、重建和追溯。

12. 审核纪律

区分两类结果:

  • 结构检查:字段、0.00秒、字符数、禁字幕规则、中文产品形态、文件完整性和可检测角色冲突。
  • 内容审核:人工逐句核对原声、人物身份、镜内外、动作主语、视线、表演、产品物理和原片动作。

结构脚本不得输出“内容审核通过”,不得依赖文件自报 PASSFAILERROR。用户交付中不使用这些单词作为本镜结论。

【内容审核记录】 只写:

  • 已经写入的具体事实;
  • 对应的原片动作与时间;
  • 仍需用户确认的冲突;
  • 必须在生成结果像素中继续查看的项目。

运行:

  • 文分支交接:python3 scripts/lint_prompt_txt.py <完整逐分镜Prompt.txt> --stage text_branch --story-plan planning/story_plan.json --text-handoff planning/text_handoff.json [--role-lock planning/role_lock.json]
  • 总控编译前:python3 scripts/lint_prompt_txt.py <完整逐分镜Prompt.txt> --stage full_delivery_precompile --story-plan planning/story_plan.json [--role-lock planning/role_lock.json]
  • Word 导出后:python3 scripts/lint_prompt_txt.py <完整逐分镜Prompt.txt> --stage full_delivery_postexport --story-plan planning/story_plan.json --delivery-dir outputs [--role-lock planning/role_lock.json]

长度默认关闭;只有 story_plan.json.prompt_length_contract.enabled=true 或命令行显式传入 --enforce-prompt-length时,才同时硬校验下限与上限。不得只开下限或只开上限。

脚本只报告“未发现结构性阻断”或具体阻断/提醒;它不能代替观看原视频和生成结果。

13. 修订与失败定位

生成失败后只修失败镜头和字段,锁定其他已确认内容。按以下类别定位:

  • 角色或声源;
  • 镜内/镜外空间;
  • 台词与口型;
  • 原片动作遗漏;
  • 视线与情感;
  • 活人感六层;
  • 手口与道具占用;
  • 产品状态或数量;
  • 产品实体微结构;
  • 首帧;
  • 文字和水印;
  • 时长和字符数。

遇到首帧换脸、分镜回填或 Word 交付故障时,按 references/remake-recovery-playbook.md 的恢复顺序执行。必须遵守:

  1. 把用户主观反馈转换成可观察症状,不直接把“重做”当根因;
  2. 对照当前已审核原始单帧、目标身份参考和失败图,分别判断身份、头身比例、颈肩融合、手嘴产品关系与画质污染;
  3. 每个失败镜从对应已审核原始单帧重新生成,不在失败生成图上叠修;
  4. 为自然融合可以扩大编辑区域到头发、颈部、肩线、上半身或姿势,但不得改变用户已锁定的小孩、产品、包装数量、杯子、场景和构图事实;
  5. 只替换失败的 S 编号,回填逐镜目录后重建分镜总览,再由总 TXT 的已校验正文生成 Word;
  6. Word 不得从摘要、聊天记录或短分镜卡重新扩写。它必须逐镜嵌入已通过校验的总 TXT/逐镜 TXT 正文,并显示程序实算字符数;
  7. 图像逐张像素检查,DOCX 渲染后逐页检查;没有完成这两类检查不得称为最终交付。

黄油脆丝棒出现 PRODUCT_MICROSTRUCTURE_FLATTENED 时,所谓“已审核原始单帧”不能继续作为产品事实源。场景、人物和构图仍回到该原始单帧;产品结构必须重新绑定 细节.jpg,从原场景底图单次重做。换脸或整个人物融合若扩大编辑区域,裸产品、盘中产品和包装产品图默认列为像素保护区;无法保护时必须同时提供产品结构参考并重新执行产品局部 QA。

14. 最终阻断条件

以下条件只阻止把项目称为 full_delivery 完成或交付最终 DOCX;它们不把已完成的 source_intake 降级成失败。原口播已经展示且源分镜分析完成时,可以明确写 source_ready 并列出下一项用户输入,禁止使用 blocked 冒充阶段边界。任一条件成立都不能称为最终交付完成:

  • 原口播尚未交接或新版口播未锁定;
  • A/B 与用户称呼、镜内外、持机者关系未确认;
  • 台词说话人、动作主语或口型归属冲突;
  • planning/story_plan.json 缺原视频总时长、完整源分镜 inventory、生成镜映射、生成镜最短/最长值或屏内/画外音语速上限;
  • source_shot_inventory 未覆盖原视频全部分镜,任一源分镜缺绝对时间、动作、原始首帧、批准分镜图,或未映射到生成镜与最终 Word;
  • 不足4秒的源分镜被删除、孤立为不足4秒生成镜、与不相邻源分镜合并、顺序颠倒,或合并后没有保留每个 source_shot_id 的动作和图;
  • 任一镜头超过项目声明的单镜最长值,且没有平台覆盖与保留源动作的独立节奏论证;
  • 任一镜头超过3个台词句段,或把多个互不相容的叙事职责压入同一动作闭环;
  • 屏内口播超过项目上限(默认5.0字/秒)或画外音超过项目上限(默认5.5字/秒);
  • 实际可说时段包含入口、咬合、闭口咀嚼、吞咽、必要换气、纯拟音或无声观察,导致时间容量虚高;
  • 咬合或闭口咀嚼尚未结束就安排吃食者屏内完整口播;或原片没有吞咽/吃后反应却把它当成吃食镜强制完成项;
  • 原片总时长达到30秒而 source/inserted/target 三个吃食计数不满足 target=max(source,3)inserted=max(0,3-source)occurrences 行数与 target 不同,原片真实事件被删,或含新增事件的一对吃食位于相同/相邻生成镜;新增吃食事件没有叙事段、原片节奏锚点或新版口播锚点;
  • 为满足每镜3000–4000字符、减少Prompt数量或保留原片镜头数而合并本应拆开的台词和动作;
  • 全程镜外人物被安排出镜;
  • 原片主要动作没有对应;
  • 活人感六层缺失或只写抽象情绪词;
  • 已明确启用 40%–50% 表演占比契约时超出范围,或任何情况下以身份锁、产品/摄影约束、通用模板冒充表演字符;
  • 没有具体口音与讲话风格方案,或只使用泛化占位表达;
  • 原声证据不足时,没有在对话中说明方案属于创作提案;
  • 台词卖点没有视觉证据;
  • 手口、产品或道具互斥占用;
  • 产品状态跳步、数量不守恒或沿用旧规范;
  • 盘中产品只守住数量却没有继承批准首帧的逐根陈列拓扑,或被重排成整齐阵列;
  • 未声明唯一 scale_mode,或把 physical_consistencyrelative_pixel_resize 同时写入同一次生成,触发 SCALE_MODE_COLLISION
  • physical_consistency 模式下,黄油脆丝棒外盒没有继承 15 × 15 × 4.5 cm、1:1 正方形正面和约 0.3 边长盒厚,或同框多盒尺寸/厚度不一致;
  • physical_consistency 模式下,黄油脆丝棒单根没有同时保持 12 × 2.5 × 1 cm、正面目标4.8:1(成品4:1–5:1)和侧面厚宽比约0.40,或其12 cm长度与盒面15 cm边长的物理比例没有通过透视校正后的联合审核;同平面、可比朝向时投影比应约为 0.80,跨景深时不得用裸像素比误判;
  • 黄油脆丝棒掰断镜没有记录 break_fraction、唯一 fracture_view_mode、同一根来源、两段长度守恒、断后宽厚保持、按断裂位置计算的半段长宽比、原始手势/断前投影尺度锚点和断裂前后相机深度锁,或错误把完整棒 4:1–5:1 套给每个半段、把约 6 × 2.5 cm 长外表面误画成断面;
  • 黄油脆丝棒人物手持/掰断镜没有声明 投影模式 与原视频真实 投影事实源;把失败图、未批准候选或畸变生成图再次作为人物/手/场景透视参考;或在 source_pixel_lock 下出现“推近镜头、紧贴镜头、占据前景、交替前推、贴到镜头前、极近景”等沿相机轴推进指令;
  • source_pixel_lock 结果相对投影事实源的脸框超出0.97–1.03、手掌框或双手联合框超出0.95–1.05、手脸比例偏差超过±5%、腕部中心位移超过画幅2%,或产品缩小却通过放大/前移整只手来补偿;
  • relative_pixel_resize 模式下没有记录唯一源帧、原始边界框、目标线性倍率、1.00 不变量与结果边界框,或让其他镜头承担当前镜头视觉尺寸;
  • 纯生成式编辑未经测量却宣称精确完成百分比缩放,或结果出现明显过缩、欠缩、整镜缩放、人物/盘子/独立袋比例漂移;
  • 包装尺寸、单根长度、实体片状微结构和盘中拓扑没有在同一结果中联合通过,或修正其中一项导致另一项回退;
  • 批准首帧可见黄油脆丝棒外盒,但 产品形态 或本镜专项 Prompt 漏写盒数、尺寸或状态;
  • 黄油脆丝棒变成光滑橙色基底上的贴图、印刷纹、划痕、浅浮雕、压花、均匀卷曲细线或其他非实体片状覆盖层;
  • 裸产品尚未用原尺寸局部与 细节.jpg 同尺度并排检查,或图生视频尚未检查运动中的微结构保持;
  • 产品形态仍用内部英文/字母标签;
  • 成年人物目标身份没有明显转移,仍接近原人物;
  • 头部相对肩宽、躯干或原构图明显过小/过大,或出现面具感、贴头感、颈肩断裂;
  • 在上一轮失败生成图上继续叠修,导致纹理、皮肤、包装文字或背景逐轮污染;
  • 吃食镜头的嘴唇、牙齿、手指与产品接触关系被换脸破坏;
  • 修好的镜头没有按 S 编号回填逐镜目录并重建分镜总览;
  • 未建立 planning/asset_reuse_plan.json,或没有先盘点人物/换脸库、产品/包装库、历史批准帧和旧 Word 画面就调用生图;
  • 历史批准资产可以满足新镜头却整批重生,或补生镜头没有合法原因、候选拒收记录和逐镜数量;
  • 人物与产品同时替换时只审核其中一层,或未记录 avatar/product 资产 ID、授权、状态与交叉像素保护区;
  • Word 图片数与复用/补生计划不一致,或使用非9:16、拼图、重复图、源视频占位帧、带源字幕水印图片或参考库图片冒充分镜;
  • 已明确启用 3000–4000 字长度契约时,任一镜少于 3000 个非空白字符,或以重复、无关约束和虚构细节凑长度;
  • 已明确启用长度契约时,任一镜超过当前契约上限(默认4000个非空白字符);
  • Prompt 压缩后遗漏已锁核心主体、核心动作、核心产品或本镜适用的活人感层,或仍存在可检测的整句重复填充;
  • Word 正文不是来自已经校验的总 TXT/逐镜 TXT,或 Word 标注字数与实际 Prompt 不一致;
  • DOCX 尚未渲染并逐页检查;
  • 镜内时间未从 0.00 秒开始;
  • 内部缺总 TXT、逐镜 TXT、角色锁定表、故事计划或内容语义审核报告;
  • 用户侧最终输出目录缺唯一 DOCX,或混入 TXT、JSON、Markdown、图片、审核表、对齐表、manifest 等非 DOCX 文件;
  • 把结构脚本结果描述成内容审核结论。
  • 候选仍带黑框、黑角、镜像/拉伸/高斯模糊补边,或未保存逐帧裁框报告;
  • 全片时间轴、硬切/动作关键帧、准确首帧或候选清单没有覆盖全部源镜头 S 编号,尤其是省略人物镜头;
  • 手持、盘装、桌放或盒装产品缺接触遮挡、受力证据或接触阴影,出现空气缝、穿模或悬浮。

Habilidades Relacionadas