电影连续运动提示词
把创意转译成可生成、可验证的导演调度。默认使用中文自然语言;精度来自具体画面事实、动作因果、物理反馈、音画时序和明确终态,不来自空泛形容词或平台格式堆叠。
先判定任务与精度
输入关系
先识别最接近的输入模式:
- 无参考生成:从文字建立完整音画时间线。
- 首帧驱动:参考图是第0秒,按“首帧锚定 → 动作启动 → 连续发展 → 结果或反应”向前发展。
- 首尾帧驱动:两张图分别锁定开始和结束,重点写可观察的中间路径与逐步收敛过程。
- 尾帧驱动:从合理前置状态出发,逐渐落到参考图规定的构图和状态。
- 多模态参考:图片、视频、音频分别承担身份、场景、风格、动作、运镜、构图、声线或关键帧职责。
- 参考图先行:先设计适合继续运动的首帧图片,再依据用户实际生成并确认的图片重写视频提示词。
- 提示词审查/失败修复:识别最早的因果错误、冲突或过载点,再重写完整可复制版本。
再选择拍摄组织:连续一镜到底、动作匹配分镜、参考图演化、手机原生实拍、人物微表演、成年克制亲密互动。不要把一镜到底、FPV、航拍或复杂运镜视为天然更高级。
精度档位
- 常规模式:自动选择真正影响画面的参数,重点写可见结果。
- 高精度模式:用户说“详细提示词”“尽可能详细”“完整提示词”“完整导演版”“导演级”等近似表达时启用。允许长提示词,但每句话必须对应画面事实、连续性要求或真实失败风险。
高精度模式若缺少摄影设定,先用普通语言询问期望效果,如空间开阔或压迫、人物亲近或疏离、背景清晰或虚化、手持或稳定、纪实或精致;再把答案转译为设备类别、焦段、光圈、景深、对焦与运动参数。不要要求用户先懂专业参数。若题材已经明确为手机、无人机、监控或纪录片,直接服从相应设备逻辑。
使用三层架构
1. 静态视觉层
从以下要素中选择真正影响生成的字段,不机械填表:
- 时间:年代、季节、时刻。
- 主体:身份、年龄、外貌、体态、服装、材质、道具、初始姿态。
- 场景:自然环境、建筑结构、天气、陈设、空间关系与生活痕迹。
- 摄影:风格、画幅、构图、机位、角度、透视、焦点、景深、光源、光向与色彩。
摄影机品牌、具体焦段和光圈只有在能解释透视、景深或成像质感且不与设备模式冲突时才写。
2. 动态连续层
每个关键动作按完整状态链书写:
初始状态 → 可见触发 → 准备 → 启动 → 过程 → 身体/道具/衣料/环境反馈 → 减速或停止 → 可验证终态
人物重心、视线、手部、道具状态与摄影机路径必须共享同一空间逻辑。已完成的动作不重复,物体不能无因出现、消失、换手或改变材质。
3. 音画同步层
分别处理环境底噪、动作音、人物非语言声音、对白/画外音和配乐。每个关键声音都要说明来源、距离、触发动作、起止、强弱和空间变化。不要无条件加入配乐。
完整模板和检查表见 references/prompt-framework.md。
锁定不变量与参考职责
动笔前确定:
- 身份或结构不变量;
- 初始空间、构图和光向;
- 摄影机起点、路径和终点;
- 主体动作与心理因果;
- 距离变化带来的可见细节;
- 风、衣料、头发、阴影、反射和声音反馈;
- 可验证尾帧与下一镜接口。
多模态参考必须建立职责表。每份素材只承担明确职责,可有多个职责但不得含糊地要求“全部参考”:
| 素材 | 可分配职责 |
|---|---|
| 图片 | 身份、服装、产品外观、场景、构图、风格、首帧、关键帧、尾帧 |
| 视频 | 动作、运镜、剪辑节奏、时间结构、源视频编辑或续写 |
| 音频 | 原声复用、声线、说话方式、节奏、音乐风格、声音连续性 |
区分“必须完整保留、允许局部变化、仅迁移某项属性、只作宽泛气氛参考”。这是内部检查语言,不强制输出MiniMax H3的专用字段或英文标签。
解决冲突
检查身份、年龄、五官、发型、服装、时间、空间、光向、设备、景深、运镜、左右手、动作顺序、对白时机和终态。
优先级:
用户明确指定的参考图事实 > 用户当前明确指令 > 全局统一设定 > 多次重复且一致的描述 > 时间线局部描述 > 氛围修辞
能判断时主动统一,并在导演判断中简短说明;两个版本同等关键且会改变成片时才询问。最终可复制提示词中不得保留互斥设定。
组织时间线与镜头
先用语义节拍组织动作,再在用户给定时长、切点、对白同步或平台需要时映射到秒数。每个节拍写清当前空间、动作准备、动作过程、反馈、终点和下一触发。
运镜必须能还原为:
运动类型 + 幅度 + 速度 + 运动目标 + 停止状态
区分摄影机主运动与小幅人体/载具微扰。推进、横漂和高度起伏可以融合为一条运动曲线,但不能作为同等强度的并行指令。轻微景别或角度变化优先连续运镜;切镜必须带来新空间、新时间、新信息、新状态或必要的动作匹配。
距离、表演与物理反馈
- 远景写规模、方向和空间关系。
- 中景写姿态、重心、服装轮廓与人物关系。
- 近景写眼动、眨眼、呼吸、嘴角、接触点与衣料受力。
- 特写才写毛孔、绒毛、粉感、微瑕疵、玻璃反射或金属划痕。
表情必须由事件触发:刺激 → 察觉 → 眼神/呼吸先变化 → 头部或身体反应 → 确认 → 情绪回落 → 最终姿态。
接触必须先建立接触点与受力,再写对方或物体反馈、重心变化、衣料变化和停止状态。复杂机械同样要写锁定、受力、运动、减速和停稳。
参考图先行工作流
用户要求先做首帧或参考图时,读取 references/prompt-framework.md 的“参考图先行”章节并执行:
- 输出简洁导演判断;
- 输出独立、完整、可复制的图片提示词;
- 让首帧处于动作即将发生或刚开始的开放状态,而不是动作完成后的封闭海报姿态;
- 为手脚、道具、视线、运动方向、前后景视差和摄影机路径保留空间;
- 用户提供实际生成图后,以图片中可见事实为新基准,建立图像—视频一致性表并重写视频提示词。
不要在用户尚未提供最终首帧时假装已锁定其具体构图。
专项模式
- 手机原生、POV、人物微表演、成年克制亲密互动或对白任务,读取 references/precision-writing-guide.md。
- 学习用户提供的优秀样本或需要相似语言密度时,读取 references/exemplar-library.md。
- 需要了解影视飓风框架、现有方法与MiniMax H3官方方法的取舍时,读取 references/method-comparison.md。
- 更新本Skill或验证新规则时,读取 references/regression-suite.md。
输出合同
除非用户明确要求简版,默认交付:
- 导演判断:核心事件、视觉重点、动作因果、运镜选择、最大生成风险;保持简洁。
- 可直接复制的完整提示词:中文为主,按播放顺序写完整;不得出现“其余不变”“同上”“参考前文”或省略号替代正文。
- 稳定重试版:仅在人物过多、动作过密、多手交接、复杂运镜、多参考素材或其他高风险组合时提供;减少并发动作但不改变叙事结论。
提示词内部可根据任务使用标题和分段,但不要强制所有平台采用MiniMax H3的英文三段式、六段式、<Subject N>、<Picture N>或<d>语法。用户明确要求H3官方格式时才按其格式转换。
详细禁止项
禁止项可以详细,但必须逐条对应当前镜头的真实风险,先写足正向状态,再按类别补充:
- 身份、面貌、服装与结构漂移;
- 肢体、手指、脚部、接触点和受力错误;
- 道具数量、材质、位置和状态突变;
- 动作重复、倒序、无触发、无终点或多人同步僵化;
- 摄影机跳变、错误变焦、无因反向、自动切镜和随机抖动;
- 建筑、机械、车辆与空间结构软化、复制或穿模;
- 光向、阴影、反射、天气和环境连续性错误;
- 声画错位、口型异常、声音提前、滞后或重复;
- 风格污染、错误景深、过度磨皮、商业精修、CG或3D感;
- 乱码文字、字幕、Logo、二维码和水印。
允许长,但禁止同义反复和与当前镜头无关的通用负面词堆积。
完成前自检
- 三层信息是否一致,且都服务同一核心事件?
- 每份参考素材的职责是否明确且无歧义?
- 首帧是否具有可动空间,首尾帧之间是否有可观察路径?
- 摄影机是否是一条可执行曲线,参数是否与设备模式一致?
- 每个动作是否有触发、准备、反馈、停止和终态?
- 景别变化是否带来正确层级的细节?
- 对白、动作声和环境声是否与距离和发生帧同步?
- 尾帧是否明确,并能自然进入下一镜?
- 禁止项是否精确、分类清晰且没有替代正向描述?