Communitygithub.com

Akira-TL/akira-video-skills

设计并维护 AI 视频中跨镜头复用的角色声音、音色参考、对白声音要求与整片声音关系;当同一角色需要跨镜头保持声音一致,或需要规划语音参考、环境声、音效、音乐与画面的职责边界时使用。

Qu'est-ce que akira-video-skills ?

akira-video-skills is a Claude Code agent skill that 设计并维护 AI 视频中跨镜头复用的角色声音、音色参考、对白声音要求与整片声音关系;当同一角色需要跨镜头保持声音一致,或需要规划语音参考、环境声、音效、音乐与画面的职责边界时使用。.

Compatible avec~Claude Code~Codex CLI~Cursor
npx skills add https://github.com/Akira-TL/akira-video-skills/tree/HEAD/skills/video/video-audio

Demander à votre IA préférée

Ouvre une nouvelle conversation avec cette compétence d'agent déjà préchargée.

Documentation

Video Audio

本 Skill 负责视频制作中的声音设计与跨镜头声音一致性,但不建立独立的项目级 audio/ 目录。

长期复用声音资料放在 video/materials/ 下,例如:

  • video/materials/voices/CHR01_voice.md
  • video/materials/voices/CHR01_reference.wav

某个镜头独有的对白、呼吸、音效或临时声音继续放在对应 video/shots/<shot-id>/;全片音乐、旁白、混音和最终声音工程进入 video/edit/。

完整声音层次、原生生成声音与后期声音的职责边界见 references/SOUND-LAYERS.md。视频需要背景音乐、品牌 / 角色动机、Animatic 临时音乐或 AI 生成配乐时,再读取 references/MUSIC.md:临时与正式音乐明确分开,音乐服务故事 / 对白 / 产品,不为了卡点破坏人物节奏。存在叙述者、角色内心画外音、品牌旁白或说明性 Voice-over 时,再读取 references/VOICEOVER.md:旁白文本归 video-script,声音身份 / 生成归本 Skill,最终整片旁白进入 video/edit/。

1. 先区分三类声音

角色长期声音

跨镜头需要稳定的年龄感、性别表现、音域、音色、共鸣位置、默认语速、音量感、节奏以及发音和停顿习惯。

镜头专属声音

只属于某个镜头的对白、呼吸、叹气、叫喊、脚步、物体碰撞和环境变化跟随镜头,不复制到公共声音定义。

整片声音

背景音乐、全片旁白、总体声音设计与最终混音只在进入后期时由 video-editing 管理。

2. 角色声音设计

角色有多镜头对白时,先建立声音定义,再生成或录制具体台词。角色声音定义至少写清当前项目需要的:年龄感、基础音域、音色、共鸣、默认语速、默认音量、说话节奏、发音特点、不同情绪下的变化以及禁止出现的声音漂移。

详细模板见 references/VOICE-DESIGN.md。

3. 声音身份与情绪分开

同一角色跨场景和跨世界时可以改变混响、环境空间感、轻微均衡、当前情绪和当前说话强度,但基础年龄感、基础音色、音域、发音习惯和核心节奏不应随机改变。

如果生成工具提供 speaker ID、voice reference、voice seed、speaker embedding 或等价稳定机制,优先复用同一身份机制;具体字段由当前工具 / 模型官方规则决定,本 Skill 不写死。

4. 对白与画面

对白时长、可见口型、多角色说话和声音跨镜头的规划属于 video-script;当前任务确实需要这部分时按需加载该 Skill,缺失则交回 akira-video 补齐,而不是在本 Skill 复制脚本规则。本 Skill 只负责声音身份与当前声音表演。

对白文本继续由 video-script 拥有;本 Skill 只负责声音表现。需要同步语音的视频模型时,把对白、语气、停顿和声音事件编译进生成提示词,但不为了模型支持原生声音就增加原本不存在的台词。

5. 有意无声

较长无对白段落如果由悬念、危险、音乐、视觉高潮或动作本身承担叙事,应在 SHOT.md 中写清无声的导演目的。如果人物长时间主动操作却没有对白、反应声、环境声或音乐承担叙事,交回 video-shot 检查是否形成死段。

6. 需要外部声音生成时

把角色声音定义、当前台词、参考音频和返回命名交给 video-generation,由它按一次性生成包契约整理;本 Skill 不自行建立另一套打包目录或临时文件规则。

7. 返回审片与后期

  • 声音身份漂移、口型、语气、音域和时序由 video-review 审核;
  • 镜头独有音频留在镜头;
  • 全片音乐、混音、字幕和最终声音电平由 video-editing 处理。

完成标准

角色声音已经能够跨镜头稳定识别;镜头声音与整片声音职责清楚;没有为了目录分类而复制音频,也没有把工具专用 speaker 参数误写成通用规则。

Individual skills in this repo

This repo contains 12 individual skills — each has its own dedicated page.

Akira-TL/akira-video-skills

为 Runway 当前视频模型编译和检查生成提示词;当 video-generation 需要使用 Runway(当前主线 Gen-4.5)的 Text to Video 或 Image to Video,并需要 Runway 专用动作、摄影和时序表达时使用。

Akira-TL/akira-video-skills

为 ByteDance / BytePlus Seedance 当前视频模型编译和检查提示词;当 video-generation 需要使用 Seedance 2.5 的参考素材、时间线、同步声音、视频编辑、延长或多镜头能力时使用。

Akira-TL/akira-video-skills

为 Google Veo 视频生成编译和检查提示词;当 video-generation 需要使用 Veo 的 Text to Video、Image to Video、首尾帧、参考元素或同步声音能力时使用,并先核验具体 Google 使用入口与 model 的当前支持范围。

Akira-TL/akira-video-skills

进入并持续推进一个 AI 视频制作项目;读取或建立 VIDEO.md,根据当前视频脚本、复用素材、镜头、生成结果和整片后期状态,按需路由到 canonical 视频专业 Skill,而不是把所有制作规则塞进一个总提示词。

Akira-TL/akira-video-skills

为品牌短片、产品植入剧情、广告或比赛作品建立产品事实与广告边界;当视频需要准确表达某个具体产品的官方功能、参数、结构、使用方式、品牌素材或产品与剧情关系时使用。

Akira-TL/akira-video-skills

设计 AI 视频中的角色与场景视觉方案;当脚本只说明“需要一个什么样的人/场景”,但还没有形成可稳定生成的外形、服装、材质、色彩、空间、光线和视觉识别系统时使用。

Akira-TL/akira-video-skills

组织整片级剪辑、合成、全片声音和最终成片;当多个已采用镜头需要进入 Premiere Pro、After Effects、DaVinci Resolve 等后期工程,或需要整片字幕、Logo、音乐、混音、比例版本和最终导出时使用。

Akira-TL/akira-video-skills

为 AI 图片或视频生成准备可直接使用的提示词与一次性生成包,并在用户把生成结果带回项目后归档;当需要从正式视频脚本、复用素材和 SHOT.md 编译生成内容、选择参考素材、约定返回文件名或清理临时包时使用。

Akira-TL/akira-video-skills

规划、创建、整理和维护多个镜头会重复使用的视频复用素材;当需要人物/场景/道具/产品提示词、参考图、官方素材、身份与状态参考或其他可重复引用内容时使用。

Akira-TL/akira-video-skills

审核 AI 生成的人物/场景等复用素材或镜头生成结果,判断采用、修改提示词、重生成还是留给后期修复;当生成结果返回项目、需要检查身份/结构/连续性/动作/摄影/产品真实性或选择生成结果时使用。

Akira-TL/akira-video-skills

把小说、章节、故事梗概、品牌 brief 或其他上游内容转换成当前视频自己的脚本层;当需要编写或修订 SCRIPT.md、视频人物表演定义、场景定义、对白或镜头总表时使用。

Akira-TL/akira-video-skills

把 SHOTS.md 中的镜头总览展开成可直接制作的单镜头定义;当需要创建或修改 video/shots/<shot-id>/SHOT.md、镜头连续性、摄影、动作、表演、声音或镜头专属生产约束时使用。

Skills associés