Communitygithub.com

ZJU-REAL/Easel

AI 视频生成:文生视频 / 图生视频 / 数字人首帧驱动。通过可插拔 provider(通义万相 Wan / 火山 Seedance / 快手可灵 / OpenAI 兼容)异步生成视频,用户自备 API key。当用户说 AI 视频生成、文生视频、图生视频、AI 生成视频、AI 短视频、让图片动起来、数字人视频、生成一段视频 时使用。与 video-strategy(选型/策略)、video-editing(剪辑处理)、clipify(切片)区别:本 SKILL 是从 0 用 AI 生成新视频。

¿Qué es Easel?

Easel is a Codex agent skill that aI 视频生成:文生视频 / 图生视频 / 数字人首帧驱动。通过可插拔 provider(通义万相 Wan / 火山 Seedance / 快手可灵 / OpenAI 兼容)异步生成视频,用户自备 API key。当用户说 AI 视频生成、文生视频、图生视频、AI 生成视频、AI 短视频、让图片动起来、数字人视频、生成一段视频 时使用。与 video-strategy(选型/策略)、video-editing(剪辑处理)、clipify(切片)区别:本 SKILL 是从 0 用 AI 生成新视频。.

Compatible con~Claude Code✓Codex CLI~Cursor
npx skills add https://github.com/ZJU-REAL/Easel/tree/HEAD/skills/openclaw/ai-video-gen

Preguntar en tu IA favorita

Abre un nuevo chat con esta habilidad de agente ya precargada.

Documentación

AI 视频生成

文生视频 / 图生视频 / 数字人首帧驱动。封装 shared/scripts/ai_video.py,多 provider 可插拔、异步提交→轮询→下载。用户自备 API key(在 .env 配置)。

前置:配置 API key

配置检查路径铁律:先 cd 到 AGENTS.md 末尾给出的 Easel 项目根,确认当前目录有 .env 和 skills/shared/scripts/,再运行注册表、check 或生成命令。不得改用 workspace 的 ./shared/scripts/...,也不得以 env / printenv 没显示变量为由判断未配置。

先选 provider 并在 .env 填对应 key,然后 check 离线校验:

python skills/shared/scripts/ai_video.py check --provider dashscope
provider服务需在 .env 配
dashscope阿里通义万相 WanDASHSCOPE_API_KEY(可选 DASHSCOPE_VIDEO_MODEL/DASHSCOPE_BASE_URL;兼容旧名 DASHSCOPE_MODEL)
ark火山引擎 SeedanceARK_API_KEY(可选 ARK_MODEL/ARK_BASE_URL)
kling快手可灵KLING_ACCESS_KEY + KLING_SECRET_KEY(JWT 鉴权)
openai-compatible通用 /videos 端点VIDEO_API_KEY + VIDEO_BASE_URL(可选 VIDEO_MODEL)
xhs-maas小红书内网 MaaS(happyhorse 文/图生视频)XHS_MAAS_API_KEY(可选 XHS_MAAS_VIDEO_BASE/XHS_MAAS_T2V_MODEL/XHS_MAAS_I2V_MODEL)。DashScope 风格异步 + api-key 头,内网直连
agnesAgnes(agnes-video-2.5-flash)AGNES_API_KEY(可选 AGNES_BASE_URL/AGNES_MODEL/AGNES_SIZE)。OpenAI Videos 兼容创建 + 自定义端点轮询;默认带原生音频(prompt 描述声音);外网走代理

也可设 VIDEO_PROVIDER 免去每次 --provider。

执行前先跑 model_registry.py configured --group video --env-file .env:只有一个可用就显式选它;多个可用且用户没点名时,列出 provider/模型询问本次使用哪个,不按默认值擅自选择。

输入

画幅确认硬门:用户或上游任务未明确横版/竖版(或 16:9/9:16/具体比例)时,任何生成/付费调用前必须追问并等确认;不得从平台、Profile 或脚本默认值静默推断。已明确则不重复问。

  • 文生视频:画面/镜头/风格描述(prompt)
  • 图生视频:一张输入图(本地路径或 URL)+ 可选运动描述
  • 可选:时长 --duration、画幅 --ratio(16:9 / 9:16 / 1:1)、模型 --model、原生音频 --audio auto|on|off

输出

生成的视频文件;必须用 -o 指定到 outputs/主题名/。异步任务自动轮询到完成再下载。

执行步骤

  1. 确认配置与能力:先运行 check,再运行 capabilities --provider <p> --model <m>。短剧不得根据品牌名猜测模型是否支持原生音频;新模型用 VIDEO_CAPABILITIES_JSON 登记能力和请求字段,无需修改调用流程。
    • probe-dialogue(短剧用):真发 1 次生成 + ASR,测该模型能否逐字忠实说出指定台词,判 dialogue_faithful 并缓存——短剧据此决定用原生对白,还是"无台词生成 + 后期配音"。用法 probe-dialogue --provider <p> --model <m>。
  2. 写好 prompt:AI 视频对 prompt 敏感,按 AI 视频提示词规范 写镜头、运镜、风格与时长。竖版短视频用 --ratio 9:16。
  3. 文生视频:
    python skills/shared/scripts/ai_video.py text2video --provider dashscope \
      --prompt "海边日落,慢镜头推进,暖色调,电影感" --ratio 9:16 --duration 5 \
      --audio auto \
      -o outputs/主题名/clip.mp4
    
  4. 图生视频 / 让图动起来 / 数字人首帧:
    python skills/shared/scripts/ai_video.py image2video --provider kling \
      --image outputs/主题名/cover.png --prompt "人物微笑挥手,头发轻微飘动" \
      -o outputs/主题名/clip.mp4
    
  5. 后续加工:生成的片段可交给 video_ops.py(拼接/加字幕/加 BGM/横竖转)、auto-subtitle(字幕)、tts-voiceover(配音)串成成片,或直接进 auto-short-video 端到端流程。

Profile 感知

  • 有 Profile:从 style.md 取视觉风格倾向注入 prompt;platforms.md 只用于给出画幅建议,不能替代用户确认。
  • 无 Profile:先确认横版/竖版,再按已确认比例生成。

注意

  • 视频生成 API 均为异步且耗时较长(数十秒到数分钟)+ 按量计费,先与用户确认。
  • 各 provider 的 model 名/字段各版本有差异,均可用 --model 或 env 覆盖;如报错对照官方最新文档调整。
  • --audio auto 只按 capability profile 映射已知字段;能力声明不等于质量保证,下载后仍须 ffprobe/ASR/视觉审计。网关默认有声但开关字段未知时,不猜测注入参数。

Individual skills in this repo

This repo contains 9 individual skills — each has its own dedicated page.

ZJU-REAL/Easel

通用音频处理:音频剪辑/裁剪、格式转码(mp3/wav/m4a/aac)、音量归一化、从视频提取音轨、多段拼接、淡入淡出、变速(保音高)。当用户说“剪音频”“裁一段”“转成 mp3”“调音量/响度”“提取音轨/扒音频”“拼接音频”“淡入淡出”“加速/减速音频”“变速不变调”时使用。与 audio-denoise 的区别:audio-denoise 专做降噪,audio-editing 做除降噪外的通用音频操作(也内置 denoise 作为兜底)。

ZJU-REAL/Easel

一句话主题 → 成品短视频:自动串联 文案→配图/AI视频→配音→字幕→BGM→合成,把 Easel 制作层零件编排成一条'一键出片'流水线。**单条视频、口播/资讯向,画面默认逐句配图 + Ken Burns 缓动,需要动态时才逐段图生视频**。当用户说 一键生成视频、自动做短视频、主题生成视频、帮我做条视频、口播视频一条龙、自动出片、短视频一键生成 时使用。**有剧情/角色/对白/反转/多集的短剧改用 short-drama(每镜强制图生视频、不用静态图冒充);只写脚本用 video-script;只生成单个片段用 ai-video-gen。**

ZJU-REAL/Easel

自动字幕 / 语音转字幕:把音频或视频里的语音识别成字幕文件(SRT/ASS/TXT/JSON),可选把字幕烧录进视频。当用户说自动字幕、语音转字幕、视频加字幕、上字幕、转录、听写、字幕文件、生成字幕、烧字幕时使用。

ZJU-REAL/Easel

音乐卡点视频 / 踩点视频:检测背景音乐的节拍,让图片或片段在节拍点上切换,配推进/白闪特效,做出燃系'卡点'短视频。当用户说 卡点视频、踩点视频、音乐卡点、节奏卡点、按音乐切换、鼓点视频、踩节奏、beat 卡点、图片卡点、卡点混剪 时使用。基于 shared/scripts/beatsync.py(librosa 节拍检测)。与 slideshow-video 区别:slideshow 每图固定时长、柔和转场,本 SKILL 切换点由音乐节拍决定、硬切踩点带特效。

ZJU-REAL/Easel

Easel clipify: long English talk → punchline cuts → optional 16:9→9:16 face-pan/split → opus word-by-word ASS burn. Ships scripts + assets/preview.png. Part of 1.6k★ Easel suite.

ZJU-REAL/Easel

>- 通用图像处理加工:改尺寸/缩放、裁剪、补边适配平台尺寸、格式转换(png/jpg/webp)、 压缩到目标大小、加文字或图片水印、圆角、多图拼接、生成缩略图、读图片信息。 基于 image_ops.py 确定性处理。 使用时机:用户说"改尺寸"、"缩放图片"、"裁剪"、"压缩图片"、"加水印"、"转格式"、 "圆角"、"拼图/多图联排"、"缩略图"、"适配小红书/朋友圈尺寸"、"把图 pad 成 1:1"。 和 card-*(卡片类)的区别:card-* 是"HTML 设计→渲染出图", image-editing 只加工已有图片,不负责视觉设计。

ZJU-REAL/Easel

多角色对话配音:按 cast 和逐行对白为不同角色分配音色与情绪,合成多声线音轨和带角色名字幕。 当用户说“多角色/双人/剧本/对话配音、多人对白、不同角色不同声音、有声剧配音”时使用。 单一公共音色用 tts-voiceover;克隆本人音色用 voice-clone;整部短剧制作由 short-drama 编排。

ZJU-REAL/Easel

Easel video-highlights: CN/livestream highlight extract + stable static vertical reframe (sibling to clipify).

ZJU-REAL/Easel

>- 视频制作策略与工具选型:AI 视频生成模型对比、视频脚本结构设计、制作流程规划,覆盖产品演示/解说/社媒短视频场景。 当用户说"视频怎么做""视频选型""用什么工具做视频""视频制作流程""视频策略""视频系列规划"时使用。 和 video-script 的区别:video-strategy 做内容规划与工具选型,video-script 写具体某条视频的脚本。

Skills relacionados