Communitygithub.com

helloo1568/image-ppt

将书籍、PDF 或文字材料转化为精美可编辑 PPT 的 AI 工作流技能 | 三步流程:内容提炼 - 图片PPT生成 - 可编辑PPTX还原 | 推荐 Codex + GPT-Image 2.0

Was ist image-ppt?

image-ppt is a Claude Code agent skill that 将书籍、PDF 或文字材料转化为精美可编辑 PPT 的 AI 工作流技能 | 三步流程:内容提炼 - 图片PPT生成 - 可编辑PPTX还原 | 推荐 Codex + GPT-Image 2.0.

Funktioniert mitClaude CodeCodex CLI~Cursor
npx skills add helloo1568/image-ppt

In Ihrer bevorzugten KI fragen

Öffnet einen neuen Chat, in dem dieser Agent-Skill bereits geladen ist.

Dokumentation

图片PPT — 文字材料转可编辑PPT工作流(通用方法论)

Overview

本技能提供一套完整的三步工作流,将书籍 PDF、论文、报告等文字材料转化为精美且可编辑的 PowerPoint 演示文稿。工作流源自小黑盒社区教程(作者:玩家22186848),参考 B 站 UP 主「一往无前河井」的学术 PPT 制作思路,经泛化后适用于课堂汇报、读书分享、组会汇报、项目汇报、比赛路演等多种场景。

强烈推荐运行环境:Codex + GPT-Image 2.0。 Codex 负责文档读取、流程编排与 PPTX 拼装/还原(shell + python-pptx 一条龙);GPT-Image 2.0 负责绘制风格统一、文字精准的 PPT 页面。Step 1/2 的提示词中"image2图像生成模型"在 Codex 环境对应 GPT-Image 2.0,在 GPT/ChatGPT 环境对应其原生图像模型,在其他环境替换为实际使用的生图工具。

平台无关:这套方法论的核心是三段提示词 + 三步流程,可在任何具备「文档读取、图像生成、文件输出」能力的 AI 助手中使用(Codex、ChatGPT/GPT、Claude、Kimi、豆包、WorkBuddy、通义等)。执行时仅需将文中标注的通用能力映射到你当前使用的 AI 工具即可。

三段核心提示词存放于 references/prompts.md,按步骤引用。

Workflow Decision Tree

用户输入文字材料(PDF / 书籍 / 论文 / 报告 / 纯文本)
         │
         ▼
  ┌──────────────┐
  │ Step 1       │  内容提炼 + 风格设计
  │ 读懂材料      │  → 提炼核心内容
  │ 生成4套预览   │  → 生成4套风格预览图
  └──────┬───────┘
         │ 用户选定一套风格
         ▼
  ┌──────────────┐
  │ Step 2       │  图片版PPT生成
  │ 逐页生成图片  │  → 按选定风格逐页生成
  │ 合并为PPTX    │  → 合并为可下载 .pptx
  └──────┬───────┘
         │ 得到图片版PPT(不可编辑)
         ▼
  ┌──────────────┐
  │ Step 3       │  可编辑化还原
  │ 逐页拆解还原  │  → 图片层 + 可编辑文字层
  │ 输出可编辑PPTX│  → 输出可编辑 .pptx
  └──────────────┘

Step 1: 内容提炼与风格设计

目标

深入阅读并理解源材料,提炼核心内容;同时生成四套不同风格的 PPT 缩略预览图供用户选择。

执行步骤

  1. 读取源材料:读取用户提供的 PDF/文档。长文档分段读取并汇总要点。
  2. 提炼内容大纲:从材料中提取以下要素:
    • 作者背景、写作背景
    • 全书/全文结构
    • 主要观点、重点章节
    • 典型案例、经典语句
    • 现实意义与阅读启示
  3. 获取参考风格:询问用户是否有参考 PPT 模板图片。如有,分析该图片的配色、字体、版式风格。
  4. 生成四套风格预览:使用 AI 的图像生成能力,按 references/prompts.md 中的 Prompt 1 生成四套不同风格的 PPT 缩略预览图(类似幻灯片浏览视图布局)。四套方案内容结构一致,但主题颜色、排版方式和视觉风格需有区别。
  5. 暂停等待用户选择:展示四套预览图,请用户选定其中一套风格。

适配说明

  • Codex(推荐):用文档读取能力提炼内容,再调用图像生成(强烈推荐 GPT-Image 2.0)生成预览图。Prompt 1 中的"image2图像生成模型"对应 GPT-Image 2.0。
  • 具备原生图像生成能力的 AI(如 GPT):直接将源材料 PDF + 参考风格图片 + Prompt 1 一起发送,AI 会调用其图像模型生成预览。
  • 通过外部工具生图的 AI(如 Claude、WorkBuddy):先用文档读取能力提炼内容,再调用可用的生图工具生成预览图。Prompt 1 中的"image2图像生成模型"替换为实际使用的生图工具。

Step 2: 生成完整图片版PPT

目标

根据用户选定的风格模板,逐页生成完整的 PPT 页面图片,并合并为可下载的 .pptx 文件。

执行步骤

  1. 确认风格选择:记录用户在 Step 1 中选定的风格编号。
  2. 逐页生成图片:基于选定的风格模板和 Step 1 提炼的内容大纲,逐页生成 PPT 页面图片。每页突出一个核心观点,避免大段文字堆砌。
  3. 合并为 PPTX:将所有页面图片按顺序嵌入 16:9 幻灯片,生成 .pptx 文件(可借助 PPT 生成器、python-pptx 脚本或 AI 自带的文件输出能力)。
  4. 交付文件:将生成的 .pptx 文件交付给用户。

适配说明

  • Codex(推荐):循环调用图像生成(强烈推荐 GPT-Image 2.0)逐页绘制,再用 python-pptx 脚本合并为 .pptx。Prompt 2 中的"image2图像生成图片"对应 GPT-Image 2.0。
  • 具备原生图像生成能力的 AI(如 GPT):发送 Prompt 2(见 references/prompts.md),AI 会逐页生成并自动合并为 pptx。
  • 通过外部工具生图的 AI:手动编排——先循环调用生图工具生成每页图片,再用 PPT 生成器或 python-pptx 脚本合并。注意部分 AI 单次对话只能调用一次工具,需分多轮完成所有页面生成。

注意事项

  • 单次生图调用通常只能生成一张图片,多页 PPT 需要循环调用。
  • 生成顺序建议:封面 → 目录 → 各内容页 → 总结页 → 致谢页。
  • 每页生成时需在 prompt 中包含:选定风格描述 + 该页具体内容要点 + 页码信息。

Step 3: 图片版PPT还原为可编辑PPTX

目标

将 Step 2 产出的图片版 PPT(每页是一整张图片,不可编辑)还原为可编辑的 PPTX 文件,保留视觉质感的同时让主要文字可编辑。

执行步骤

  1. 逐页处理:将图片版 PPT 的每一页单独处理,每次最多处理 1-3 页,避免拆分效果下降。
  2. 识别页面结构:分析每页图片,将内容拆分为两个层次:
    • 复杂视觉资产层:品牌Logo、人物、插画、3D图、复杂背景、复杂图表等 → 裁切/提取为高清图片嵌入
    • 可编辑信息层:标题、副标题、正文、金句、关键数字、结论框文字、页码等 → 用 PPT 原生文本框重建
  3. 文字还原:将可编辑文字用 PPT 原生文本框重新制作,匹配原图的字体气质、字号层级、字重、颜色、行距、字距、对齐方式和位置。如需覆盖原图文字,先用背景色/局部遮罩遮盖原文字,再叠加新文本框,避免重影。
  4. 视觉还原:保持原图的版式比例、视觉重心、阅读顺序、留白节奏、颜色、对比度、明暗关系。
  5. 输出与对照:输出 16:9 可编辑 PPTX,同时渲染预览图与原图对照。如存在明显差距,继续迭代修改。
  6. 交付说明:完成后说明哪些元素被还原为可编辑文本、哪些保留为图片、是否存在字体替代。

还原指令

完整的逐页还原提示词见 references/prompts.md 中的 Prompt 3。该提示词采用"复杂视觉保真 + 主要文字可编辑"的混合还原策略。

适配说明

  • 具备原生图像拆解能力的 AI(如 GPT):上传图片版PPT + 发送 Prompt 3,AI 的图像功能可拆解组合图层元素,直接输出可编辑 PPTX。
  • Codex(推荐)
    1. 查看每页图片,识别文字内容和视觉元素结构
    2. 用图像处理库(如 Pillow)裁切复杂视觉区域为独立图片
    3. 用 python-pptx 或 pptxgenjs 构建 PPTX:背景图铺底 + 原生文本框叠加文字
    4. 逐页处理,每次 1-3 页
    5. 合并所有页面为最终 .pptx
  • 其他 AI(如 Claude、WorkBuddy):按上述 Codex 路径,将具体库/工具替换为当前环境可用者即可。

关键注意事项

  • 一页一页拆:每次最多处理 3 页,否则拆分元素效果不理想。
  • 避免双重显示:如果原图本身已含文字,必须先用背景色覆盖原文字再叠加文本框,否则会出现文字重影。
  • 字体替代:无法识别原图字体时,中文选用黑体/思源黑体/微软雅黑,英文选用最接近的无衬线/衬线字体。
  • 复杂视觉区域中的小字:如果单独拆分会破坏画面质感,可保留为图片,但需在最终说明中标注。

Resources

references/

  • prompts.md — 三段核心提示词原文(Prompt 1: 内容提炼与风格设计 / Prompt 2: 图片版PPT生成 / Prompt 3: 可编辑PPTX还原)

工具映射建议

执行时按当前 AI 环境选择对应能力:

通用能力可用的工具/技能示例
文档读取内置 PDF/文档阅读、MarkItDown、任何文件解析能力
图像生成原生图像模型(如 GPT Image)、Agnes、Midjourney、即梦、通义万相等
PPTX 构建AI 自带文件输出、python-pptx、pptxgenjs、WPS/Office 插件

适用场景

场景说明
大学课堂小组汇报读书分享、课程作业汇报
组会汇报文献汇报、研究进展汇报
项目汇报项目总结、方案展示
比赛路演创业计划书、项目路演
读书分享会书籍内容提炼与分享

Verwandte Skills