lilei0311/pixel-gaze

像素级凝视 Pixel Gaze — 4层视觉理解法:让AI像人一样分层看图,不再扫一眼就下结论 | A 4-layer visual comprehension methodology for AI agents

O que é pixel-gaze?

pixel-gaze is a Claude Code agent skill that 像素级凝视 Pixel Gaze — 4层视觉理解法:让AI像人一样分层看图,不再扫一眼就下结论 | A 4-layer visual comprehension methodology for AI agents.

Funciona com~Claude Code~Codex CLI~Cursor
npx skills add lilei0311/pixel-gaze

Installed? Explore more Programação e Desenvolvimento skills: steipete/bluebubbles, steipete/eightctl, steipete/blucli · View all 6 →

Perguntar na sua IA favorita

Abre um novo chat com esta habilidade de agente já pré-carregada.

Documentação

像素级凝视 — 4层视觉理解法

为什么需要这个技能

AI具备识别图中文字和细节的能力,但一次性扫视容易漏掉关键的小字、数字或状态。本技能通过分层处理机制,让AI像人类阅读一样逐层深入理解图片,而不是"看一眼就猜"。

核心方法:4层处理流程

每次分析图片时,严格按以下4层执行,不得跳层。

第一层:整体扫视

先建立对图片的整体认知:

  • 这是什么类型的内容?(截图/照片/图表/UI界面/文档/产品图...)
  • 画面分几个区域?各区域大致功能是什么?
  • 整体传达什么信息?

这一步不要求读清所有文字细节。 重点是建立全局地图。

第二层:识别精度敏感区

根据第一层的整体认知,判断哪些区域值得细看——这些地方读错会导致后续理解出错:

  • 数字类:价格、时间/倒计时、数量、编号、日期、金额
  • 状态/操作类:按钮文字、选中状态、开关状态、警示/错误提示
  • 关键小字:标注、脚注、版本号、单位、图例说明
  • 其他:你判断对回答用户问题很关键,但看起来偏小/偏密的文字

像侦探一样标记出"如果看错这里,整个回答就废了"的区域。

第三层:针对敏感区专门再看一遍

不要满足于第一层扫视时对这些区域的印象。像人类"凑近看清楚"一样:

  • 在回答前,专门在这些敏感区域上重新确认一遍具体内容
  • 不要直接用第一层扫视时的模糊印象作答
  • 对数字类内容额外做一次逻辑自查
    • 这个数字和上下文逻辑是否吻合?(货币符号、位数、单位)
    • 如果心里有两个可能的读数,选逻辑更合理的那个
    • 必要时在回答中说明存疑
  • 密集文字区域(表格、多行说明文字),可分段逐行确认,避免一次性扫视漏行

第四层:如实输出

  • 精读后的结果,优先于第一层扫视时的印象
  • 如果某处即使仔细看依然模糊不确定,直接说"这部分不确定/看不清",不要编造
  • 最终回答要把整体理解关键细节整合到一起
    • 不能只罗列细节丢了结构
    • 也不能只讲结构没有关键数字

快速判断规则

本技能的4层流程适用于所有需要从图片中获取精确信息的场景。但并非所有图片都需要同等深度的处理:

场景处理方式
需要从图中读取精确数字/文字/状态必须完整走4层
Agent自己生成的产出物(代码渲染截图、UI页面、前端页面)必须完整走4层,禁止因为"看着还行"就跳过
背景氛围图、纯装饰图、无精度诉求的展示图第一层扫视即可,按需进入第二层

特别警告:判断"这张图是否简单"这件事本身,恰恰是"扫一眼就下结论"的行为。在Agent前端自审场景中尤其危险——你很容易觉得"页面看着还行"而跳过细查。凡是涉及精度验证的图片,一律不给予快速通道。

与AI内置视觉能力的关系

本技能是叠加在AI已有视觉能力之上的行为方法论,不替代模型本身的识别能力。它改变的不是"能不能看清",而是"怎么看":

  • 所有具备图片输入能力的AI模型都可以使用本技能
  • 不同模型对文字的识别基础能力有差异,但4层流程在所有模型上均能叠加提升准确率
  • 本技能不依赖外部API或OCR工具,纯Prompt驱动,即装即用

使用场景

  • 用户发图让你识别内容、读取文字或数字
  • 对比两张图片的差异
  • 分析截图中的UI状态、表单内容
  • 读取产品包装、标签、票据上的信息
  • Agent前端自审:检查自己生成的页面渲染结果(这是本技能最具杀伤力的场景)
  • 任何需要从图片中获取精确信息的任务

注意事项

  • 核心原则:宁可说看不清,也不要编造一个看起来像的答案
  • 本技能是行为方法论,不依赖外部API或工具
  • 适用于所有具备视觉理解能力的AI Agent
  • 完整案例参见 references/ 目录:
    • case-agent-self-review.md:Agent前端自审场景(主打案例)
    • case-product-label.md:读产品标签场景(经典案例)

Habilidades Relacionadas