像素级凝视 — 4层视觉理解法
为什么需要这个技能
AI具备识别图中文字和细节的能力,但一次性扫视容易漏掉关键的小字、数字或状态。本技能通过分层处理机制,让AI像人类阅读一样逐层深入理解图片,而不是"看一眼就猜"。
核心方法:4层处理流程
每次分析图片时,严格按以下4层执行,不得跳层。
第一层:整体扫视
先建立对图片的整体认知:
- 这是什么类型的内容?(截图/照片/图表/UI界面/文档/产品图...)
- 画面分几个区域?各区域大致功能是什么?
- 整体传达什么信息?
这一步不要求读清所有文字细节。 重点是建立全局地图。
第二层:识别精度敏感区
根据第一层的整体认知,判断哪些区域值得细看——这些地方读错会导致后续理解出错:
- 数字类:价格、时间/倒计时、数量、编号、日期、金额
- 状态/操作类:按钮文字、选中状态、开关状态、警示/错误提示
- 关键小字:标注、脚注、版本号、单位、图例说明
- 其他:你判断对回答用户问题很关键,但看起来偏小/偏密的文字
像侦探一样标记出"如果看错这里,整个回答就废了"的区域。
第三层:针对敏感区专门再看一遍
不要满足于第一层扫视时对这些区域的印象。像人类"凑近看清楚"一样:
- 在回答前,专门在这些敏感区域上重新确认一遍具体内容
- 不要直接用第一层扫视时的模糊印象作答
- 对数字类内容额外做一次逻辑自查:
- 这个数字和上下文逻辑是否吻合?(货币符号、位数、单位)
- 如果心里有两个可能的读数,选逻辑更合理的那个
- 必要时在回答中说明存疑
- 对密集文字区域(表格、多行说明文字),可分段逐行确认,避免一次性扫视漏行
第四层:如实输出
- 精读后的结果,优先于第一层扫视时的印象
- 如果某处即使仔细看依然模糊不确定,直接说"这部分不确定/看不清",不要编造
- 最终回答要把整体理解和关键细节整合到一起
- 不能只罗列细节丢了结构
- 也不能只讲结构没有关键数字
快速判断规则
本技能的4层流程适用于所有需要从图片中获取精确信息的场景。但并非所有图片都需要同等深度的处理:
| 场景 | 处理方式 |
|---|---|
| 需要从图中读取精确数字/文字/状态 | 必须完整走4层 |
| Agent自己生成的产出物(代码渲染截图、UI页面、前端页面) | 必须完整走4层,禁止因为"看着还行"就跳过 |
| 背景氛围图、纯装饰图、无精度诉求的展示图 | 第一层扫视即可,按需进入第二层 |
特别警告:判断"这张图是否简单"这件事本身,恰恰是"扫一眼就下结论"的行为。在Agent前端自审场景中尤其危险——你很容易觉得"页面看着还行"而跳过细查。凡是涉及精度验证的图片,一律不给予快速通道。
与AI内置视觉能力的关系
本技能是叠加在AI已有视觉能力之上的行为方法论,不替代模型本身的识别能力。它改变的不是"能不能看清",而是"怎么看":
- 所有具备图片输入能力的AI模型都可以使用本技能
- 不同模型对文字的识别基础能力有差异,但4层流程在所有模型上均能叠加提升准确率
- 本技能不依赖外部API或OCR工具,纯Prompt驱动,即装即用
使用场景
- 用户发图让你识别内容、读取文字或数字
- 对比两张图片的差异
- 分析截图中的UI状态、表单内容
- 读取产品包装、标签、票据上的信息
- Agent前端自审:检查自己生成的页面渲染结果(这是本技能最具杀伤力的场景)
- 任何需要从图片中获取精确信息的任务
注意事项
- 核心原则:宁可说看不清,也不要编造一个看起来像的答案
- 本技能是行为方法论,不依赖外部API或工具
- 适用于所有具备视觉理解能力的AI Agent
- 完整案例参见
references/目录:case-agent-self-review.md:Agent前端自审场景(主打案例)case-product-label.md:读产品标签场景(经典案例)