使用 Z.ai GLM-4.1V-thinking-flash 模型进行图片理解和分析。当用户需要分析图片内容、提取图片信息、描述图片细节、回答关于图片的问题,或进行任何形式的视觉理解任务时,必须使用此 skill。支持图片 URL 直接调用,返回结构化分析结果供主模型进一步处理。
Design & media
像素级凝视
Try it让AI像人一样分层看图,不再扫一眼就下结论。4层视觉理解法:整体扫视→识别精度敏感区→专门细看关键细节→如实输出。解决AI看图时漏读数字、错认状态、忽视小字等常见问题。当用户要求分析图片、识别图中内容、读取图中文字/数字、对比图片细节时触发。
What it does
让AI像人一样分层看图,不再扫一眼就下结论。4层视觉理解法:整体扫视→识别精度敏感区→专门细看关键细节→如实输出。解决AI看图时漏读数字、错认状态、忽视小字等常见问题。当用户要求分析图片、识别图中内容、读取图中文字/数字、对比图片细节时触发。
The skill document
像素级凝视 — 4层视觉理解法
为什么需要这个技能
AI具备识别图中文字和细节的能力,但一次性扫视容易漏掉关键的小字、数字或状态。本技能通过分层处理机制,让AI像人类阅读一样逐层深入理解图片,而不是"看一眼就猜"。
核心方法:4层处理流程
每次分析图片时,严格按以下4层执行,不得跳层。
第一层:整体扫视
先建立对图片的整体认知:
- 这是什么类型的内容?(截图/照片/图表/UI界面/文档/产品图...)
- 画面分几个区域?各区域大致功能是什么?
- 整体传达什么信息?
这一步不要求读清所有文字细节。 重点是建立全局地图。
第二层:识别精度敏感区
根据第一层的整体认知,判断哪些区域值得细看——这些地方读错会导致后续理解出错:
- 数字类:价格、时间/倒计时、数量、编号、日期、金额
- 状态/操作类:按钮文字、选中状态、开关状态、警示/错误提示
- 关键小字:标注、脚注、版本号、单位、图例说明
- 其他:你判断对回答用户问题很关键,但看起来偏小/偏密的文字
像侦探一样标记出"如果看错这里,整个回答就废了"的区域。
第三层:针对敏感区专门再看一遍
不要满足于第一层扫视时对这些区域的印象。像人类"凑近看清楚"一样:
- 在回答前,专门在这些敏感区域上重新确认一遍具体内容
- 不要直接用第一层扫视时的模糊印象作答
- 对数字类内容额外做一次逻辑自查:
- 这个数字和上下文逻辑是否吻合?(货币符号、位数、单位)
- 如果心里有两个可能的读数,选逻辑更合理的那个
- 必要时在回答中说明存疑
- 对密集文字区域(表格、多行说明文字),可分段逐行确认,避免一次性扫视漏行
第四层:如实输出
- 精读后的结果,优先于第一层扫视时的印象
- 如果某处即使仔细看依然模糊不确定,直接说"这部分不确定/看不清",不要编造
- 最终回答要把整体理解和关键细节整合到一起
- 不能只罗列细节丢了结构
- 也不能只讲结构没有关键数字
快速判断规则
本技能的4层流程适用于所有需要从图片中获取精确信息的场景。但并非所有图片都需要同等深度的处理:
| 场景 | 处理方式 |
|---|---|
| 需要从图中读取精确数字/文字/状态 | 必须完整走4层 |
| Agent自己生成的产出物(代码渲染截图、UI页面、前端页面) | 必须完整走4层,禁止因为"看着还行"就跳过 |
| 背景氛围图、纯装饰图、无精度诉求的展示图 | 第一层扫视即可,按需进入第二层 |
特别警告:判断"这张图是否简单"这件事本身,恰恰是"扫一眼就下结论"的行为。在Agent前端自审场景中尤其危险——你很容易觉得"页面看着还行"而跳过细查。凡是涉及精度验证的图片,一律不给予快速通道。
与AI内置视觉能力的关系
本技能是叠加在AI已有视觉能力之上的行为方法论,不替代模型本身的识别能力。它改变的不是"能不能看清",而是"怎么看":
- 所有具备图片输入能力的AI模型都可以使用本技能
- 不同模型对文字的识别基础能力有差异,但4层流程在所有模型上均能叠加提升准确率
- 本技能不依赖外部API或OCR工具,纯Prompt驱动,即装即用
使用场景
- 用户发图让你识别内容、读取文字或数字
- 对比两张图片的差异
- 分析截图中的UI状态、表单内容
- 读取产品包装、标签、票据上的信息
- Agent前端自审:检查自己生成的页面渲染结果(这是本技能最具杀伤力的场景)
- 任何需要从图片中获取精确信息的任务
注意事项
- 核心原则:宁可说看不清,也不要编造一个看起来像的答案
- 本技能是行为方法论,不依赖外部API或工具
- 适用于所有具备视觉理解能力的AI Agent
- 完整案例参见
references/目录:case-agent-self-review.md:Agent前端自审场景(主打案例)case-product-label.md:读产品标签场景(经典案例)
Related skills
使用 agnes-2.0-flash 多模态模型分析图片(看图 / OCR / 描述 / 识别)。当用户想用 agnes 或 agnes-2.0-flash 处理图片、把图片理解任务交给更便宜的 flash 模型、或需要与 app 中 agnes 模型结果一致时使用。运行 skill 目录下的 agnes_vision.py,将图片 base64 编码后调用 Agnes 的 OpenAI 兼容接口返回文本。
Ghost Eye 👁️ — Let any pure-text LLM see images through any vision model. OCR + visual summary in one shot.
Analyzes an uploaded photograph, provides detailed feedback on exposure, focus, composition, lighting, and suggests concrete camera settings and shooting technique. Generates a simulated improved image based on the recommendations.
Use the AutoGLM Image Recognition API to analyze and describe image content. Use this skill when the user needs image analysis, object or scene recognition,...
AI-powered pet eye anomaly detection from close-up facial images/video. Detects conjunctival redness, abnormal tearing/tear stains, and pupil/cornea opacity (cataract / corneal edema), then outputs anomaly alerts to help owners catch eye disease risks early. Scenarios: daily home health self-check, boarding center routine inspection, animal hospital triage, senior pet cataract monitoring. | 通过宠物摄像头捕捉宠物面部近景视频,利用AI视觉分析技术检测眼部充血(结膜颜色发红)、异常流泪(泪痕严重或持续性溢泪)、瞳孔区域浑浊(可能为白内障或角膜水肿)等异常征象,输出异常提示,帮助主人及早发现眼部疾病风险。适用于日常健康监测、老年宠物护理及宠物医院预检。应用场景:宠物家庭日常健康自检、宠物寄养中心巡检、宠物医院门诊初筛、老年宠物白内障监测。