使用 Agnes AI 升级版图像生成模型 agnes-image-2.1-flash 生成图片。同时支持文生图(text-to-image)与图生图(image-to-image)。当用户说「用 Agnes 生成图片」「用 Agnes 画一张」「Agnes 生成」「用这张图生成/改成……」或明确要求使用 Agnes API 进行文生图/图生图时,加载本 skill。不消耗 WorkBuddy 积分,仅消耗 Agnes API 额度(当前图像生成免费)。
Coding
Agnes Vision
Try it使用 agnes-2.0-flash 多模态模型分析图片(看图 / OCR / 描述 / 识别)。当用户想用 agnes 或 agnes-2.0-flash 处理图片、把图片理解任务交给更便宜的 flash 模型、或需要与 app 中 agnes 模型结果一致时使用。运行 skill 目录下的 agnes_vision.py,将图片 base64 编码后调用 Agnes 的 OpenAI 兼容接口返回文本。
What it does
使用 agnes-2.0-flash 多模态模型分析图片(看图 / OCR / 描述 / 识别)。当用户想用 agnes 或 agnes-2.0-flash 处理图片、把图片理解任务交给更便宜的 flash 模型、或需要与 app 中 agnes 模型结果一致时使用。运行 skill 目录下的 agnes_vision.py,将图片 base64 编码后调用 Agnes 的 OpenAI 兼容接口返回文本。
The skill document
Agnes Vision Skill
通过 Agnes 的 agnes-2.0-flash 多模态模型分析图片,把模型返回的文本拿来用。
何时使用
- 用户明确要求用 agnes / agnes-2.0-flash 处理图片
- 想用更便宜/更快的 flash 模型批量看图
- 需要与 app 中 agnes 模型保持一致的图片理解结果
- OCR、图片描述、物体识别等任务,且希望走 agnes 接口
注意:Claude Code 本身已能用 Read 工具直接看图。本 skill 仅在需要走 agnes 接口时使用,不要替代 Read 用于普通看图。
如何使用
在项目根目录运行 skill 脚本(工作目录默认就是项目根,用相对路径):
python .claude/skills/agnes-vision/agnes_vision.py <图片路径> [<图片路径> ...] [-p "提示词"]
参数:
图片路径:至少一张图片,支持多张-p / --prompt:给模型的提示词(默认“请详细描述这张图片的内容。”)-m / --model:模型名(默认agnes-2.0-flash)-k / --key:API key(也可用环境变量或 config.json)--max-tokens:最大输出 token(默认不设)
脚本的 stdout 就是模型的回答,错误信息走 stderr。直接读 stdout 即可。
API Key 配置
按优先级查找:
--key参数- 环境变量
AGNES_API_KEY - skill 目录下
config.json:{"api_key": "...", "model": "...", "endpoint": "..."}
⚠️ 真实 key 不要写进 SKILL.md,不要提交到 git。推荐环境变量;用 config.json 的话已被 .gitignore 忽略。
工作流
- 确认图片路径存在(必要时用 Glob/Read 找)
- 根据任务构造合适的提示词(OCR 要“保持原文”、提取数据要“输出表格”等)
- 运行脚本,读取 stdout 即模型回答
- 把回答整合进给用户的回复;如需追问,带上图片再次调用
示例
# 描述一张图
python .claude/skills/agnes-vision/agnes_vision.py photo.jpg
# 自定义提示词:把图表数据提取成表格
python .claude/skills/agnes-vision/agnes_vision.py chart.png -p "把图表里的数据提取成 markdown 表格"
# 多张图对比
python .claude/skills/agnes-vision/agnes_vision.py a.png b.png -p "对比这两张图的差异"
# OCR
python .claude/skills/agnes-vision/agnes_vision.py receipt.jpg -p "识别图中所有文字,保持原文排版"
备注
- 脚本会把图片以 base64 data URL 形式发送到
https://apihub.agnes-ai.com/v1/chat/completions,属于把图片内容上传给第三方服务,敏感图片慎用。 - 脚本仅用 Python 标准库,无需 pip install。
- 首次运行若被沙箱拦截网络,需允许该次调用访问
apihub.agnes-ai.com。
Related skills
调用 Agnes Image 2.1 Flash 生成图像,支持文生图、图生图、URL / Base64 输出。当用户说"帮我生成一张图"、"文生图"、"图生图"、"把这张图改成 XX 风格"时触发。
使用 Z.ai GLM-4.1V-thinking-flash 模型进行图片理解和分析。当用户需要分析图片内容、提取图片信息、描述图片细节、回答关于图片的问题,或进行任何形式的视觉理解任务时,必须使用此 skill。支持图片 URL 直接调用,返回结构化分析结果供主模型进一步处理。
基于多模态AI的图片识别与分析。当用户想分析、描述、从图片URL中提取信息、image recognition, image analysis, image description, image content understanding, OCR text recognition, visual Q&A时触发此技能。当用户提到图片识别、图片分析、图片描述、识别图片内容、分析产品图、从图片中读取文字、描述图片、提取视觉内容或理解照片内容时触发。当用户提供图片URL并就其视觉内容提问时,即使未明确说"图片识别",也应触发此技能。
免费AI模型配置领域负载物。标准化Agnes AI、智谱、商汤、小米、美团等平台的免费模型配置流程,支持文本/图像/视频/音频生成、语音识别(ASR)与信息图生成,及灵活多模态路径(单条、组合、批量生成与拼接)。核心:API Key管理、接口配置、模型选择、多模态生成(Agnes AI特有,采用基本命令组合复杂命令架构)、音频生成(简单合成+TTS语音合成)、语音识别与合成(ASR/TTS,含音色克隆/音色设计)。6域24种任务。触发词:模型配置、免费模型、API配置、模型设置、AI模型、图像生成、视频生成、音频生成、语音识别、语音合成、音色克隆、信息图生成、TTS配音、音视频合并、meta-
让AI像人一样分层看图,不再扫一眼就下结论。4层视觉理解法:整体扫视→识别精度敏感区→专门细看关键细节→如实输出。解决AI看图时漏读数字、错认状态、忽视小字等常见问题。当用户要求分析图片、识别图中内容、读取图中文字/数字、对比图片细节时触发。