让 agent 看图干活:多模态图片识别技能使用指南
公开图片 URL 加一句话要求,agent 返回内容描述、OCR 与视觉问答:批量读认证文字/主图差异/说明书参数的开口模板,附 Claude Code 实测触发截图。
本文目录 · 9 节
让 agent 看图干活:多模态图片识别技能使用指南
一堆商品图要读文字、要提炼卖点、要核对认证标识——人工看图又慢又漏。这个技能让 agent 收图片链接就能看:内容描述、图内文字(OCR)、视觉问答,批量化是它的真正价值。
实测:技能触发与 Key 检查
本机在 Claude Code 里真实触发过一次(截图为真实会话捕获):agent 读技能说明后检查 LinkFox API Key,未配置时如实提示。
在 WorkBuddy 图形界面里实测(2026-09-16)
WorkBuddy 是腾讯出品的图形界面版 AI 助手(和 Claude Code 一样属于"能装技能的那个软件",不用敲命令行)。把技能包装进它的技能目录后,新建任务、照上面的模板说一句话,它会真实加载技能、跑检查脚本,把"缺什么"说清楚。下面是本机实测(21 秒,消耗 0.76 积分):
它检查后如实汇报:
- 已就绪:脚本齐备:multimodal_recognize_image.py(识别主脚本)+ upload_image.py(本地图先上传换 24 小时有效的公网链接),无外部依赖;调用走 POST /multimodal/recognize-image,传 imageUrl 加一句 requirement(比如"识别商品品类与材质、颜色等属性标签")
- 阻断项:两个:一是 LinkFox API Key 没配(和其他 linkfox 技能同一把);二是你还没给它要识别的图
- 它给出的下一步:配一次 Key;图片二选一给:公网 URL(JPG/PNG/GIF/WebP/BMP)或本地图路径(它会先上传换链接再识别)。它还会主动提醒该接口按输入+输出动态计费,单次可能消耗较多积分
看图要点:回复底部有"已完成"耗时与积分消耗(模型 GLM-5.3-Flash);因为没配 Key,agent 没有编造数据,而是按技能规范停下来向用户要 Key——装对了技能就该是这个表现。
装好后,你可以这样开口
读认证文字:
用图片识别技能读这张图里的全部认证标识和参数文字,整理成表格(图片用你的公开图床链接)
主图差异分析:
用图片识别技能分别描述这三张竞品主图的构图、道具和卖点元素,对比我们这张差在哪。
说明书数字化:
用图片识别技能把这几张说明书照片里的参数逐项提出来,做成上架素材清单。
它支持什么(官方文档口径)
给一个公开可访问的图片 URL 加一句自然语言要求,多模态模型看图后返回文本结果。支持 JPG、JPEG、PNG、GIF、WebP、BMP。适合:图片描述、OCR 文字识别、视觉问答。
准备什么
- 装技能:
npx clawhub@latest install @linkfox-ai/linkfox-multimodal-recognize-image或用本站固定版本包(见文末)。 - LinkFox API Key:识别按量计费。
- 图片必须是公开 URL:本地图要先传到可公开访问的图床或对象存储。
出问题怎么办
- 提示图片无法访问:URL 不是公开可读的(带鉴权或内网地址),换公开链接。
- 识别结果太浅:把要求写具体("逐字读出左上角的认证编号"比"看看这图"好得多)。
安全注意
注册表扫描提示涉及公开文件上传、账号与计费。只传公开图片,别传含隐私或未发布商业机密的图——传出去的图会经平台处理。
配对资源
固定版本 v1.0.7 完整包点此打开本站资源页:多模态图像识别技能(免费下载)。
文字来源:开工科技原创教程。技能事实依据对应技能包内 SKILL.md(clawhub.ai 官方注册表固定版本,2026-09-16 安装并逐文件核对 SHA256)转述;实测截图为本机 Claude Code 与 WorkBuddy 会话真实捕获(WorkBuddy 为指定实测宿主)。