dsh-vision
在终端中运行以下命令:
dsh plugin install joyiok/dsh-vision
将以下提示词粘贴到 DeepSeek Harness 对话框中:
在 DeepSeek Harness 中执行 dsh plugin install joyiok/dsh-vision 即可安装该识图插件,源码仓库地址为 https://github.com/joyiok/dsh-vision,安装后重启 dsh web 即可生效。
插件介绍
DeepSeek Harness 的 Agent 跑着跑着就可能碰上一张截图、一个设计稿、一张报错界面——但主模型是纯文本的,看不了图。dsh-vision 正是为这个缝隙而生:它给 Agent 装上一双眼睛,让任何不支持多模态输入的文本模型也能"看图说话"。
安装后,Agent 获得一个 image_analyze 工具。只需传入本地路径、http(s) 链接或 data URL(最多 4 张),插件便会在内存中将图片转为 base64,转发给 OpenAI 兼容的视觉模型接口,再将文字分析结果交还主模型继续推理。默认走 OpenRouter 上的 Gemini Flash 系列,支持 png、jpeg、gif、webp 格式;你也可以通过参数覆盖模型、调整输出长度、指定分析方向,比如"检查这段 UI 有没有对齐问题"。网络层面内置了 429 / 5xx 自动重试和 AbortSignal 超时控制,确保在批量任务中不会卡死或丢失上下文。
如果你在用 DeepSeek、Llama 这类纯文本大模型作为 Harness 主脑,又希望 Agent 在自动化流程中具备基本的视觉理解能力——读截图、看报表、审界面——dsh-vision 是一个轻量且低摩擦的补位方案。
使用场景
- 主模型无法读取截图或设计稿时,调用视觉模型获取文字描述后继续推理
- 自动化流程中需要识别 UI 截图、报表图片或报错界面的像素内容
- 用户粘贴图片链接或本地文件,Agent 需理解图片含义后给出下一步操作
适合人员
- 使用 DeepSeek、Llama 等纯文本大模型作为 Harness 主脑的开发者
- 希望 Agent 在自动化流水线中具备基本图片识别能力的工程师
- 需要轻量视觉补位而不想整体切换到多模态主模型的用户