dsh-vision-primitives
在终端中运行以下命令:
dsh plugin install zouyuanqing/dsh-vision-primitives
将以下提示词粘贴到 DeepSeek Harness 对话框中:
在 DeepSeek Harness 终端执行 dsh plugin install zouyuanqing/dsh-vision-primitives 即可安装(源码见 https://github.com/zouyuanqing/dsh-vision-primitives),重启 DSH 后全部 vision_* 工具将自动注册到当前会话。
插件介绍
纯文本智能体在操作 GUI 或分析截图时,往往面临视觉模型输出模糊坐标、无法精确定位的困境。dsh-vision-primitives 为 DeepSeek Harness 智能体装上一双像素级精确的眼睛:通过 Set-of-Mark 编号网格将模糊感知锚定为确定性坐标,配合纯 JS 内核完成截图、局部无损放大、几何标注、帧差分、颜色分割与原生 OCR,全程零外部 MCP 依赖,视觉推理 100% 在 DSH 运行时内完成。
插件同时提供 MiMo V2.5 多模态后端(vision_describe / vision_locate)和视觉证据协议(VEP),让纯文本模型也能结构化解析图片;聊天框图片桥接则使 deepseek 等纯文本模型在粘贴图片时不再报错,发送时自动转为工作区文件路径供模型按需读取。
适合在 DSH 环境中构建桌面自动化、UI 测试、截图解析等需要精确视觉坐标推理的智能体开发者,尤其是希望不依赖外部 MCP 服务、保持单一运行时简洁性的团队。
使用场景
- 智能体操作桌面 GUI 时通过编号网格精确定位按钮与元素坐标
- 截图解析后以视觉证据协议将结构化布局与元素列表注入纯文本模型上下文
- 自动化 UI 测试中执行帧差分并定位变化区域的精确边界框
适合人员
- 在 DSH 中构建桌面自动化或 UI 测试智能体的开发者
- 需要像素级视觉坐标但不愿部署外部 MCP 服务的技术团队
- 希望为纯文本模型补充确定性视觉理解能力的架构师