dsh-plugin-vision-toolkit
在终端中运行以下命令:
dsh plugin install YYTbit/dsh-plugin-vision-toolkit
将以下提示词粘贴到 DeepSeek Harness 对话框中:
在 DeepSeek Harness 终端中执行 dsh plugin install YYTbit/dsh-plugin-vision-toolkit 即可完成安装,插件源码地址为 https://github.com/YYTbit/dsh-plugin-vision-toolkit 。
插件介绍
在 DeepSeek Harness 中,Agent 本质上只能处理文本。当用户粘贴一张截图、附上一张产品界面图,或者引用一张图表时,纯文本模型完全无从下手——它看不见像素,也无法读懂画面。dsh-plugin-vision-toolkit 正是为填补这一缺口而生:它以插件形式为 Agent 装上一双眼睛,让原本纯文字的推理流程中自然融入图像理解能力。
插件提供四个轻量 CLI 工具,分别对应不同粒度的视觉任务:glance 用于整体描述、提问或 OCR 一张图片;ground 精确定位某个元素并返回边界框坐标;detect 扫描全图找出某类元素的所有实例;crop 则按坐标裁切出指定区域。底层支持 DeepSeek VL(deepseek-vl2 / vl2.5)、OpenAI GPT-4V / GPT-4o 以及任意 OpenAI 兼容的多模态端点。Agent 本身并不接触原始像素,它拿到的是自然语言描述,随后像处理普通文本一样进行推理。
如果你正在用 DeepSeek Harness 搭建工作流,且经常需要 Agent 处理截图、UI 设计稿、图表扫描件或照片,这个插件可以即插即用。它不要求你更换模型或改造推理链路,只需配置一个视觉 API 端点,Agent 便能在对话中自主判断该不该看图、看哪张图、用什么工具看。
使用场景
- Agent 描述用户粘贴的截图或图表内容
- 从 UI 设计稿中定位并裁剪特定组件
- 对扫描件执行 OCR 与多元素实例检测
适合人员
- 使用 DeepSeek Harness 且需要处理图像的开发者
- 希望纯文本 Agent 获得看图推理能力的用户
- 对接 DeepSeek VL 或 GPT-4V 等视觉 API 的应用构建者