dsh-vision-toolkit
在终端中运行以下命令:
dsh plugin install Anionex/dsh-vision-toolkit
将以下提示词粘贴到 DeepSeek Harness 对话框中:
在 DeepSeek Harness 中运行 dsh plugin install Anionex/dsh-vision-toolkit,或访问 https://github.com/Anionex/dsh-vision-toolkit 查看安装说明。
插件介绍
如果你一直在 DeepSeek Harness 里用纯文本模型,大概已经习惯了这样的痛点:想让它看一张截图、读一段长聊天记录,或者照着草图生成页面,却只能把图片转成路径或手动切换模型,最后得到的往往还是一段含糊的“图片描述”。DSH Vision Toolkit 要解决的就是这个问题——它让文本模型真正“长出眼睛”,而且不是简单地看图说话,而是围绕你当前的任务提取关键证据:错误在哪里、按钮在哪里、这段 UI 和设计稿差多少。
这个插件把一整套经过实战打磨的视觉方法装进了 DeepSeek Harness。它提供 10 个可以单独调用或组合成流程的工具:快速浏览、目标定位、元素检测、区域裁剪、矢量化描摹、像素级差异对比、长截图 OCR、前景抠图、主色提取,以及 HTML 页面截图。配合内置的 vision-skills Skill,模型会学会什么任务该看什么、按什么顺序调用工具、以及如何验证结果。更贴心的是,在 DSH Web 里直接粘贴图片就能自动切换到对应的视觉变体,无需手工改配置。
它适合两类人。第一类是想获得接近多模态模型体验的用户:粘贴一张图,直接提问,剩下的交给工具链。第二类是有更高价值视觉任务需求的人:把草图变成前端页面、把截图重建为可编辑的 HTML、或者从超长截图中抽取聊天记录——这些不再是“描述一下图片”的玩具场景,而是一套可复用、可验证的工作流。
截图预览
使用场景
- 在 DeepSeek Harness 中直接粘贴截图并向模型提问,无需手动切换模型。
- 从超长截图或聊天记录中提取结构化内容,保留说话人、时间戳与引用。
- 将草图或设计稿重建为可编辑的 HTML 前端页面,并通过截图对比验证效果。
适合人员
- 希望文本模型也能看图问答的 DeepSeek Harness 用户。
- 需要处理长截图 OCR、UI 还原等复杂视觉任务的内容创作者与开发者。
- 想要通过内置工作流高效完成界面验证与像素级对比的前端工程师。






