dsh-vision-toolkit
在终端中运行以下命令:
dsh plugin install mengruoa/dsh-vision-toolkit
将以下提示词粘贴到 DeepSeek Harness 对话框中:
在 DSH 终端中运行 dsh plugin install mengruoa/dsh-vision-toolkit 完成安装(开源地址 https://github.com/mengruoa/dsh-vision-toolkit),之后重启 Web Profile 并进入 Settings → Vision Toolkit 配置视觉 Provider 即可使用。
插件介绍
在 DeepSeek Harness 中,纯文本模型面对图片只能给出一段泛泛的描述,无法真正完成视觉任务。DSH Vision Toolkit 将一组视觉工具与一套实战 Skill 注入 Harness:粘贴图片即可切换为视觉增强变体,模型围绕当前任务聚焦提取关键信息,而非生成一段通用摘要。
工具箱涵盖图像问答、元素定位、区域裁剪、矢量追踪、像素差异对比、长截图逐段 OCR、前景提取、主色识别和本地页面截图共十项能力;捆绑的 vision-skills Skill 则把长截图阅读、UI 还原、图标与草图重建、GUI 操作等五套流程编排为可复用的工作流,并支持多视觉 Provider 配置与自动降级。
它适合希望在文本模型上获得类多模态交互体验的用户——直接把截图贴进对话提问,也可以把一张设计稿变成可编辑的前端页面,或从一段长聊天截图中精确提取对话内容。
截图预览
使用场景
- 在对话中粘贴截图,让纯文本模型直接完成图像问答与元素定位
- 将一张设计稿或手绘草图还原为可编辑的前端代码
- 从长聊天截图中按顺序提取对话人、时间戳与消息内容
适合人员
- 希望在纯文本模型上获得类多模态交互体验的 DeepSeek Harness 用户
- 需要视觉辅助来还原 UI、对比实现与参考稿的前端开发者
- 日常处理截图、设计稿或长页面内容的产品与设计团队






