DSH Plugins
返回列表
🤖

dsh-vision-bridge

模型推理 更新于 2026.08.20

在终端中运行以下命令:

dsh plugin install YuLee-314/dsh-vision-bridge

将以下提示词粘贴到 DeepSeek Harness 对话框中:

在 DeepSeek Harness 中执行 dsh plugin install YuLee-314/dsh-vision-bridge 即可完成安装,项目源码位于 https://github.com/YuLee-314/dsh-vision-bridge

插件介绍

DeepSeek Harness 里的 v4-flash 和 v4-pro 是纯文本模型,API 直接拒绝图片字节——粘贴截图会被拦截,read_image 工具无法使用,整个会话对图像完全失明。dsh-vision-bridge 把同一组 DeepSeek 模型重新注册为一条支持图片的"视觉孪生"路由,在请求层将图片交给本地 Ollama 视觉模型(默认 qwen2.5vl)翻译成文本描述,再喂给 DeepSeek 的 API。你看到的体验是原生的:粘贴即出缩略图、图片块、模型正常回答,而图片字节始终没有离开你的机器。

除了基础的图片理解,插件还内置九种检查工具:整图描述、OCR 提取(含归一化坐标)、结构化元素扫描、区域聚焦查询、目标两级定位、前后对比、剪贴板读取和健康检查。所有工具走本地推理、schema 校验加自动重试,重复图片命中内容哈希缓存,零额外开销。粘贴路由会根据实时模型元数据自动选择原生图片流或路径文本流,无需手写正则或手动切换。

如果你日常在 Harness 里用 DeepSeek 写代码,偶尔需要看截图、读 UI 图、做视觉回归对比,又不想为一次图片理解切到别的模型或申请云端视觉 Key,这个插件就是最轻量的补齐方案——一个 29 KB 的 tarball,装完即用,官方路由原封不动。

使用场景

  • 粘贴截图让 DeepSeek 理解 UI 布局并给出改进建议
  • 用 OCR 工具提取图片文字及归一化坐标用于自动化
  • 对前后截图做视觉回归对比,定位变更区域

适合人员

  • 日常在 DeepSeek Harness 中编码的开发者
  • 需要图像理解但不愿申请云端视觉 API Key 的用户
  • 对截图隐私敏感、要求数据不出本机的安全优先用户