DSH Plugins
返回列表
🤖

dsh-vision-skill

模型推理 更新于 2026.08.24

在终端中运行以下命令:

dsh plugin install DDDFXYqiming/dsh-vision-skill

将以下提示词粘贴到 DeepSeek Harness 对话框中:

在终端执行 dsh plugin install DDDFXYqiming/dsh-vision-skill 即可安装该插件,源码见 https://github.com/DDDFXYqiming/dsh-vision-skill 。

插件介绍

很多 DSH 用户用的是纯文本模型,想让它「看图」时直接贴图就会撞墙。dsh-vision-skill 就是为此而生的桥:它把 Qwen 官方动态分辨率方法封装成 DSH 原生插件,零框架补丁,只走官方扩展接缝,让任意 OpenAI 兼容多模态模型(默认 MiniMax-M3)成为纯文本模型的「眼睛」。

插件提供 8 个工具加 1 个运行时 skill,覆盖通用图像分析(含 evidence 结构化证据)、独立 OCR(保留原始排版)、目标定位(返回像素与归一化坐标)、元素枚举、主色分析、超长截图分块 OCR 以及剪贴板兜底识别。v0.4 起支持 paste-to-path 直贴,粘贴的图自动落盘到工作区,消息里不再出现 image 块,宿主不再报不支持图片的错误。渐进式工具暴露机制让全局只挂一个轻量激活入口,完整工具集等 skill 加载后再按 Agent 挂载,显著节省上下文窗口。

面向生产环境的工程细节同样齐全:多 provider 顺序 failover 与 429 退避、按 SHA-256 加参数的图像记忆缓存、realpath 路径围栏防穿越、密钥走 DSH Credential 引用而非明文。vision_analyze 的 evidence 模式还能输出含 summary、OCR 全文、阅读顺序、实体关系与不确定度的结构化 JSON,方便下游流程直接消费。

如果你正用 DSH 跑纯文本模型又需要 OCR、图像理解或目标定位,又不想在宿主上打补丁、也不想手动管理一堆散落的脚本,这个插件把整套流程收敛到一次安装里——配好兼容的视觉 API 和 Credential,就能用。

使用场景

  • 纯文本 DSH Agent 需要识别图片、提取文字或定位界面元素
  • 超长截图和扫描件需要分块 OCR 并保留原始排版
  • 多视觉供应商需要顺序 failover,避免单点 429 阻塞整条链路

适合人员

  • 跑纯文本模型但需要按需调用视觉能力的 DSH 用户
  • 偏好官方扩展接缝、不想给宿主打补丁的插件开发者
  • 需要结构化 evidence JSON 喂给下游流程的工程团队