DSH Plugins
返回列表
dsh-vision-subagent

dsh-vision-subagent

模型推理 更新于 2026.08.25

在终端中运行以下命令:

dsh plugin install ruby1304/dsh-vision-subagent

将以下提示词粘贴到 DeepSeek Harness 对话框中:

在 DeepSeek Harness 中运行 dsh plugin install ruby1304/dsh-vision-subagent 即可安装,源码仓库地址为 https://github.com/ruby1304/dsh-vision-subagent ,安装后可在 profile 的 cordis.patch.yml 中配置视觉路由。

插件介绍

用纯文本模型驱动 DeepSeek Harness 代理时,一个常见的短板是无法直接处理图片——截图、错误日志、设计稿都需要人工转述。dsh-vision-subagent 正是为此而生:它让主代理拥有一个独立的视觉眼睛,把图片理解工作委托给配置在单独视觉路由(Kimi、MiniMax 或任意 OpenAI 兼容端点)上的一次性子代理。最关键的一点是,图片字节和视觉模型的中间上下文永远不会进入主会话窗口,只有最终文本结论回到主模型,从而彻底解决大截图挤占上下文窗口的问题。

除了基础的图片读取,插件还支持多轮视觉推理——子代理可以在回答前多次调用 read_image 检查工作区文件;Web 端粘贴图片后自动触发语境感知分析,你的草稿消息会指导视觉焦点(调试问错误文字、搭配问服装细节),聊天气泡只保留你的原话加缩略图,完整分析收在灯箱中。需要原始文件做像素级编辑时,vision_image_fetch 可以把高保真原图落到 .dsh-vision/ 目录。

它适合这样的人群:主模型是纯文本路由但日常频繁需要看一下图的开发者;对成本敏感、希望视觉调用单独计费的团队;以及在意安全隔离、不希望图片数据污染主会话上下文的合规场景。

截图预览

使用场景

  • 纯文本代理需要读取截图或错误日志时,委托视觉子代理分析后仅取回文字结论
  • Web 端粘贴设计稿或报错截图,自动触发语境感知分析,聊天气泡保持干净
  • 多图对比或多轮视觉推理场景下,子代理可在工作区内逐步查看文件再给出综合回答

适合人员

  • 主模型为纯文本路由但日常频繁需要查看图片的 Harness 开发者
  • 希望将视觉上下文与主会话隔离以节省窗口空间的团队
  • 对成本敏感、希望视觉调用在独立路由上单独计费的团队