DSH Plugins
返回列表
🤖

jolly-dsh-vision

模型推理 更新于 2026.08.22

在终端中运行以下命令:

dsh plugin install JollY-Life/jolly-dsh-vision

将以下提示词粘贴到 DeepSeek Harness 对话框中:

在 DeepSeek Harness 终端执行 dsh plugin install JollY-Life/jolly-dsh-vision 即可安装该视觉桥接插件(开源地址:https://github.com/JollY-Life/jolly-dsh-vision)。

插件介绍

纯文本大模型再强,也看不见像素。当你把一张截图、图纸或手写笔记丢给对话窗口时,模型只能靠上下文猜,而严重场景里猜图几乎等于没答。jolly-dsh-vision 把这条短板补上:它让一个纯文本大脑(默认 DeepSeek-V4-Pro)借助一个视觉眼睛(默认 DeepSeek-V4-Flash-Vision-Exp),拿到一份包含 summary、ocr、layout、semantics、visual、uncertainty 六个维度的结构化证据 JSON,然后基于证据作答而非瞎猜。插件提供两条视觉通路:一是 vision 工具,传入图片路径或 URL 即可,大脑在需要时主动调用、读到证据后作答;二是模型选择器里的 (ds vision) 视觉孪生条目,选中后可以直接在输入框粘贴或拖入图片,插件在请求发出前自动将图片转为证据文本注入给大脑,无需手动调工具。两条通路按内容寻址缓存,同一张图在一次会话里只转换一次,失败时降级为占位文本继续对话而不中断。整个插件零运行时依赖——没有 commander、没有 undici、没有构建步骤,工具定义走原始 JSON-Schema 注册,消息与适配器全部鸭子类型化,也就把供应链投毒面压到了最低。安全侧做了 SSRF 防护(默认拒绝内网、环回、链路本地及云元数据地址)、API key 零接触(密钥由 harness 凭据 seam 每次调用时解析,插件代码不读 process.env、不构造 Authorization 头),以及将图片 OCR 文本框定为"证据,请引用"以降低提示注入风险。适合想让自己的 DeepSeek 对话获得可靠看图能力、又不想额外部署视觉推理服务或自管多引擎密钥的开发者与重度对话用户;尤其适合需要 OCR 取证、布局分析、图表语义理解的工作流,以及希望与既有 modlens 插件共存而不冲突的场景。

使用场景

  • 在 DeepSeek 对话中直接粘贴截图或图表,让模型基于 OCR 与布局证据作答而非猜图
  • 通过 vision 工具传入图片路径或 URL,获取包含 summary、ocr、layout 等维度的结构化证据 JSON 供下游流程消费
  • 与已有 modlens 工作流共存,为不同项目提供独立的视觉桥接通路而互不干扰

适合人员

  • 希望 DeepSeek 对话获得可靠看图能力、又不想自部署视觉推理服务或自管多引擎密钥的开发者
  • 需要 OCR 取证、布局分析或图表语义理解等工作流的构建者
  • 偏好零运行时依赖、低供应链攻击面、配置集中在 settings.yaml 的轻量插件用户