dsh-ollama-vision-bridge
在终端中运行以下命令:
dsh plugin install nvbb/dsh-ollama-vision-bridge
将以下提示词粘贴到 DeepSeek Harness 对话框中:
在终端执行 dsh plugin install nvbb/dsh-ollama-vision-bridge 即可从 https://github.com/nvbb/dsh-ollama-vision-bridge 安装该插件,装完重启 dsh web 生效。
插件介绍
在 DSH 的 Web 界面里用纯文本模型聊天时,一旦你拖进一张图片,系统立刻抛出「当前模型不支持图片识别」的拒绝——哪怕你只想让模型看看屏幕截图、解释一张图表。dsh-ollama-vision-bridge 正是为这个断点而生的桥梁。它给 DSH 的会话控制器打了一个幂等补丁:当模型步骤检测到图片且模型本身不具备视觉能力时,自动把图片交给本地 Ollama 视觉模型(默认 qwen3-vl:8b)生成一段描述,再在同一个模型步骤中作为「上下文注入」消息并入请求。一次发送、一次回答,没有额外轮次,没有云端调用,也没有 API Key。图片引用完整保留在你的对话历史里,用户消息一字不改。
显存管理是另一条容易忽略却非常实用的设计。桥接请求携带 Ollama 的 keep_alive 参数,VL 模型在推理结束后仅驻留显存一小段时间即自动卸载,不会与主模型争抢 VRAM。配置热加载——在 settings.yaml 的 vision-bridge 段改完即生效,删除该段则优雅回退到 DSH 原生拒绝行为,Ollama 进程挂掉时的兜底路径与 DSH 自身完全一致。整个插件零 npm 依赖,运行时只是一个极小的 Cordis 行,补丁注入所需辅助代码由 DSH 宿主环境提供。
适合这样的场景:你日常用 DSH 搭配一个高性能文本模型做编码、写作或推理,偶尔需要发一张截图、一张公式图或一张 UI 设计稿,但不想为此切换到专门的视觉模型,也不想把图片数据推到云端。只要你本地跑着 Ollama、显存装得下一张 8B VL 模型,装上这个插件就能让「文本模型 + 本地视觉理解」在同一句话里自然衔接。
使用场景
- 用文本模型聊天时拖入截图或图表,自动获取本地视觉模型描述并注入同一步骤
- 不想把图片数据推送到云端,在纯本地完成图片理解
- 在 DSH Web 界面中让文本模型无缝处理带图消息,无需切换模型
适合人员
- 日常用 DSH 搭配高性能文本模型、偶尔需要看图的开发者
- 已部署本地 Ollama 且显存可承载 8B 级 VL 模型的用户
- 重视数据隐私、拒绝云 API Key 的本地推理用户