DSH Plugins
返回列表
dsh-visibridge

dsh-visibridge

模型推理 更新于 2026.08.25

在终端中运行以下命令:

dsh plugin install lhbsaa/dsh-visibridge

将以下提示词粘贴到 DeepSeek Harness 对话框中:

在 DeepSeek Harness 中执行 dsh plugin install lhbsaa/dsh-visibridge 即可安装该插件(源码地址:https://github.com/lhbsaa/dsh-visibridge),重启 dsh 后 analyze_image 与 capture_image 工具将自动注册可用。

插件介绍

使用 DeepSeek、GLM 等纯文本大模型时,一个长期痛点是:模型看不到图片。遇到需要 OCR、版面理解或场景识别的任务,它只能凭上下文猜测,结果往往不可靠。dsh-visibridge 正是为此而生——它作为宿主级 bundle 插件接入 DeepSeek Harness,让纯文本模型获得一条可靠的视觉通路,而无需改造模型本身或修改 Harness 核心配置。\n\n插件的核心思路是证据驱动:analyze_image 工具将图片发送给视觉后端(本地 Ollama、小米 MiMo 云端、DeepSeek 官方视觉模型,或任意 OpenAI 兼容端点),取回一份结构化 JSON 证据,涵盖 OCR 全文与逐行文本、版面区块、场景与实体语义、配色风格,以及模型自报的不确定项。纯文本模型随后基于这份证据作答,不再凭空编造。此外,capture_image 工具让模型在调试循环中自主调用 USB 摄像头拍照、识别、再对比,实现改-拍-看-再改的视觉闭环,特别适合屏幕调试、文档扫描等需要观察物理世界变化的场景。\n\n如果你正在用 DeepSeek Harness 搭建 Agent 工作流,希望给纯文本模型补上一只眼睛,又不想引入额外的代理进程或修改核心配置,dsh-visibridge 提供了一个轻量、零依赖的宿主级方案。本地 Ollama 后端零上传、自动常驻;云端后端一行配置切换;密钥自动脱敏;内网地址默认拒绝——兼顾了易用性与安全性。

截图预览

使用场景

  • 纯文本模型需要提取图片中的文字或理解版面结构
  • 调试循环中用摄像头实时拍照并逐帧对比屏幕变化
  • 本地零上传环境下完成文档 OCR 与场景语义分析

适合人员

  • 在 DeepSeek Harness 上构建 Agent 工作流的开发者
  • 需要为纯文本模型补全视觉能力、又不想改造核心配置的团队
  • 偏好本地推理、重视图片数据不出机的隐私敏感用户