dsh-vision-bridge
在终端中运行以下命令:
dsh plugin install GooDAnDReaDY/dsh-vision-bridge
将以下提示词粘贴到 DeepSeek Harness 对话框中:
在 DeepSeek Harness 中运行 dsh plugin install GooDAnDReaDY/dsh-vision-bridge 安装本插件,完整源码见 https://github.com/GooDAnDReaDY/dsh-vision-bridge
插件介绍
在 DeepSeek Harness 中,纯文本模型(如 deepseek-v3、Qwen 文本变体)有一个硬伤:会话控制器的模态检查会直接拒绝任何附带图像的提示词,用户根本无法把截图、图表或设计稿发进对话。dsh-vision-bridge 填补了这块空白——它在 Cordis 运行时内部透明地扩展模型的输入声明,让文本模型也能接收图片,同时自动将图像转写为结构化文本描述,再交回给聊天模型。
核心能力集中在三层:一是服务模式桥接,自动检测原生视觉模型直接透传,非原生模型则路由到可配置的后端(dsh-catalog、OpenAI 兼容端点、Ollama、自定义 Webhook)完成图像描述,支持多通道回退与并行竞赛;二是高性能 LRU 缓存,按内容哈希去重,避免重复调用视觉 API 浪费 token;三是 26 种即取即用的视觉工具,覆盖 OCR(含离线 Tesseract)、视觉问答、边界框定位、UI 布局解析、像素差异比对、SVG 描摹等,满足从截图阅读到多图对比的完整链路。
如果你日常在 DSH 里用文本模型处理截图、UI 稿、图表或任何视觉素材,这个插件基本是刚需。三种处理模式(hybrid / llm / tools)让你按需切换自动化程度,无需改动工作流即可让纯文本对话拥有完整的视觉理解能力。
使用场景
- 用纯文本模型在 DSH 中分析截图或 UI 设计稿
- 离线环境下通过 Ollama 视觉模型完成图像识别与 OCR
- 对同一张图做多轮视觉问答、像素比对或边界框定位
适合人员
- 日常用文本模型处理视觉素材的 DSH 用户
- 需要在本地或私有化部署视觉能力的开发者
- 依赖 DSH 工作流做产品与设计协作的团队