dsh-vision-bridge
在终端中运行以下命令:
dsh plugin install Zh-U-hB/dsh-vision-bridge
将以下提示词粘贴到 DeepSeek Harness 对话框中:
在 DeepSeek Harness 终端中执行 dsh plugin install Zh-U-hB/dsh-vision-bridge 即可安装该插件,源码地址为 https://github.com/Zh-U-hB/dsh-vision-bridge
插件介绍
你正在用一只纯文本模型做主力推理,对话里却插了一张截图——模型读不了,消息就卡在那儿,体验断裂。dsh-vision-bridge 要解决的就是这个尴尬:作为 dsh 的宿主插件,它挂在 agent/pre-step 水线上逐条检查消息中的图片块,当活跃模型自报仅支持文本输入、且用户在 Web 设置页填写了视觉端点时,自动接管这条消息,你无需手动切换模型。
核心流程分三步:先请当前文本模型以 temperature 0 写出一条精准的视觉提示词,再将该提示词、会话系统提示与图片数据一起 POST 到用户配置的 OpenAI 兼容 /chat/completions 端点,最后把返回的文本替换掉原始图片块,以一条纯文本用户消息写入会话日志。整个过程中文本模型从未接触原始图片字节,对话记录仍然可以完整重建,KV 缓存前缀也保持不变。
它适合的主力场景是:推理跑在纯文本模型上、偶尔需要处理带图消息(产品截图、报错图、白板照片)而不想为单张图切换整套模型的开发者;以及只使用 OpenAI 兼容视觉 API、希望把视觉能力作为文本模型透明补充层的团队。插件通过 Web 设置页提供 enabled、url、apiKey、model、timeoutMs 五个字段,所有凭据在传输层自动脱敏。
使用场景
- 文本模型推理时对话插入截图,需要透明处理而无需手动切换模型
- 用 OpenAI 兼容视觉 API 为纯文本模型补充图像理解能力
- 处理带图消息时保持会话记录完整可重建、KV 缓存前缀不变
适合人员
- 主力推理跑在纯文本模型上、偶尔需要处理带图消息的开发者
- 使用 OpenAI 兼容视觉端点、希望将视觉能力作为文本模型透明补充层的团队
- 关注对话记录完整性与 KV 缓存稳定性的 AI 应用工程师