DSH Plugins
返回列表
🤖

dsh-vision-bridge

模型推理 更新于 2026.08.25

在终端中运行以下命令:

dsh plugin install ximengxiaolan/dsh-vision-bridge

将以下提示词粘贴到 DeepSeek Harness 对话框中:

在 DeepSeek Harness 中,运行 'dsh plugin install ximengxiaolan/dsh-vision-bridge' 来安装此插件,完整源码地址为 https://github.com/ximengxiaolan/dsh-vision-bridge。

插件介绍

在对话式AI应用中,纯文本模型如DeepSeek V4/4-Flash因其架构限制,无法直接处理图像输入。用户粘贴图片时,系统会抛出MODEL_DOES_NOT_SUPPORT_IMAGES错误,导致图文交互中断。dsh-vision-bridge 插件巧妙地解决了这一痛点:它充当“视觉桥梁”,自动调用用户配置的OpenAI兼容视觉模型(如通义千问VL、智谱GLM-4V)将图像识别为文字描述,再将描述传递给DeepSeek进行后续推理。这使得用户能在保持纯文本模型强大文本能力的同时,无缝融入图像理解。

插件的核心能力体现在其透明化的工作流中。它通过修补模型信息解析和流式请求流程,让系统“误以为”文本模型支持图像,从而允许图片附件进入会话。随后,在发送给模型前,插件会扫描所有消息中的图片块,用视觉模型生成的描述进行替换。对于原生支持图像的模型,插件则放行原图,避免不必要的转换。此外,它内置了按图片ID的缓存机制,避免重复调用视觉模型产生额外费用,并在视觉调用失败时优雅降级,确保对话不中断。

这个插件非常适合那些希望利用纯文本模型(如DeepSeek系列)但又需要处理图像内容的开发者、研究人员或内容创作者。例如,在客服聊天机器人、教育辅助工具或内容分析场景中,用户可能随手发送截图或照片,而模型需要基于这些视觉信息给出回应。通过dsh-vision-bridge,你可以无需切换到昂贵的多模态模型,就能扩展文本模型的能力边界,实现成本与功能的平衡。

使用场景

  • 在对话中粘贴图片,让纯文本模型基于视觉描述回答问题。
  • 用户上传截图,插件自动转换为文字描述供模型分析。
  • 在客服机器人中处理用户发送的产品图片并生成回复。

适合人员

  • 开发者构建需要处理图像的AI应用。
  • 研究人员测试纯文本模型在多模态任务中的能力。
  • 内容创作者分析图像内容以辅助创作。