dsh-vision-mix
在终端中运行以下命令:
dsh plugin install haiziyao/dsh-vision-mix
将以下提示词粘贴到 DeepSeek Harness 对话框中:
在 DeepSeek Harness 中,您可以通过运行命令 dsh plugin install haiziyao/dsh-vision-mix 来安装此插件,完整源码地址为 https://github.com/haiziyao/dsh-vision-mix。
插件介绍
在 DeepSeek Harness 中,许多 Agent 默认仅处理文本,当用户上传图片或需要分析网页截图时,功能便受到限制。dsh-vision-mix 插件正是为了解决这一痛点而设计,它通过将文本模型、视觉模型和可选的图片生成 API 有机组合成一个“Mix”模型,让 Agent 突破文本边界,实现对图片的识别、深度理解以及后续追问。插件的核心能力在于其智能路由机制:它能自动区分普通文本、新上传图片或模糊的跨轮追问,并调度相应的模型进行处理。例如,当用户询问“这张图里还有什么”时,插件会重新读取最近的图片;而面对“再详细一点”等模糊指令时,则可借助意图识别模型判断是否需要再次分析图片。此外,插件还支持独立的图片生成与编辑功能,允许用户直接生成新图或基于现有附件进行修改,极大丰富了 Agent 的交互维度。对于开发者或需要视觉增强的用户而言,dsh-vision-mix 提供了灵活的配置选项——你可以为识图、基础对话和图片生成分别选择不同的模型和 Provider,并通过测试工具安全地启用图片能力。无论你是构建多模态 Agent、希望 Agent 能理解设计稿并生成代码,还是需要让聊天助手具备图片处理能力,这款插件都能无缝集成到现有工作流中,提升整体智能体验。
截图预览
使用场景
- 识别并分析用户上传的图片内容
- 理解网页截图或设计稿以辅助代码生成
- 通过对话持续追问图片细节或编辑图片
适合人员
- 需要构建视觉增强型Agent的开发者
- 希望Agent处理多模态输入的用户
- 从事设计转代码或图像编辑相关工作的人员




