dsh-vision-tool
在终端中运行以下命令:
dsh plugin install visail/dsh-vision-tool
将以下提示词粘贴到 DeepSeek Harness 对话框中:
在 DeepSeek Harness 中执行 dsh plugin install visail/dsh-vision-tool 即可完成安装,完整源码地址为 https://github.com/visail/dsh-vision-tool
插件介绍
在 DeepSeek Harness 中,纯文本模型(如 deepseek-v4-flash)本身不具备图像理解能力,用户粘贴的图片对模型而言只是一段无法解析的二进制数据。dsh-vision-tool 通过两个协同插件解决这个问题:vision-prompt 在 API 层拦截 session.prompt 请求,将粘贴的图片持久化为内容寻址附件,并将其改写为携带完整引用 JSON 的文本提示;vision-tool 则向模型注册一个全局 analyze_image 工具,模型可按需调用,将图片路由至视觉模型获取文字描述。整个流程经过端到端验证:粘贴图片 → 附件持久化 → 模型调用 analyze_image → 视觉模型返回描述。
该插件默认对接 kimi-for-coding 视觉端点,也兼容其他 OpenAI 协议视觉接口,只需替换配置中的 base_url 与模型名即可。输入支持附件引用 JSON 和本地文件路径(png、jpg、jpeg、webp、gif,本地文件上限 20 MB)。安全方面,vision-prompt 完整复现了官方 /api 的信任围栏(回环地址校验、sec-fetch-site 与 Origin 检查、160 MB 请求体上限),且任何环节失败都会降级为透传,原始请求原样转发,绝不吞掉或篡改。
适合在 DSH 中使用纯文本模型但偶尔需要看图、读图、描述截图的开发者。安装后无需改变日常交互——粘贴图片即可触发,模型自动决定是否调用视觉工具,对已原生支持图像的会话零侵入。
使用场景
- 在 DSH 纯文本模型会话中粘贴截图,让模型自动调用视觉工具描述图片内容
- 对话中读取本地 png 或 jpg 文件(如架构图、报错截图),无需切换模型即可获取文字解读
- 保持现有文本模型工作流不变,仅按需为个别会话解锁看图能力
适合人员
- 在 DeepSeek Harness 中使用纯文本模型(如 deepseek-v4-flash)的开发者
- 需要频繁读取截图、图表、UI mockup 但受限于文本模型的工程师
- 希望零改动现有会话习惯、按需获得图像理解能力的 DSH 用户