DSH Plugins
返回列表
🤖

dsh-vision-tool

模型推理 更新于 2026.08.15

在终端中运行以下命令:

dsh plugin install visail/dsh-vision-tool

将以下提示词粘贴到 DeepSeek Harness 对话框中:

在 DeepSeek Harness 中执行 dsh plugin install visail/dsh-vision-tool 即可完成安装,完整源码地址为 https://github.com/visail/dsh-vision-tool

插件介绍

在 DeepSeek Harness 中,纯文本模型(如 deepseek-v4-flash)本身不具备图像理解能力,用户粘贴的图片对模型而言只是一段无法解析的二进制数据。dsh-vision-tool 通过两个协同插件解决这个问题:vision-prompt 在 API 层拦截 session.prompt 请求,将粘贴的图片持久化为内容寻址附件,并将其改写为携带完整引用 JSON 的文本提示;vision-tool 则向模型注册一个全局 analyze_image 工具,模型可按需调用,将图片路由至视觉模型获取文字描述。整个流程经过端到端验证:粘贴图片 → 附件持久化 → 模型调用 analyze_image → 视觉模型返回描述。

该插件默认对接 kimi-for-coding 视觉端点,也兼容其他 OpenAI 协议视觉接口,只需替换配置中的 base_url 与模型名即可。输入支持附件引用 JSON 和本地文件路径(png、jpg、jpeg、webp、gif,本地文件上限 20 MB)。安全方面,vision-prompt 完整复现了官方 /api 的信任围栏(回环地址校验、sec-fetch-site 与 Origin 检查、160 MB 请求体上限),且任何环节失败都会降级为透传,原始请求原样转发,绝不吞掉或篡改。

适合在 DSH 中使用纯文本模型但偶尔需要看图、读图、描述截图的开发者。安装后无需改变日常交互——粘贴图片即可触发,模型自动决定是否调用视觉工具,对已原生支持图像的会话零侵入。

使用场景

  • 在 DSH 纯文本模型会话中粘贴截图,让模型自动调用视觉工具描述图片内容
  • 对话中读取本地 png 或 jpg 文件(如架构图、报错截图),无需切换模型即可获取文字解读
  • 保持现有文本模型工作流不变,仅按需为个别会话解锁看图能力

适合人员

  • 在 DeepSeek Harness 中使用纯文本模型(如 deepseek-v4-flash)的开发者
  • 需要频繁读取截图、图表、UI mockup 但受限于文本模型的工程师
  • 希望零改动现有会话习惯、按需获得图像理解能力的 DSH 用户