dsh-tool-see-image
在终端中运行以下命令:
dsh plugin install gugu123a/dsh-tool-see-image
将以下提示词粘贴到 DeepSeek Harness 对话框中:
在 DeepSeek Harness 中执行 dsh plugin install gugu123a/dsh-tool-see-image 即可安装该插件,完整源码地址:https://github.com/gugu123a/dsh-tool-see-image
插件介绍
DSH 默认的纯文本模型无法看见图片——你发一张截图过去,它只能回一句干巴巴的「我无法查看图像」。dsh-tool-see-image 做的事情很直接:给纯文本模型装上「眼睛」,把图片路由到一个可配置的视觉模型(默认是免费的智谱 GLM-4V-Flash),拿到文字描述后再回传到你的 DSH 会话。不需要本地 GPU,不需要换模型,也不需要额外搭服务。
核心工具 see_image 接受任意图片路径和一个问题,返回结构化的文字描述。视觉后端可替换为任何兼容 OpenAI /chat/completions 接口的端点,例如 SiliconFlow、Qwen2.5-VL。插件通过 ctx.fs 读取文件,自动遵守 DSH 的沙箱与观察策略,不会绕过安全边界。仓库还附带一个「粘贴即转文字」的补丁脚本:直接把图片粘进聊天框,自动调用视觉模型转为描述,带本地缓存和 8 秒超时降级。
适合所有在 DSH 里用纯文本模型、又经常需要「看一眼」截图或文档照片的开发者。
使用场景
- 在 DSH 会话中让纯文本模型读取 UI 截图并回答界面相关问题
- 将文档照片转为结构化文字描述,辅助纯文本模型进行后续推理
- 粘贴图片到聊天框,自动调用视觉模型转为文字描述
适合人员
- 在 DSH 中使用纯文本模型、需要偶尔查看截图或照片的开发者
- 不想为图像理解额外部署本地 GPU 的轻量工作流用户
- 希望保持现有 DSH 模型配置不变、以插件方式扩展多模态能力的用户