dsh-img
在终端中运行以下命令:
dsh plugin install gmleong/dsh-img
将以下提示词粘贴到 DeepSeek Harness 对话框中:
在 DeepSeek Harness 中运行 dsh plugin install gmleong/dsh-img 即可安装,完整源码地址:https://github.com/gmleong/dsh-img
插件介绍
纯文本模型最大的短板之一,是面对一张截图、一份设计稿或一个报错弹窗时完全无能为力。dsh-img 为 DeepSeek Harness 补齐了这条链路:让任意文本编码代理通过视觉 API 看懂图片,同时在本地提供一组完全免 key 的像素工具,覆盖裁剪、像素级比对、主色提取、OCR 转录、位图矢量化和背景抠图,形成从看图到处理图的完整闭环。
在视觉后端方面,插件默认接入智谱 GLM-4V-Flash(免费)或通义 Qwen-VL,也支持 Ollama 本地模型(如 minicpm-v:8b)实现零 key、零外部依赖的纯本地模式;配置 backends 列表后还能按序自动回退,一个后端挂了立即切换下一个。识别结果按图片和问题 hash 持久化缓存,重复调用不再重复消耗配额。
适合需要让文本模型理解 UI 截图、设计稿还原度、图标矢量化等场景的开发者;也适合不想为偶尔看图而注册多个 API、追求开箱即用的个人用户。纯 JavaScript、零构建步骤,一条命令即可接入现有 dsh 工作流。
使用场景
- 让文本模型读懂 UI 截图和报错弹窗
- 本地像素级比对设计稿还原度
- 位图矢量化和背景抠图
适合人员
- 需要视觉能力的文本编码代理开发者
- 不想注册多个 API 的个人用户
- 使用本地 Ollama 模型的离线开发者