DSH Plugins
返回列表
🤖

dsh-view-image

模型推理 更新于 2026.08.18

在终端中运行以下命令:

dsh plugin install johnoooooo/dsh-view-image

将以下提示词粘贴到 DeepSeek Harness 对话框中:

在 DeepSeek Harness 终端中执行 dsh plugin install johnoooooo/dsh-view-image 即可安装该插件,完整源码地址为 https://github.com/johnoooooo/dsh-view-image

插件介绍

很多纯文本模型(比如 deepseek-v4-flash)根本不具备视觉能力,用户一旦在对话里粘了张图,要么被直接拒绝,要么整轮对话就卡死在"当前模型不支持图片"的报错上。dsh-view-image 的思路很干脆:在主对话之外挂一个独立的 OpenAI 兼容视觉模型,专门负责"看图",把识别结果以纯文本描述的形式交回主模型。图片字节始终不进入主对话上下文,主模型看到的只是一段自然语言描述,就像你替它读了一遍图。这意味着即使你的主力路由是纯文本的,也照样能流畅地完成"贴一张截图问报错原因"这类操作。

体验层面,插件做了不少细节:Web 输入框支持 Ctrl+V 直接粘贴,多张图全部内联缩略展示(右对齐、240px),点击放大、悬停复制、拖拽回输入框都可以;终端和 headless 脚本场景则只需传一个文件路径,模型自动调用 view_image 完成识别。视觉端点完全可插拔,Ollama、vLLM、LiteLLM、OpenRouter、阿里云百炼、opencode.ai 等任何 OpenAI 兼容接口都能在 vision-model.json 里指过去,本地跑一个小型 VLM 就能用,不必额外订阅多模态 API。

附件侧走内容寻址(sha256)加同图去重和完整性校验,会话关掉再重开缩略图依然能兜底渲染,不会丢图。整体来看,这个插件适合三类人:一是主力跑纯文本模型但偶尔需要读图的日常用户;二是写自动化脚本、需要给 headless 流程加一步图片识别的开发者;三是倾向本地部署视觉模型、不想把截图上传到第三方多模态服务的隐私敏感用户。配置一个端点、重启一次 dsh,纯文本模型就多了一双"眼睛"。

使用场景

  • 纯文本模型路由下粘贴截图描述报错或 UI 元素
  • headless 脚本中自动识别文档截图并提取信息
  • 本地部署小型 VLM 后为日常对话补充图片理解能力

适合人员

  • 主力模型为纯文本但偶尔需要读图描述的日常用户
  • 需要给自动化流程加一步图片识别的脚本开发者
  • 倾向本地部署视觉模型、不想上传截图到第三方服务的用户