DSH Plugins
返回列表
🖥️

dsh-image-vision

客户端 更新于 2026.08.17

在终端中运行以下命令:

dsh plugin install VeryInt/dsh-image-vision

将以下提示词粘贴到 DeepSeek Harness 对话框中:

在 DeepSeek Harness 中执行 dsh plugin install VeryInt/dsh-image-vision 即可安装,源码地址为 https://github.com/VeryInt/dsh-image-vision,安装后重启 Harness 并在 Settings 中配置视觉模型即可使用。

插件介绍

当 DeepSeek Harness 的主模型走纯文本路由时,聊天中粘贴的截图、飞书文档里的图表都会被输入模态校验拦截,主模型始终只能看到纯文本。dsh-image-vision 专为解决这个问题而生:它不替换适配器、不禁用内置插件,仅通过包装 llm.resolveModelInfo 使图片通过准入校验,再借助 agent/pre-step 官方瀑布流调用可配置的视觉模型将图片转写为文本,让纯文本主模型无缝获得完整的图像理解能力。

核心能力覆盖三种场景:聊天中直接粘贴或拖入图片,视觉模型生成涵盖人物、场景、表格、图表及原文文字的完整描述而非简单 OCR,提示词可自定义覆盖;飞书 / Lark 文档中由 lark_read_doc 等工具产出的图片自动下载并描述后注入回工具输出;提供 describe_image 模型工具对本地图片文件路径进行描述。视觉模型可从 ModelScope 免费社区 API 或 SiliconFlow 选取,路由自动从 settings.yaml 探测,也可在插件配置中显式指定。单条消息图片上限、飞书图片上限等参数均可调整,视觉调用瞬态失败时回复中带有占位提示而非整轮中断。

适合所有主模型侧使用纯文本路由的用户——无论是 pi-ai 转发的 DeepSeek 还是任何未声明 image 输入模态的后端——同时又希望在聊天和 agent 工作流中让模型读懂图片。插件为纯 JS ESM 实现,无构建步骤,额外 peer 依赖极少,完整契合 DeepSeek Harness 一切皆插件的设计哲学。

使用场景

  • 在纯文本主模型聊天中粘贴或拖入图片,由视觉模型转写为完整描述后注入
  • Agent 通过 lark_read_doc 读取飞书文档时,自动下载并描述文档中的图片
  • 调用 describe_image 工具对本地图片文件路径生成涵盖人物、场景、表格、图表的描述

适合人员

  • 使用纯文本路由(如 pi-ai 转发 DeepSeek)的 DeepSeek Harness 用户
  • 希望在 Agent 工作流中让模型读懂图片、但不想改动宿主代码或替换适配器的开发者
  • 日常处理飞书 / Lark 文档并需要截图识别能力的团队
  • 在 ModelScope 或 SiliconFlow 上已配置视觉模型、希望零构建直接接入 Harness 的用户