dsh-image-dscriber
在终端中运行以下命令:
dsh plugin install shuxu-zhao/dsh-image-dscriber
将以下提示词粘贴到 DeepSeek Harness 对话框中:
在终端执行 dsh plugin install shuxu-zhao/dsh-image-dscriber 即可完成安装,插件源码位于 https://github.com/shuxu-zhao/dsh-image-dscriber ,安装后按 README 指引将其挂载到对应的 DeepSeek Harness Web Profile 并在 settings.yaml 中为纯文本模型声明 image 模态即可启用视觉理解能力。
插件介绍
DeepSeek Harness 中的纯文本模型(如 deepseek-v4-flash、deepseek-v4-pro)没有视觉通道。用户粘贴截图时,模型要么因接收二进制数据而崩溃,要么发起无意义的本地文件搜索,完全无法理解图片内容。dsh-image-describer 要解决的就是这道断层。
插件提供双模视觉理解:附件模式下,图片经视觉模型(默认 MiniMax-M3)完成 OCR 与版面识别后,以结构化提示词替代原始二进制块,文本模型直接基于识别文字作答;工具模式下,模型自主调用 describe_image 工具读取工作区图片文件,视觉模型按指定问题返回分析结果,调用过程在 Web UI 工具卡片中完全可见。
适合在 DeepSeek Harness 中使用纯文本模型、又需要让模型看见截图、架构图、报错截图等图片内容的开发者。只需在配置中声明 image 模态并指定视觉模型,即可零代码获得视觉理解能力。
截图预览
使用场景
- 在纯文本模型中查看截图、报错画面或界面快照
- 让模型自主分析工作区中的架构图、流程图等图片文件
- 对粘贴的图片进行 OCR 文字提取与版面内容理解
适合人员
- 在 DeepSeek Harness 中使用 deepseek-v4-flash 等纯文本模型的开发者
- 需要 LLM 理解图片但团队未部署多模态模型的场景
- 希望零代码为现有工作流添加视觉理解能力的用户