dsh-plugin-vision
在终端中运行以下命令:
dsh plugin install qizhen2021/dsh-plugin-vision
将以下提示词粘贴到 DeepSeek Harness 对话框中:
运行 dsh plugin install qizhen2021/dsh-plugin-vision 即可安装,源码地址 https://github.com/qizhen2021/dsh-plugin-vision
插件介绍
大多数纯文本大模型天生没有“眼睛”:当你把一张截图丢进对话,模型看到的要么是一串无意义的 base64,要么是路由层的 “不支持 image 输入” 拒绝。dsh-plugin-vision 注册的 see 工具解决了这个断裂——它把任意图片拆解为三条纯文本通道回传给模型,让 deepseek-v4-flash 这类不声明多模态的模型也能像人一样“读”图。
三条通道各司其职:OCR 通道调用 macOS Vision 框架离线提取文字,自动检测中英文混排并输出归一化坐标,逐字精确;ASCII 布局图通道用 PIL 将灰度图渲染为 88 列字符画,模型无需像素就能感知版面结构;语义描述通道则通过 OpenAI 兼容网关调用视觉语言模型(默认 mimo-v2.5),并将 OCR 结果作为 ground truth 注入提示词,确保报告中的数字、标签、货币符号与像素级一致。三条通道独立容错,任何一条失败不会拖垮整体结果。
如果你正在用纯文本模型做文档审阅、UI 走查、图表读数或截图问答,又不想为此切换到更贵的多模态端点,这个插件是最低摩擦的桥接层。零配置即可工作,所有输出都是干净的文本,模型可以直接引用、推理、对比。
使用场景
- 用纯文本模型审阅截图中的 UI 布局与文字内容
- 让不声明多模态输入的模型读取图表数据与坐标标签
- 在文档或多轮对话中让模型感知版面结构后做推理
适合人员
- 使用纯文本大模型做截图问答或文档审阅的开发者
- 需要低成本图像理解而不愿切换多模态端点的小团队
- 在 macOS 上构建纯文本 AI 工作流的工程师