dsh-omni-vision
在终端中运行以下命令:
dsh plugin install Renji004/dsh-omni-vision
将以下提示词粘贴到 DeepSeek Harness 对话框中:
在 DeepSeek Harness 中运行 dsh plugin install Renji004/dsh-omni-vision 安装该插件,源码见 https://github.com/Renji004/dsh-omni-vision 。
插件介绍
纯文本模型没有眼睛,但 Agent 的工作流里经常要读一张截图里的文字、确认一张流程图的结构、或者描述一张图片的配色与布局。dsh-omni-vision 让 Agent 在完全本地、不依赖任何视觉模型的前提下获得看见的能力。
插件提供四个核心工具:eyes_render 在 Web GUI 中渲染画布(文字、线条、矩形、圆形)并支持 Mermaid 流程图,PNG 一式两份落盘;eyes_ocr 调用 Windows 自带离线 OCR 引擎,把图片中的文字读回给模型;eyes_analyze 将 PNG 解码为像素网格与主色直方图,让 Agent 以结构化数据看懂图形与配色;eyes_paste 让用户直接把剪贴板图片粘贴或拖入页面,浏览器捕获后存为本地 PNG 供读取。全程闭环走本机 HTTP 与磁盘,不产生多余网络请求。
适合在 Windows 上使用 DeepSeek 等纯文本模型、又希望 Agent 能本地处理图片和文字的开发者和团队。无需额外 GPU、无需视觉模型 API,安装即用,离线可工作。
使用场景
- Agent 从截图中离线读取文字并复述给模型
- Agent 渲染 Mermaid 流程图并通过 OCR 确认节点结构
- Agent 对图片做像素网格分析和主色占比描述
适合人员
- 使用 DeepSeek 等纯文本模型的开发者
- 需要本地离线处理图片且不想调用视觉 API 的团队
- Windows 平台上的 DSH Web 用户