dsh-ocr-vision
在终端中运行以下命令:
dsh plugin install QEDQCD/dsh-ocr-vision
将以下提示词粘贴到 DeepSeek Harness 对话框中:
在 DeepSeek Harness 中运行 dsh plugin install QEDQCD/dsh-ocr-vision 即可安装该插件,源码仓库地址为 https://github.com/QEDQCD/dsh-ocr-vision
插件介绍
把纯文本大模型接入 DeepSeek Harness 会撞上一堵硬墙:模型想识图时调用 read_image,但纯文本路由在 tool-fs 侧直接拒绝图片输入,模型只看到一条错误。dsh-ocr-vision 从根上绕开这个问题——新增 ocr_image 工具,用本地 RapidOCR 把图片里的文字提取成纯文本返回,图片字节永远不发给模型 API,模型全程只处理字符串。
插件内部封装了 RapidOCR 引擎(2 倍放大、区域裁剪、坐标输出、空图容错),附带 SKILL.md 引导模型走三步流程(先明确识图目的、再提取、再围绕任务组织文本),并通过系统提示段在纯文本路由下优先推荐 ocr_image。所有文件读取走 ctx.fs 沙箱策略,图片不出本机,也不经过任何第三方服务。
适合在 DeepSeek Harness 中使用纯文本路由、但仍需让模型理解截图、图表或文档扫描件的开发者。它是对 claude-ocr-vision 在 DeepSeek Harness 上的等价实现,工作流与输出格式一致,迁移零成本。
使用场景
- 纯文本模型需要读取截图、图表或文档文字时的本地识别方案
- 图片数据敏感、不允许上传至外部 API 的合规场景
- DeepSeek Harness 纯文本路由中替代 read_image 的等价工具
适合人员
- 使用 DeepSeek Harness 纯文本路由、仍需让模型理解图片文字的开发团队
- 对数据隐私有严格要求、禁止图片上传第三方的企业用户
- 从 Claude Code 或 Codex 迁移到 DeepSeek Harness、需要等价 OCR 工作流的开发者