dsh-umi-ocr-vision
在终端中运行以下命令:
dsh plugin install paul-yangmy/dsh-umi-ocr-vision
将以下提示词粘贴到 DeepSeek Harness 对话框中:
在 DeepSeek Harness 中运行 dsh plugin install paul-yangmy/dsh-umi-ocr-vision 即可安装本插件,源码位于 https://github.com/paul-yangmy/dsh-umi-ocr-vision 。
插件介绍
在 DeepSeek Harness 中,如果你当前的主模型是纯文本模型(例如 deepseek-official),聊天里贴进去的截图、文档图片便石沉大海。dsh-umi-ocr-vision 正是为这个场景而生:它参考 dsh-vision 的桥接思路,在主模型不支持图片时,自动把聊天中的图片交给本地运行的 Umi-OCR 识别为文字,再将 OCR 结果作为非可信视觉上下文注入请求,最终由你原来的文本模型给出回答。整个过程完全离线,HTTP 模式默认只访问 127.0.0.1,图片不经过任何云端。
插件不会替换你在界面中选择的主模型,行为透明:多张附件按顺序分别 OCR 后合并放入同一次请求;OCR 结果被明确标记为非可信观察数据,图片中嵌入的提示词无法获得系统权限。除了自动桥接,开启 enableVisionTools 后还可以调用 vision_ocr、vision_glance、vision_detect_text、vision_ground_text、vision_crop、vision_long_screenshot_ocr、vision_dominant_colors、vision_pixel_diff 等工具,覆盖从单图识别到长截图分块、像素级对比的一整套离线图像文字工作流。
它最适合这样的用户:主力模型是纯文本 DeepSeek,日常需要处理截图、表格、验证码、UI 界面文字;在意隐私,希望图片始终留在本机;不想为一次 OCR 切换成重量级多模态模型。如果你需要理解图片中的空间关系或物体语义,则应转向 dsh-vision 等真正的视觉大模型插件。
使用场景
- 聊天中粘贴截图或文档图片,文本模型需要读取其中文字后作答
- 长截图包含多段文字,需要分块 OCR 并合并为 Markdown
- 对比两张界面截图,定位像素级差异区域和差异百分比
适合人员
- 主力模型为纯文本 DeepSeek、日常需要读取截图表格验证码的用户
- 在意隐私、希望图片始终留在本机不出内网的开发者
- 在 Harness 中构建离线图像文字工作流而不愿引入重量级多模态模型的用户