duhai-vision
在终端中运行以下命令:
dsh plugin install hamliy-feng/duhai-vision
将以下提示词粘贴到 DeepSeek Harness 对话框中:
在 DeepSeek Harness 中执行 dsh plugin install hamliy-feng/duhai-vision 即可安装来自 https://github.com/hamliy-feng/duhai-vision 的 Duhai Vision 视觉适配器插件。
插件介绍
Codex 与 DSH 处理图片任务时,视觉入口往往是固定的:额度边界不清晰、Token 口径不透明、失败后缺少可追溯的回退机制。Duhai Vision 把图片识别从内置通道拆成一个可替换的视觉适配层,让批量 OCR、长文档、UI 截图、古籍报刊等场景都有明确的路由规则、调用预算和降级策略。
所有视觉任务默认走 PaddleOCR-VL 1.6,覆盖人物、建筑、物体、场景、UI、图表、文档与复杂版面,返回结构化 JSON(正文、表格、公式、印章、不确定项)交回 Agent 继续推理与验证。Qwen3-VL-Plus 仅在用户显式指定或 Paddle 不可用时作为语义后备;外部路线全部失效才回退 Codex Native,且必须说明回退原因。每个任务最多两次外部调用,全链路记录提供方、模型、页数、耗时与不确定项,避免把未知值写成 0。同一仓库同时服务 Codex Skill 与 DSH Plugin,两端复用相同的路由规则、执行器与返回结构,无需分别维护。
适合的对象:经常需要 AI 阅读文档、表格、扫描件、UI 截图或处理批量图片的开发者;在意免费额度(AI Studio 当前每用户每模型每日 3000 页)与成本可控的团队;以及需要可审计、可替换视觉管线的工程用户。Duhai Vision 不替代 Agent 的推理与工具编排能力,而是把视觉提取这一层做成独立、可观测、可降级的基础设施。
截图预览
使用场景
- 批量阅读古籍、侨批、复杂报刊等文档并提取结构化内容
- 对 UI 截图、商品图、开放场景进行视觉理解与推理
- 长文档、表格、印章、公式的结构化提取与交叉验证
适合人员
- 需要 AI 阅读文档、表格、扫描件的开发者
- 关注免费额度与成本可控的视觉工作流团队
- 需要可审计、可替换视觉管线的工程用户


