dsh-baidu-ocr
在终端中运行以下命令:
dsh plugin install pipiwolve/dsh-baidu-ocr
将以下提示词粘贴到 DeepSeek Harness 对话框中:
在 DeepSeek Harness 终端中执行 dsh plugin install pipiwolve/dsh-baidu-ocr 即可完成安装,插件源码地址为 https://github.com/pipiwolve/dsh-baidu-ocr ,安装后重启 Web UI 并刷新浏览器即可使用。
插件介绍
在 DeepSeek Harness 的 Web 界面里,把一张截图或一份 PDF 转成 Markdown 并没有想象中那么顺滑——浏览器拖入文件后只给你一个 File 对象,没有真实本地路径,而 OCR 引擎恰恰需要那条路径才能读文件。dsh-baidu-ocr 补上了这一段:把文件拖进页面,宿主进程解析出真实路径、调用百度云 API、把结果写回源文件旁,全程不用打开终端或手动拼接路径。
一个 BCE IAM Key 同时驱动两个引擎。PaddleOCR-VL(同步,千帆平台)负责图片和通用 PDF,输出带版面分析、图表识别和方向矫正的 Markdown;Unlimited-OCR(异步,aip 平台)深入文档解析,公式转 LaTeX、表格转 HTML、多栏版面智能合并。按扩展名自动路由到对应引擎,也可在面板中手动指定。结果以 .md 和 .json 落入源文件旁的 ocr_output/ 目录,方便审查和二次处理。
经常需要把扫描件、合同或幻灯片转成可编辑 Markdown 的人,或者希望 Agent 在对话中直接调用 OCR 而无需自己复制粘贴文本的用户,这个插件提供了一条轻量双通道工作流:拖入面板加模型工具,一个 Key、两个引擎、拖入即识别、结果直接落盘。
使用场景
- 将扫描的合同或幻灯片拖入页面,一键转为可编辑 Markdown
- 在 Agent 对话中直接调用 baidu_ocr 工具识别本地图片路径
- 把 PDF 和办公文档批量解析为含 LaTeX 公式和 HTML 表格的结构化文本
适合人员
- 需要频繁将图片或 PDF 转为 Markdown 的文档处理用户
- 希望 Agent 自动调用 OCR 而无需手动复制粘贴的开发者
- 不想本地部署重型 OCR 引擎、偏好云端调用的轻量级用户