dsh-md-convert
在终端中运行以下命令:
dsh plugin install yakoylp/dsh-md-convert
将以下提示词粘贴到 DeepSeek Harness 对话框中:
在 DeepSeek Harness 终端中执行 dsh plugin install yakoylp/dsh-md-convert 即可安装该插件,源码仓库位于 https://github.com/yakoylp/dsh-md-convert
插件介绍
丢给它一份 Word、Excel、PPT,甚至一张扫描件 PDF,拿回来的 Markdown 里标题层级、列表、管道表格、段落顺序全都在。dsh-md-convert 要解决的就是这个问题:做 RAG 知识库、给 LLM 喂语料、批量归档杂七杂八的文档时,结构一旦在中途丢失,下游就全废了。它基于 MarkItDown 引擎,把"结构级排版保留"当作硬指标,而不是转换器的附带效果。
真正区分它的是扫描件 PDF 的处理方式。不是无脑整页 OCR,而是一条模块化路由流水线:PP-DocLayout-L 先做版面分析,再按区域分别派给 RapidOCR(文字)、SLANet + RT-DETR(表格)、FormulaNet(公式)、印章注释。所有模型轻量、纯 CPU 推理,首次下载到本地缓存后完全离线运行,不做任何网络检查。老格式 .doc/.xls/.ppt 则自动探测平台,走 WPS、Office COM 或 LibreOffice 另存为现代格式后再交给 MarkItDown,平台差异对用户透明。
两个入口:批量友好的 CLI 和 dsh agent 工具 md_convert。失败时必定带上稳定错误码(E_OCR_EMPTY、E_LEGACY_CONVERT 等),方便脚本和下游工具做分类处理。Python 与 OCR 依赖首次使用时自动 pip install,临时文件用完即删,异常退出也有信号钩子兜底清理。它是工程师做批量文档转 Markdown、DeepSeek Harness 用户搭 agent 工作流、或者团队手里有一堆扫描件 PDF 需要变成 LLM 就绪文本时,该拿起来的那支插件。
使用场景
- 批量将 Word、Excel、PPT 转为保留标题与表格的 Markdown,供 LLM 管道直接使用
- 将扫描件 PDF 经版面路由 OCR 识别后导出为结构化 Markdown
- 在 DeepSeek Harness agent 工作流中调用 md_convert 工具完成文档预处理
适合人员
- 需要批量文档转 Markdown 的 AI 工程师
- 搭建 DeepSeek Harness agent 工作流的开发者
- 持有扫描件 PDF 需变成 LLM 就绪文本的团队