DSH Plugins
返回列表
🤖

dsh-md-convert

模型推理 更新于 2026.08.30

在终端中运行以下命令:

dsh plugin install yakoylp/dsh-md-convert

将以下提示词粘贴到 DeepSeek Harness 对话框中:

在 DeepSeek Harness 终端中执行 dsh plugin install yakoylp/dsh-md-convert 即可安装该插件,源码仓库位于 https://github.com/yakoylp/dsh-md-convert

插件介绍

丢给它一份 Word、Excel、PPT,甚至一张扫描件 PDF,拿回来的 Markdown 里标题层级、列表、管道表格、段落顺序全都在。dsh-md-convert 要解决的就是这个问题:做 RAG 知识库、给 LLM 喂语料、批量归档杂七杂八的文档时,结构一旦在中途丢失,下游就全废了。它基于 MarkItDown 引擎,把"结构级排版保留"当作硬指标,而不是转换器的附带效果。

真正区分它的是扫描件 PDF 的处理方式。不是无脑整页 OCR,而是一条模块化路由流水线:PP-DocLayout-L 先做版面分析,再按区域分别派给 RapidOCR(文字)、SLANet + RT-DETR(表格)、FormulaNet(公式)、印章注释。所有模型轻量、纯 CPU 推理,首次下载到本地缓存后完全离线运行,不做任何网络检查。老格式 .doc/.xls/.ppt 则自动探测平台,走 WPS、Office COM 或 LibreOffice 另存为现代格式后再交给 MarkItDown,平台差异对用户透明。

两个入口:批量友好的 CLI 和 dsh agent 工具 md_convert。失败时必定带上稳定错误码(E_OCR_EMPTY、E_LEGACY_CONVERT 等),方便脚本和下游工具做分类处理。Python 与 OCR 依赖首次使用时自动 pip install,临时文件用完即删,异常退出也有信号钩子兜底清理。它是工程师做批量文档转 Markdown、DeepSeek Harness 用户搭 agent 工作流、或者团队手里有一堆扫描件 PDF 需要变成 LLM 就绪文本时,该拿起来的那支插件。

使用场景

  • 批量将 Word、Excel、PPT 转为保留标题与表格的 Markdown,供 LLM 管道直接使用
  • 将扫描件 PDF 经版面路由 OCR 识别后导出为结构化 Markdown
  • 在 DeepSeek Harness agent 工作流中调用 md_convert 工具完成文档预处理

适合人员

  • 需要批量文档转 Markdown 的 AI 工程师
  • 搭建 DeepSeek Harness agent 工作流的开发者
  • 持有扫描件 PDF 需变成 LLM 就绪文本的团队