dsh-web-fetch-moli
在终端中运行以下命令:
dsh plugin install GreyRaphael/dsh-web-fetch-moli
将以下提示词粘贴到 DeepSeek Harness 对话框中:
在终端执行 dsh plugin install GreyRaphael/dsh-web-fetch-moli 安装插件,重启 dsh web 后即可生效;项目源码见 https://github.com/GreyRaphael/dsh-web-fetch-moli 。
插件介绍
在 DeepSeek Harness 生态中,web_fetch 工具通常依赖 Chromium 或 Playwright 执行 JavaScript 渲染,每个实例占用 800 MB 至 1.2 GB 以上内存。在需要同时驱动企业级微前端沙箱(Alibaba Alfa、qiankun、single-spa)、无限滚动哨兵或动态 SPA 的资源受限服务器上,这一开销几乎无法承受。dsh-web-fetch-moli 将渲染后端替换为 Moli——一款基于 Rust 的超轻量无头浏览器——将单实例内存压至 50–60 MB,降幅超过 90%,让高并发抓取在普通 VPS 上即可稳定运行。
插件的核心在于以极低成本保住渲染保真度。通过 CDP Micro-Clip 布局物化配合 Page.setBypassCSP,无需任何用户脚本注入即可干净渲染复杂微前端与动态样式加载器。两级去噪管道先用 LinkeDOM 与 Mozilla Readability 剥离广告、导航栏、页脚和表单,再经 mdream(原生 Rust 实现,附纯 JS 回退)转换为面向 LLM 的 GitHub Flavored Markdown,内联 base64 图片自动折叠为紧凑尺寸占位符。内置的 Cloudflare 挑战处理器在同一页面上下文中自然等待验证通过,避免人工模拟行为。首次使用时若未检测到 Moli 二进制文件,插件会自动下载并缓存匹配当前操作系统与架构的最新发布版本,免除手动安装。
该方案适合在受限硬件上运行高并发网页渲染的 DSH 用户、需要稳定解析动态微前端与 SPA 而无须承受 Chromium 级内存开销的开发者,以及将抓取内容直接喂入大语言模型、要求干净结构化 Markdown 输出的管道团队。两种灵活后端可在本地托管的 Moli 守护进程与远程 CDP 端点之间切换,从容适配单节点与浏览器集群两种部署形态。
使用场景
- 资源受限服务器上高并发渲染 SPA 与微前端页面
- LLM 数据管道中抓取网页并获取干净的结构化 Markdown
- 解析受 CSP 保护或存在 Cloudflare 挑战的企业动态站点
适合人员
- 在 VPS 或轻量云服务器上运行 DSH web_fetch 的开发者
- 需要稳定解析微前端、SPA 等动态页面的前端与数据工程团队
- 构建面向大语言模型的网页内容清洗与结构化管道工程师