dsh-plugin-vllm-ascend-profiler
在终端中运行以下命令:
dsh plugin install nutsDad/dsh-plugin-vllm-ascend-profiler
将以下提示词粘贴到 DeepSeek Harness 对话框中:
在终端执行 dsh plugin install nutsDad/dsh-plugin-vllm-ascend-profiler 即可从 GitHub(https://github.com/nutsDad/dsh-plugin-vllm-ascend-profiler)安装本插件,安装完成后重启 profile 即可在侧边栏看到 Profiler 分析入口。
插件介绍
升腾 NPU 上 vLLM 推理变慢时,瓶颈可能在 Host 调度、NPU 计算、跨卡通信或 H2D/D2H 拷贝,但 CANN 与 torch_npu 导出的 profiling 产物(trace_view.json、kernel_details.csv、op_statistic.csv 等)存在裸 JSON 数组、CSV 表头跨版本漂移、Prefill/Decode 标签缺失等大量解析陷阱。本插件将这些复杂性全部内化——拖入产物或指向服务器目录即可,无需自维护解析管线。
工作流为六步:导入产物 → 概览与瓶颈定位 → Host/Device 算子泳道图(时序取证)→ 大类构成条与算子耗时分布 Treemap(占比归因)→ 五节点推理链(瓶颈打分、量化证据、根因推断、优化行动、预期收益)→ 优化前后对比。三大可视化模块共享同一筛选状态,点击泳道图算子条,Treemap 与构成条同步高亮;每一条结论均可追溯到具体指标、门限与推算公式,Prefill 与 Decode 两阶段分别报告。最终导出自包含 Markdown 或打印级 PDF 报告,可直接用于设计评审或工单。
适合在升腾 NPU 上做推理性能优化的 ML 工程师与 DevOps:需要快速定位主导瓶颈、验证配置改动是否生效、并产出可追溯的结论报告,而不必维护一套前端可视化管线。插件零运行时依赖,纯 ESM 包,安装后重启 profile 即可使用。
截图预览
使用场景
- 定位昇腾 NPU 上 vLLM 推理瓶颈:Host 调度、NPU 计算、跨卡通信或数据拷贝,并给出可追溯的结论。
- 导入优化前后的两组 profiling 产物,自动配对对比墙钟、NPU 忙碌率、Host 独占等指标,验证改动是否生效。
- 从 CANN 与 torch_npu 导出的 trace_view.json、CSV 等多份产物中一键生成自包含 Markdown 或 PDF 性能优化报告。
适合人员
- 在昇腾 NPU 上部署 vLLM 推理服务的 ML 工程师
- 负责推理服务性能调优的 DevOps 或 SRE 工程师
- 需要从 profiling 产物中快速提取结论并产出评审报告的数据分析人员






