dsh-model-deploy
在终端中运行以下命令:
dsh plugin install lhwwxy/dsh-model-deploy
将以下提示词粘贴到 DeepSeek Harness 对话框中:
在终端执行 dsh plugin install lhwwxy/dsh-model-deploy 即可安装,插件源码位于 https://github.com/lhwwxy/dsh-model-deploy
插件介绍
在决定把一个大语言模型放到具体硬件上之前,最常被问到的问题是:显存放得下吗?首 token 要多久?能跑多少并发?电费能不能接受?过去这些判断高度依赖个人经验和反复试错,而 dsh-model-deploy 用一套公开的一阶解析模型,把这些估算变成了可审计的结构化报告。
它的核心能力是把模型参数量、精度、上下文长度、并发数与互联带宽代入解析公式,输出四块结果:显存拆解(权重 / KV 缓存 / 激活 / 运行时,单卡与集群两级)、时延(TTFT 与整体,空闲与满载两种口径)、吞吐(单请求与系统 tok/s、req/s、预填充 tok/s)、功耗(空闲 / 典型 / 峰值,含 PUE 与每 token 能耗)。同时自动搜索最优的 TP × PP × DP 并行组合并给出选择理由。内置 38 款主流模型与 20 款 GPU/NPU 的规格数据,涵盖 NVIDIA、AMD、华为昇腾、平头哥含光、寒武纪、天数、沐曦、摩尔线程等国产加速卡,所有公式与系数公开,结论可用真实部署锚点复核。
它适合推理集群规划者、MLOps 工程师,以及在大模型采购或自部署前需要做快速技术验证的架构师。不需要搭建原型,输入模型与硬件参数即可获得一份带修复建议和假设条件的评估报告,帮助在几十种硬件组合中快速缩小候选范围。
使用场景
- 评估某款大模型能否在指定GPU集群上完整部署
- 对比不同精度与TP/PP/DP组合下的吞吐和时延
- 估算推理集群的功耗及每token能耗
适合人员
- 推理集群规划者
- MLOps 工程师
- 大模型采购或自部署前的架构师