dsh-model-manager
在终端中运行以下命令:
dsh plugin install Ansonfishing/dsh-model-manager
将以下提示词粘贴到 DeepSeek Harness 对话框中:
在 DeepSeek Harness 中执行 dsh plugin install Ansonfishing/dsh-model-manager 即可安装,完整源码见 https://github.com/Ansonfishing/dsh-model-manager
插件介绍
同时跑 llama.cpp、SGLang、vLLM 几路本地推理服务,参数散在终端历史和笔记本里,显存够不够全凭感觉,OOM 之前根本不知道配置超了。dsh-model-manager 把这些碎片收进一个面板:服务在哪张卡上跑、谁在跑、健康状态如何,一眼看清;注册、停服、测速都在同一个视图里完成。
参数管理是这块面板的核心。每个「模型 × 框架 × GPU」组合可以存一版命名 Profile,参数表按模型、上下文、KV、投机解码、采样、性能、并行、服务、其他九个逻辑组固定排序;同一模型不同量化版按参数并集对齐展示,本版未设的字段以灰行标出「其他量化:值」,量化间差异无需来回切换就能比完。推荐值走实跑值、兄弟量化、官方最佳实践三级溯源,每格标注来源,无依据不臆造。
几个容易踩的坑被提前兜住了:保存 Profile 时按上下文长度和 batch 估算 KV 占用,超出目标卡容量立刻给 warning,不用等 GPU 炸掉才知道;一键测速支持固定 prompt 的 tok/s 统计,也支持满上下文热测,先校验实际可用上下文再跑 warmup,记录 TTFB、prefill、decode 三段耗时。安全方面绝不 pkill,停外部服务需要显式 force 加两次点击确认,DSH 自身推理端口额外提示「将中断当前会话」。
适合在本地一台多卡机器上同时维护多套推理服务、经常换量化版本或跨框架对比参数的开发者。面板是 DSH 的内置 tab,装好即在会话视图出现;不想装 DSH 也可以直接 clone 仓库打开 mock 页面预览完整面板效果。
截图预览
使用场景
- 多路推理服务同时运行时统一查看各服务健康状态与端口占用
- 切换量化版本时对比不同 Profile 的参数差异并自动校验显存是否超标
- 对新拉起的推理服务做 tok/s 基线测速与满上下文热测,记录 TTFB / prefill / decode
适合人员
- 在本地多卡机器上同时维护多套 LLM 推理服务的开发者
- 需要频繁切换模型量化版本或跨框架对比推理参数的研究者
- 希望用面板取代终端历史记录来管理 KV / 上下文 / batch 配置的本地部署用户