dsh-local-models
在终端中运行以下命令:
dsh plugin install Vmarcelo49/dsh-local-models
将以下提示词粘贴到 DeepSeek Harness 对话框中:
在 DeepSeek Harness 中执行 dsh plugin install Vmarcelo49/dsh-local-models 即可安装该插件,源码位于 https://github.com/Vmarcelo49/dsh-local-models
插件介绍
跑本地大模型从来都是一堆胶水活:终端命令、手动搭 OpenAI 兼容端点、猜显存够不够、换模型就重启服务器。dsh-local-models 把整条工作流收进 dsh Web GUI 的一个标签页里,管理本地推理像配置云服务商一样简单。
打开标签页就能在应用内浏览 .gguf 文件,插件解析 GGUF 头信息,展示架构、量化、层数和 MoE 检测,无需加载权重。随后可调优上下文滑条、MTP 推测解码深度、思考等级、可选视觉 mmproj,以及 MoE 专家放置参数。实时显存估算按权重、KV 缓存、循环状态和计算开销逐项累加,与目标 GPU 对比,给出是否放得下、安全余量和最大可用上下文三行结论。支持保存命名配置文件一键切换,也可启动路由模式让所有已存配置共用一个 OpenAI 兼容端点,模型按需加载,路由启动时自动注册进 dsh。
适合在本地 GPU 上跑原生上游 llama.cpp 的开发者和高阶用户。无需 fork、无需构建补丁、客户端零依赖,即插即用。显存估算默认按 16 GB 校准,可在源码顶部常量处修改。
使用场景
- 在 dsh Web GUI 中直接选取 GGUF 文件,调优上下文、推测解码与 MoE 参数后一键通过 llama-server 加载
- 利用实时显存估算判断 16 GB 显卡能否放下目标模型,并获取安全余量与最大可用上下文
- 启用路由模式将多个已存配置共用一个 OpenAI 兼容端点,模型按需加载、自动注册进 dsh
适合人员
- 在本地 GPU 上运行原生上游 llama.cpp 并需要将其无缝接入 dsh 的开发者
- 希望免 fork、免构建补丁、客户端零依赖地管理本地 LLM 推理的高阶用户
- 依赖实时显存估算来规划上下文长度、量化选择与 MoE 专家放置的本地模型使用者