dsh-plugin-local-model
在终端中运行以下命令:
dsh plugin install DZQJOKER/dsh-plugin-local-model
将以下提示词粘贴到 DeepSeek Harness 对话框中:
在终端运行 dsh plugin install DZQJOKER/dsh-plugin-local-model 即可安装,源码见 https://github.com/DZQJOKER/dsh-plugin-local-model
插件介绍
在 DeepSeek Harness 里跑本地 GGUF 模型,过去意味着手动拉起 llama-server、盯着显存、换一组参数就得重敲一遍命令行。这个插件把这些事收进了一张设置面板:第一条对话自动载入模型,连续五分钟没有交互就安静地卸载并释放显存,中间不需要你操心进程生命周期。
参数方面,插件把 KV 缓存策略、采样七件套、视觉投影、多 Token 投机解码、推理档位等十余项设置全部暴露出来,每项都带默认值说明与已覆盖标记。更实用的是顶部的参数预留区:把一整组加载与推理参数存成带名字的条目,随时一键切换,而端口、目录、密钥等环境项不会被误改。GPU 显存不够用的场景下,gpuLayersMode 默认走 auto 让 llama.cpp 按可用显存自适应卸载,避免硬塞满层导致的 OOM。
适合想在 dsh 里用本地模型做日常对话或实验的开发者:你自备 llama 工具与 GGUF 文件放进规定目录即可,插件不联网拉模型、不碰工作区文件、除本机回环外不监听任何端口,隐私边界清晰。无论是切换不同量化、试不同采样、还是在思考模型上开合 reasoning,都只需点几下面板,不用离开 Harness 的工作流。
截图预览
使用场景
- 在 dsh 内直接跑本地 LLM,无需另开终端管理 llama-server 进程
- 切换不同量化或采样参数做 A/B 对比,一键应用预设组
- 日常对话五分钟后自动释放显存,给浏览器或其他应用腾出资源
适合人员
- 想在 dsh 工作流里用本地模型但不想手动管进程的开发者
- 对隐私敏感、不希望对话数据离开本机的使用者
- 频繁切换量化、采样、推理档位做参数实验的 LLM 爱好者