dsh-wsl-gpu
在终端中运行以下命令:
dsh plugin install 173787247/dsh-wsl-gpu
将以下提示词粘贴到 DeepSeek Harness 对话框中:
在 DeepSeek Harness 中执行 dsh plugin install 173787247/dsh-wsl-gpu 即可安装该插件,完整源码地址为 https://github.com/173787247/dsh-wsl-gpu 。
插件介绍
在 WSL2 里做本地推理,最隐蔽的杀手不是模型选错,而是资源争抢。一张 16GB 级别的 RTX 卡同时挂着 Ollama、llama-server 和 vLLM,任何一个进程多占几百 MB 显存就可能触发 OOM,而问题往往要到加载下一个大 GGUF 的那一刻才彻底爆发。gpu_doctor 就是为这个场景设计的诊断工具:它一次性把 GPU 可见性、显存压力、实时利用率和推理端口占用全部拉出来,让你在切换模型或引擎之前就能看清当前卡到底还能吃下多少。
能力方面,它解析每张 GPU 的名称、驱动版本、显存已用与总量、compute capability;针对 Blackwell / RTX 50 系列额外给出 sm_120 和 CUDA 12.8+ 或 13.x 的兼容性提示;同时扫描 11434、1234、8000、8080 这几个常见推理端口,判断 Ollama、vLLM、Unsloth Desktop 是否在同一张卡上互相争抢。诊断结果还会指向 host_reach 和 docker_doctor 等配套工具,方便进一步排查宿主机网络或 Docker 容器层面的问题。
适合在 Windows + WSL2 环境下用 NVIDIA 单卡做本地 LLM 推理的开发者,尤其是同时在 Ollama、vLLM 或 llama.cpp 之间切换、在驱动升级或 CUDA 重建之后频繁遇到加载失败的同事。驱动更新后跑一次、CUDA 编译失败后跑一次、加载下一个大模型之前跑一次,三秒钟的输出一句话就能告诉你下一步该关谁还是该换卡。
使用场景
- 驱动升级或 CUDA 重建后 GPU 不可见
- 同时运行 Ollama、vLLM、llama.cpp 触发显存 OOM
- 加载下一个大 GGUF 前检查显存余量与端口占用
适合人员
- WSL2 环境下用单张 NVIDIA 卡做本地 LLM 推理的开发者
- 在 Ollama、vLLM、llama.cpp 之间切换的 LLM 用户
- 驱动更新或 CUDA 编译后频繁遇到加载失败的工程师