DSH Plugins
返回列表
🤖

dsh-local-llm

模型推理 更新于 2026.08.26

在终端中运行以下命令:

dsh plugin install wertyBSd/dsh-local-llm

将以下提示词粘贴到 DeepSeek Harness 对话框中:

在终端执行 dsh plugin install wertyBSd/dsh-local-llm 即可安装,插件仓库地址为 https://github.com/wertyBSd/dsh-local-llm 。

插件介绍

本地跑大模型往往意味着装一套 Ollama、忍受它的版本绑定和含糊的配置。dsh-local-llm 把这个中间层拿掉了:直接从 llama.cpp 官方发布拉取 llama-server 二进制,绑定到 127.0.0.1,再配合 Hugging Face 或任意直链下载 GGUF 模型。整个推理栈只有 DeepSeek Harness + llama-server,透明且极简。

侧边栏的 Local models 面板提供精选目录(Mistral、Llama 3、DeepSeek Coder、Qwen 2.5)和自由粘贴 .gguf 链接的入口。下载走 SSE 实时推送进度,并发去重、清理中断文件、防御路径穿越。运行时支持 CUDA、CPU、自动三种构建切换,选择持久化到磁盘,跨 Harness 重启不丢失。上下文大小按模型自动选取;对 TinyLlama 这类小模型,适配器会预估算提示词长度,超限请求在发出前就被拒绝,避免服务端莫名报错。

插件以 local-llm provider 身份注册进 Harness,工具调用自动转为 OpenAI function-tool 格式,流式输出走 /v1/chat/completions。界面支持十种语言,选择保存在浏览器端。适合希望完全掌控本地推理 runtime、不想依赖 Ollama、又想把大模型能力无缝织入 DeepSeek Harness 工作流的开发者和研究者。

使用场景

  • 在局域网内离线运行 7B/8B 级别模型进行代码补全和对话
  • 在 DeepSeek Harness 中直接选一个本地大模型替代云端 API 调用
  • 切换 CUDA 与 CPU 构建,适配不同硬件的本地推理部署

适合人员

  • 希望摆脱 Ollama 依赖、直接管理 GGUF 文件的推理用户
  • 在 DeepSeek Harness 生态中需要接入本地大模型的开发者与研究者
  • 需要灵活配置上下文大小和构建方式的本地部署工程师