DSH Plugins
返回列表
🤖

dsh-llamacpp

模型推理 更新于 2026.09.01

在终端中运行以下命令:

dsh plugin install jwilson411/dsh-llamacpp

将以下提示词粘贴到 DeepSeek Harness 对话框中:

在 DeepSeek Harness 中运行 dsh plugin install jwilson411/dsh-llamacpp 即可安装该插件,源码见 https://github.com/jwilson411/dsh-llamacpp 。

插件介绍

你已经把 llama-server 跑起来了,权重也加载好了,但 DeepSeek Harness 默认没有任何原生 Provider 能直接对接它。dsh-llamacpp 就是这座缺失的桥梁:它完全绕过 Ollama 的模型注册表、/api/* 路由和自动拉取机制,只与本地 llama.cpp 二进制的 OpenAI 兼容 /v1/chat/completions 端点通信。

注册完成后,llamacpp 成为 LLM seam 上的一条标准 Provider 路由,Harness 通过 ctx.llm.stream() 将模型调用派发给它。每次调用是一次带 stream: true 的 POST;options.system 被前置为 system 消息,options.tools 映射到 OpenAI tools 数组,temperature、stop、maxTokens 原样透传。返回时,适配器按严格顺序输出 StreamChunk 序列——block-start、逐段 text-delta、block-end、usage、finish——空响应绝不会留下未关闭的 block。任何失败都会以带稳定错误码的 LlmError 抛出(PROVIDER_UNREACHABLE、PROVIDER_HTTP_ERROR、PROVIDER_PROTOCOL_ERROR、UNSUPPORTED_CONTENT 等),不会被静默吞成空流。

它刻意保持轻薄:文本进、文本出。图像块、tool-call 块、tool-result 块会被明确拒绝而非静默丢弃,因为悄悄删掉任何一块都会让模型拿到调用方从未写过的对话。它不注册任何 ctx.tools 上的工具,对 -ngl、tensor split 等卸载参数也持无意见态度。如果你的推理栈是 Ollama,这个插件不适合你。它面向的是自行编译或下载 llama.cpp、手动管理上下文窗口、希望在 Harness 下拥有一条可预测、零魔法、可替换的 Provider 通道的本地推理用户。

使用场景

  • 在本地 llama-server 上运行推理,无需 Ollama 或云 API
  • 通过切换 llama.cpp 的 --alias 参数在多个本地模型间热切换
  • 为 Harness 驱动的对话应用接入一条零魔法、可替换的本地 Provider 路由

适合人员

  • 自行编译或下载 llama.cpp 并管理权重的本地推理开发者
  • 希望摆脱云依赖、在单机上跑对话应用的团队
  • 在 DeepSeek Harness 上扩展 Provider 路由的插件开发者