DSH Plugins
返回列表
🤖

dsh-llm-gate

模型推理 更新于 2026.08.29

在终端中运行以下命令:

dsh plugin install d3vmeh/dsh-llm-gate

将以下提示词粘贴到 DeepSeek Harness 对话框中:

在终端执行 dsh plugin install d3vmeh/dsh-llm-gate 即可安装该插件,项目仓库位于 https://github.com/d3vmeh/dsh-llm-gate 。

插件介绍

运行本地 LLM 服务时,llama-server 等引擎往往只能同时处理一两个请求。当 DeepSeek Harness 中主代理、子代理或压缩任务恰好重叠,多出的请求被服务端静默挂起,客户端无法区分排队与失联,Node HTTP 层在 300 秒后直接抛出 terminated,整轮对话就此中断。dsh-llm-gate 将超额请求拦在 dsh 内部:请求进入 FIFO 队列后根本不发出 HTTP 调用,因此没有任何超时计时在运行,槽位释放时队首请求才被派发。你可以按供应方配置 maxConcurrent、maxQueued 与 queueTimeoutMs,排队超限则以 QUEUE_FULL 或 QUEUE_TIMEOUT 快速失败而非无限等待。该插件挂载在 llm/stream 瀑布上,覆盖主机内所有模型请求——代理、子代理、压缩、标题生成——无需逐处改造。适合在 DeepSeek Harness 中接入本地或低并发 LLM 供应方、希望消除因并发溢出导致的超时断连、且不想在业务代码里手写信号量或重试逻辑的开发者。

使用场景

  • 主代理与子代理同时向本地 llama-server 发起请求,低并发服务无法承接导致 HTTP 300 秒超时断连。
  • 压缩任务与用户对话重叠,多余的模型请求被服务端静默挂起,客户端无法区分排队与失联。
  • 多个供应方按实际 --parallel 值配置槽位,超额请求在 dsh 内部 FIFO 排队,槽位释放后自动派发。

适合人员

  • 在 DeepSeek Harness 中接入本地或低并发 LLM 供应方的开发者。
  • 使用 llama.cpp / llama-server 且 --parallel 较小、希望消除并发溢出超时的用户。
  • 不想在业务代码里手写信号量或重试逻辑、追求最小侵入式并发治理的 Harness 使用者。