dsh-llm-gate
在终端中运行以下命令:
dsh plugin install d3vmeh/dsh-llm-gate
将以下提示词粘贴到 DeepSeek Harness 对话框中:
在终端执行 dsh plugin install d3vmeh/dsh-llm-gate 即可安装该插件,项目仓库位于 https://github.com/d3vmeh/dsh-llm-gate 。
插件介绍
运行本地 LLM 服务时,llama-server 等引擎往往只能同时处理一两个请求。当 DeepSeek Harness 中主代理、子代理或压缩任务恰好重叠,多出的请求被服务端静默挂起,客户端无法区分排队与失联,Node HTTP 层在 300 秒后直接抛出 terminated,整轮对话就此中断。dsh-llm-gate 将超额请求拦在 dsh 内部:请求进入 FIFO 队列后根本不发出 HTTP 调用,因此没有任何超时计时在运行,槽位释放时队首请求才被派发。你可以按供应方配置 maxConcurrent、maxQueued 与 queueTimeoutMs,排队超限则以 QUEUE_FULL 或 QUEUE_TIMEOUT 快速失败而非无限等待。该插件挂载在 llm/stream 瀑布上,覆盖主机内所有模型请求——代理、子代理、压缩、标题生成——无需逐处改造。适合在 DeepSeek Harness 中接入本地或低并发 LLM 供应方、希望消除因并发溢出导致的超时断连、且不想在业务代码里手写信号量或重试逻辑的开发者。
使用场景
- 主代理与子代理同时向本地 llama-server 发起请求,低并发服务无法承接导致 HTTP 300 秒超时断连。
- 压缩任务与用户对话重叠,多余的模型请求被服务端静默挂起,客户端无法区分排队与失联。
- 多个供应方按实际 --parallel 值配置槽位,超额请求在 dsh 内部 FIFO 排队,槽位释放后自动派发。
适合人员
- 在 DeepSeek Harness 中接入本地或低并发 LLM 供应方的开发者。
- 使用 llama.cpp / llama-server 且 --parallel 较小、希望消除并发溢出超时的用户。
- 不想在业务代码里手写信号量或重试逻辑、追求最小侵入式并发治理的 Harness 使用者。