dsh-llama-responses
在终端中运行以下命令:
dsh plugin install SnowRikka/dsh-llama-responses
将以下提示词粘贴到 DeepSeek Harness 对话框中:
在 DeepSeek Harness 中执行 dsh plugin install SnowRikka/dsh-llama-responses 即可安装,源码仓库为 https://github.com/SnowRikka/dsh-llama-responses,安装后按 patch 将子代理路由到 provider: llama-responses 即可启用本地模型。
插件介绍
每次 DeepSeek Harness 派生子代理,都会走官方 API 消耗 token,主代理和子代理叠在一起成本翻倍。dsh-llama-responses 把子代理的推理路由到本地 llama.cpp llama-server,主代理继续用 DeepSeek 官方模型保证质量,子代理走本地模型把重复性任务的 API 开销压到接近零。
插件通过 OpenAI Responses 协议(/v1/responses)对接 llama-server,支持多轮记忆、工具调用流式输出、用量统计和中断恢复。最关键的设计是上下文隔离:subagent_fork 被重定向到 spawn 提供方,子代理只能看到父代理显式写入指令文本的背景,父会话历史、已完成轮次一律不进入子代理上下文,既避免上下文膨胀,也堵住信息泄漏通道。
适合重度使用 dsh 子代理、本地有 GPU 能跑 llama.cpp 模型、希望在保持主代理质量的同时显著降低推理成本的开发者。插件自带委派规范 SKILL,约束同一时刻最多一个子代理并发,指令必须自包含,降低多代理协作的复杂度。
使用场景
- 主代理保留官方模型质量,批量子代理任务路由到本地 llama-server 以降低 token 开销
- 敏感任务要求子代理与父会话完全隔离,避免历史上下文泄漏到子代理
- 本地 GPU 已部署 llama-server,希望无缝接入 dsh 子代理委派体系
适合人员
- 重度使用 DeepSeek Harness 子代理能力的开发者
- 本地拥有 GPU 并运行 llama.cpp 的推理工程师
- 希望在保持主代理质量的同时控制 API 成本的技术团队