DSH Plugins
返回列表
🤖

dsh-context-budget

模型推理 更新于 2026.08.31

在终端中运行以下命令:

dsh plugin install d3vmeh/dsh-context-budget

将以下提示词粘贴到 DeepSeek Harness 对话框中:

在终端执行 dsh plugin install d3vmeh/dsh-context-budget 即可从 https://github.com/d3vmeh/dsh-context-budget 安装该插件并完成初始配置。

插件介绍

在本地 GPU 上跑大模型时,模型宣称的上下文窗口往往远大于硬件实际能高效处理的范围。一个 27B 模型号称支持 256K 上下文,但 prefill 速度在刚过 100K 时可能从 300 tokens/s 骤降到 70 tokens/s,GPU 甚至在窗口填满之前就卡死。dsh 原生的压缩机制按固定比例触发,完全不感知实际性能,结果就是对话前几轮秒回、后几轮等半小时甚至直接挂起。

dsh-context-budget 在每一步 agent 行动前对每个受保护的 provider 路由做三项实时检查:硬 token 上限(hardCeilingTokens)、上轮首 token 延迟(maxTtftMs)、以及基于已测 prefill 速率预测的冷缓存等待时间(maxColdPrefillMs)。prefill 速率来自 dsh 自身的 usage 报告和 wall-clock 计时,不直接和模型服务器通信,因此对任何 dsh 流式 provider 都适用。任意一项超标即触发响应,未配置的项自动跳过。

触发时插件可选择 warn 或 compact 两种动作。warn 在 dsh 终端打印一行诊断信息,标注触发的检查项、当前值以及现在压缩的预估成本;compact 则调用 dsh 的压缩引擎,保留最近 retainTokens 条消息并在工具调用边界截断,执行结果同样打印。由于本地冷压缩本身有代价,较低的阈值搭配较大的 retainTokens 通常比频繁小压缩更划算。

适合在本地 GPU 上用 dsh 跑大模型、希望上下文压缩由实际性能而非固定比例驱动的使用者。它和 dsh 内置的 compaction-basic 并行工作,后者仍保持自己的静态阈值,本插件在此基础上叠加动态测量检查和成本估算,两者不冲突。

使用场景

  • 本地 GPU 跑大模型时上下文增长导致推理速度从秒级降到分钟级
  • dsh 长会话后半段单轮响应延迟急剧上升甚至 GPU 卡死
  • 需要多轮流式对话且上下文会持续增长的应用场景

适合人员

  • 在本地 GPU 上通过 dsh 运行大模型的开发者
  • 构建多轮 AI 对话应用并关注响应延迟的工程师
  • 希望 GPU 资源利用率稳定可控的终端用户