dsh-agent-rate-limit
在终端中运行以下命令:
dsh plugin install zhourenke/dsh-agent-rate-limit
将以下提示词粘贴到 DeepSeek Harness 对话框中:
在终端执行 dsh plugin install zhourenke/dsh-agent-rate-limit,插件将从 https://github.com/zhourenke/dsh-agent-rate-limit 下载并自动注册,重启 DSH 后生效。
插件介绍
多 Agent 并发调用 LLM API 时,最容易被忽视的问题就是配额管理。没有统一的令牌追踪和限速策略,请求就会悄悄逼近甚至突破 TPM/RPM 上限,触发 HTTP 429 或临时服务器过载(例如 Nvidia Service temporarily overloaded),Agent 工作流随之中断。dsh-agent-rate-limit 正是为解决这一痛点而设计的 DSH 客户端插件。
插件拦截了 DSH 的 LLM 流式管线,将每次调用纳入 60 秒 FIFO 滑动窗口。窗口中记录的是从 API usage 数据块中读取的精确令牌消耗,包含 cacheReadTokens 与 cacheWriteTokens,使统计值与 API 账单总额一致。每次新请求发出前,插件检查窗口余量并自适应计算等待时长,确保令牌总量回到限额以下再放行。多 Agent 并发时,单个 Agent 等待期间其他 Agent 仍在产生令牌,插件会依据当前超限比例动态延长等待,避免反复碰撞配额上限。
在错误恢复层面,插件自动识别 statusCode、code 及 message 中匹配 rate limit、too many requests、quota、429、service temporarily overloaded、PI_AI_ERROR 等模式的临时性错误,以 2s、4s、8s、16s、30s 的递增退避重试,连续失败超过可配置上限后才将错误交还用户。适合需要并发调度多个 Agent、使用阿里云百炼等按 TPM/RPM 计费的 LLM 服务的开发者,也适合任何希望在 DSH 中消除 429 噪音、让工作流稳定跑完的场景。
使用场景
- 多 Agent 并发调用 LLM API,防止 TPM/RPM 超限触发 429
- 高频调用阿里云百炼等按配额计费的模型,保持稳定吞吐
- 遇到 429 或临时服务器过载时自动退避重试,减少人工干预
适合人员
- 在 DSH 中编排多个 Agent 并发调用 LLM 的开发者
- 使用阿里云百炼等平台按 TPM/RPM 计费的 AI 应用团队
- 希望消除 429 噪音、让 Agent 工作流稳定完成的工程师