dsh-replay-lab
在终端中运行以下命令:
dsh plugin install tbxy09/dsh-replay-lab
将以下提示词粘贴到 DeepSeek Harness 对话框中:
在 DeepSeek Harness 中执行 dsh plugin install tbxy09/dsh-replay-lab 即可安装,插件源码托管于 https://github.com/tbxy09/dsh-replay-lab 。
插件介绍
用 DeepSeek Harness 跑 Agent 时,同一个模型换个 preset、换个插件,行为轨迹就能差出一截——token 消耗、工具调用次数、甚至推理路径都可能变。但想搞清楚到底是谁改了我的请求,靠两次独立会话的前后对比很难服人:prompt 可能微调了,workspace 状态漂移了,token budget 也不一致了。dsh-replay-lab 把这件事变成一次可控实验。它从一个已完成的 DSH 回合出发,冻结该回合的 prompt 哈希、provider、model、preset 标签、system 与 tool-schema 指纹以及 workspace 快照,随后在一份校验过的隔离工作区副本中执行一次候选会话。跑完后,你会拿到一份 baseline / candidate / delta 的执行记分卡(新鲜输入 token、输出 token、缓存读取 token、耗时、步数、工具调用次数),以及独立的 request-surface 对比(路由、阶段、schema 哈希、可见工具列表)。所有证据以持久化事件保留,候选文件在运行结束后自动恢复到检查点,源工作区不被回写或回滚。插件还内置了一个沙箱证据仪表盘:你可以直接点预设(Overlay、Metric Deltas、Request Surface Diff、Execution Delta、一句话摘要),也可以随手输入任意 prompt 让它重新绘制——图表、表格、雷达、自定义迷宫都走同一个不透明 iframe,数字由宿主从回放载荷注入,无效 HTML 自动回退到内置图表。适合正在调 DSH preset 或插件行为、需要排查 tool-call 循环和无进展回合、或者想严肃对比不同请求面配置对模型轨迹影响的开发者和研究者。它不给你能力分,只给你可复核的执行度量与请求面证据,让你把我觉得标准配置更差变成一条带引用 ID 的观察记录。
截图预览
使用场景
- 排查不同 preset 下工具调用循环或无进展回合的执行差异
- 对比 Minimal、Standard、Anchored Standard 对同一回合 token 消耗与轨迹的影响
- 在隔离环境中验证插件变更是否改变了最终到达 provider 的 request surface
适合人员
- 正在调优 DeepSeek Harness preset 或插件配置的开发者
- 需要复现并归因 Agent 轨迹异常的工程师
- 对 Model × Harness 组合效应做系统研究的算法研究者






