dsh-eval-regression
在终端中运行以下命令:
dsh plugin install aryswisnu/dsh-eval-regression
将以下提示词粘贴到 DeepSeek Harness 对话框中:
在终端执行 dsh plugin install aryswisnu/dsh-eval-regression 即可将插件注册到当前 DeepSeek Harness 配置,源码详见 https://github.com/aryswisnu/dsh-eval-regression
插件介绍
Agent 代码的每次迭代都可能悄悄劣化那些表面看起来还不错、实则已经退化的回答。dsh-eval-regression 为 DeepSeek Harness 提供了一个轻量、确定性的回归评测门控:你只需维护一份期望片段语料,它就能在每次重放或冒烟测试中给出可复现的通过或失败证据,不再依赖主观判断。
核心工具 evaluate_golden_output 将候选输出与两组片段做严格比对——必需片段捕捉遗漏,禁止片段拦截已知的错误声明或危险降级。它不调用模型、不持久化数据,只产出 0 到 1 的确定性分数。插件还附带一个小型 CLI:读入 JSON 测试套件,将报告打印到标准输出,并以退出码 0、1、2 区分全部通过、存在失败和输入错误,方便直接卡住 CI 流水线。
如果你正在为 Agent 或 LLM 应用搭建持续集成中的回答质量基线,或者希望把评测语料当作普通可审源码来版本管理,这个插件就是一个低门槛的起步门控。它有意保持边界清晰,不替代模型质量评审、事实校验或快照回放,而是作为评估套件中第一道廉价的确定性关卡使用。
使用场景
- 在 CI 流水线中对 Agent 回答做回归门控,存在失败即阻断合并
- 维护一组期望片段语料,对重放对话做廉价且可复现的通过/失败检查
- 在发布冒烟测试中用禁止片段规则拦截已知的错误声明或危险降级输出
适合人员
- 为 LLM Agent 应用搭建 CI 质量基线的开发者
- 希望把评测语料当作普通源码做版本管理的团队
- 在评估套件中需要一道廉价且确定性门控而不想引入重依赖的工程师