dsh-evidence-arena
在终端中运行以下命令:
dsh plugin install shengshifantang/dsh-evidence-arena
将以下提示词粘贴到 DeepSeek Harness 对话框中:
在 DeepSeek Harness 中执行 dsh plugin install shengshifantang/dsh-evidence-arena 即可安装该插件,仓库源码见 https://github.com/shengshifantang/dsh-evidence-arena
插件介绍
当你想比较两到三个 AI 模型在同一编码任务上的真实差距时,最缺的不是再跑一遍对话,而是一套隔离、可复现、可审计的评测流程。dsh-evidence-arena 正是为此而生:它让两到三个 Builder 在彼此隔离的 Git worktree 和独立 DSH 子运行时中并行解题,互相不可见,确保结果来自模型自身能力而非上下文串扰;每个 Builder 可分别指定不同的 Provider、模型、凭据引用和 System Prompt,实现真正意义上的跨配置对比。
对比结束后,独立 Reviewer 以零工具、密封证据模式逐条验证门禁结果;你可以通过带行号的逐文件统一 diff 审查每一处改动,展开前端候选结果在一次性回环预览中独立运行、查看日志并给出人工通过或否决判定。全部证据最终可导出为一份版本化 JSON 报告,涵盖指标、哈希、文件元数据、门禁与 Reviewer 裁定,同时自动剔除本地路径、凭据引用、子 Session 标识等敏感字段,方便团队内流转与外部审查。
如果你正在评估不同模型、不同 Provider 或不同提示词策略在编码任务上的差异,或者需要一条可复现、可审计的评测链路来支撑技术选型,这个插件提供了一条无需改动官方 DSH 源码、零额外环境变量的轻量路径。它适合使用 DeepSeek Harness 生态的开发者与研究团队,也适合任何希望在多模型编码场景中建立客观证据链的工程人员。
截图预览
使用场景
- 比较两到三个模型在同一编码任务上的产出差异
- 为技术选型或 Provider 切换提供可复现的评测证据
- 审查 AI 生成的逐文件代码改动并导出可分享的审计报告
适合人员
- 使用 DeepSeek Harness 生态的开发者与团队
- 需要跨模型、跨 Provider 编码能力评估的研究人员
- 关注 AI 生成代码可审计性与可追溯性的工程负责人