dsh-dual-model-eval
在终端中运行以下命令:
dsh plugin install huangdaxianer/dsh-dual-model-eval
将以下提示词粘贴到 DeepSeek Harness 对话框中:
在终端执行 dsh plugin install huangdaxianer/dsh-dual-model-eval 完成安装,插件源码见 https://github.com/huangdaxianer/dsh-dual-model-eval
插件介绍
在 DeepSeek Harness 中评测多个编码模型,最头疼的往往是"各跑各的、结果没法直观对比"。dsh-dual-model-eval 把这件事做成了开箱即用的并排实验:一条 prompt 同时投给两到四个已配置的模型路由,每个模型在从同一 commit 创建的独立 Git worktree 中并发工作,互不干扰。你在 Chat 标签页里就能看到每张结果卡片实时流入的工具调用轨迹、耗时、token 用量和 TTFT,展开后还有逐段解码细节与工具参数,不用翻日志。
对比的核心价值在于看得见的差异:最终回复并排呈现,行变更统计精确到 +added / −deleted 行数、百分比和变更文件数,还可以直接预览或下载单个改动文件乃至完整候选 worktree。当你选定满意的那一版,点击 Adopt this result 即可将该 patch 提交为本地 commit 并推进共享基线;后续轮次自动继承已采纳的对话上下文,未选中的候选则被隔离在外。插件内置的 composer gate 还会阻止你在未采纳任何候选前就发起下一轮,确保每一轮对比都建立在已确认的代码基线上。整个过程只操作本地仓库,绝不推送远程,也不触碰全局 Git 身份。
这个插件适合正在用 DeepSeek Harness 做日常编码、想横向验证多个 LLM 在真实任务上谁更靠谱的工程师和架构师,也适合需要为团队选型提供可复现实验证据的技术负责人。
使用场景
- 在同一条编码 prompt 上并排跑 2~4 个 LLM 路由,实时对比工具轨迹与行变更
- 采纳满意候选后一键推进基线,下一轮自动继承已确认的对话上下文
- 为团队模型选型提供可复现、可下载的完整候选 worktree 证据
适合人员
- 日常在 DeepSeek Harness 中编码、想横向验证多个 LLM 表现的工程师
- 需要为模型选型出具可复现实验报告的技术负责人
- 研究编码代理工具调用行为差异的 AI 研究员