dsh-skill-eval
在终端中运行以下命令:
dsh plugin install renjianguojianqianfan/dsh-skill-eval
将以下提示词粘贴到 DeepSeek Harness 对话框中:
要安装此插件,请在 DeepSeek Harness 中运行 dsh plugin install renjianguojianqianfan/dsh-skill-eval。源码地址:https://github.com/renjianguojinqianfan/dsh-skill-eval
插件介绍
在 DeepSeek Harness (DSH) 的生态中,技能的精准路由直接决定了用户体验与系统的智能化程度。然而,如何确保技能描述能准确引导大模型触发相应的技能,往往是一个难以验证的难题。`dsh-skill-eval` 插件正是为了解决这一痛点而生,它提供了一套自动化的评估机制,帮助开发者客观地衡量技能路由的可靠性。
该插件的核心能力在于利用 LLM 评判者来模拟真实的路由决策过程。它会精确复刻 DSH 官方的技能目录提示,并对每个测试查询进行“是/否”的裁决,最终生成包含准确率、召回率、精确率以及混淆矩阵在内的详细报告。这种可复现的测量方式,能够清晰地揭示技能描述是过度触发还是触发不足,从而为优化提供数据支持。
这款工具非常适合 DSH 插件开发者、模型工程师以及正在构建复杂智能对话系统的团队。无论是为了验证新技能的接入逻辑,还是为了对比不同评判模型在路由任务上的表现,`dsh-skill-eval` 都能提供直观且专业的评估视角,确保你的技能系统在实战中表现稳健。
使用场景
- 验证技能描述的准确性
- 测试大模型对技能的触发逻辑
- 分析技能系统的召回率与误报率
适合人员
- DeepSeek Harness 插件开发者
- 大模型应用工程师
- 模型评估与测试人员