dsh-live-token-stats
在终端中运行以下命令:
dsh plugin install better-er/dsh-live-token-stats
将以下提示词粘贴到 DeepSeek Harness 对话框中:
在 DeepSeek Harness 终端中执行 dsh plugin install better-er/dsh-live-token-stats 即可安装该插件,源码仓库地址为 https://github.com/better-er/dsh-live-token-stats,安装完成后重启 web 端即生效,无需手工编辑任何配置。
插件介绍
在 DeepSeek Harness 中发起一次推理请求后,界面往往只甩出一句「深度潜水中」,既不显示速度、也不告诉你是不是卡死了——你只能干等。dsh-live-token-stats 就是为这个盲区而生的:它直接读取流式响应,用内置的 DeepSeek V4 词表对每个增量做字节级 BPE 切分,把实时 token/s、全程平均速率、首字延迟(TTFT)和累计停顿时长全部摊开在状态栏上,结算后再用官方 usage 字段做一次偏差对账,让你一眼看出模型是在全速思考还是已经溺水。
插件提供三层洞察。第一层是速度感知:滑动窗口实时速率与包含 TTFT 及一切停顿的全程平均并排显示,推流加速还是减速一目了然。第二层是卡死检测:相邻增量间隔一旦超过阈值,「已停顿」计时器每 100 毫秒跳一格,速度格直接消失,模型是真的停住了还是只是慢,不用再猜。第三层是精度对账:内置 added tokens 元数据与官方 tokenizer.json 逐项一致,纯文本和推理输出偏差通常仅 1~2 token,工具调用轮次约多计 40~80 token,全部如实报告并由 provider 结算数据校准。
这个插件适合每天用 DeepSeek Harness 跑推理、却苦于「到底在跑还是在装死」的开发者。它以标准 dsh 客户端加主机双半身形态存在,纯插件自包含、不改 DSH 源码,重启 web 端即生效,无需手工编辑任何配置文件。
截图预览
使用场景
- 推理时状态栏只显示深度潜水中,无法判断模型是在正常生成还是已经卡死
- 需要量化对比不同模型或不同并发负载下的实时输出速率与首字延迟
- 长文本生成过程中需要及时发现流式断流并快速介入处理
适合人员
- 日常用 DeepSeek Harness 做开发调试、需要确认推理是否健康的工程师
- 负责监控大模型推理性能与稳定性的运维或 SRE 人员
- 对 token 计费精度敏感、希望核对本地估算与官方 usage 偏差的用量管理者