DSH Plugins
返回列表
dsh-token-speed

dsh-token-speed

模型推理 更新于 2026.09.03

在终端中运行以下命令:

dsh plugin install gbeta/dsh-token-speed

将以下提示词粘贴到 DeepSeek Harness 对话框中:

在 DeepSeek Harness 终端中执行 dsh plugin install gbeta/dsh-token-speed 即可安装该插件,源码仓库地址为 https://github.com/gbeta/dsh-token-speed

插件介绍

用 DSH 客户端跑长上下文推理时,你很可能盯着滚动的文本凭感觉猜速度:这轮是 40 tok/s 还是 120 tok/s?TTFT 到底多少毫秒?这类问题其实不需要翻日志或写脚本,只需要一个始终在视野里的仪表。

dsh-token-speed 把答案做成 Web GUI 右下角一枚可拖拽的环形表盘。生成期间,指针和中央数字随流式输出实时爬升,数字由输出文本量乘以实测字符/token 比率估算;每一步结算后,插件立刻用 provider 上报的 usage.outputTokens 与 firstToken→completed 时间戳算出精确 tok/s,并反过来校准那个比率,让下一回合的估算更准。点击表盘即展开详情面板,一屏读完实时估算、上一步精确速度、上一步输出 token 数、上一步 TTFT 以及当前加载窗口内的累计输出,同时以颜色区分生成中、工具执行中和空闲三种状态。整个插件是纯浏览器端只读订阅,不碰任何宿主状态,拖到哪里位置都记得。

如果你日常用 DSH 桌面或 Web 客户端做推理、prompt 迭代、或多模型对比,又希望在不打断工作流的前提下对吞吐和延迟保持敏感,这只是一枚轻量表盘就能把那些藏在日志里的数字推到眼前。

截图预览

使用场景

  • 长上下文推理时实时观察 tok/s 与 TTFT,快速判断模型是否卡顿或多 token 丢弃
  • 多模型对比或 prompt 调优时,一屏读取吞吐、首 token 延迟和累计输出量,免去翻日志
  • 工具链执行期间通过表盘状态色区分「生成中」与「工具执行中」,避免误判等待时长

适合人员

  • 日常在 DSH 桌面或 Web 客户端跑推理、希望吞吐和延迟始终在视野内的开发者
  • 做 prompt 迭代或模型评测、需要量化 tok/s 与 TTFT 的工程师
  • 偏轻量 GUI 增强、不想改动宿主状态或部署额外后端服务的用户