DSH Plugins
返回列表
🤖

dsh-qwen38-compaction-fix

模型推理 更新于 2026.08.25

在终端中运行以下命令:

dsh plugin install zhubaohi/dsh-qwen38-compaction-fix

将以下提示词粘贴到 DeepSeek Harness 对话框中:

在 DeepSeek Harness 中执行 dsh plugin install zhubaohi/dsh-qwen38-compaction-fix 即可安装该插件,完整源码地址为 https://github.com/zhubaohi/dsh-qwen38-compaction-fix 。

插件介绍

在 NInfer 引擎上本地部署 qwen3.8-27b 时,DeepSeek Harness 的对话压缩常常以一条 summarization truncated at the token cap 的提示收场。原因并不复杂:模型默认以 xhigh 推理强度工作,把全部输出 token 都花在了内部思考上,还没来得及写出一句摘要就触顶。结果是一整段对话上下文明确丢失,会话标题同样被截短。

这个插件做的事情非常克制——只在压缩和标题生成的那一次调用上关闭思考,把输出预算完整交还给摘要文本;同时写入该模型在无思考模式下推荐的采样参数,并设置一个 max_tokens 下限防止预算被进一步压缩。其余所有对话轮次、子代理和其他模型走原路,字节级不变。匹配逻辑严格到模型 ID 精确一致才生效,防止参数串味到其他模型。

它适合在 NInfer(ninfer-serve,OpenAI 兼容 API)上跑 qwen3.8-27b、且已经在 Harness 里看到截断提示的用户。如果你用的是 llama.cpp、vLLM 或 FastMTP 等其他推理引擎,思路相同但线格式不同,这个包不覆盖那些场景。

使用场景

  • NInfer 上运行 qwen3.8 时压缩检查点反复出现 summarization truncated 提示
  • 会话标题因 xhigh 推理耗尽 64 token 预算而被截短
  • 本地推理网关需要按场景区分思考开启与关闭的采样参数

适合人员

  • 在 NInfer(ninfer-serve)上本地部署 qwen3.8-27b 的推理用户
  • 用 DeepSeek Harness 管理长对话、依赖压缩机制保持上下文的开发者
  • 需要对压缩与标题调用做精细化采样控制的运维工程师