DSH Plugins
返回列表
🤖

dsh-qwen38-local-qol

模型推理 更新于 2026.09.16

在终端中运行以下命令:

dsh plugin install Yunado/dsh-qwen38-local-qol

将以下提示词粘贴到 DeepSeek Harness 对话框中:

在终端执行 dsh plugin install Yunado/dsh-qwen38-local-qol 安装该插件,完整源码地址为 https://github.com/Yunado/dsh-qwen38-local-qol ,安装完成后重启 dsh web 即可自动生效。

插件介绍

在 DeepSeek Harness 中本地运行 Qwen3.8,最大的痛点往往不在模型本身,而在推理后端与宿主之间的缝隙:思考预算无法按 effort 档位逐请求下发,摘要 checkpoint 被 token 上限悄悄截断,缺少一个即时生效的统一配置入口。dsh-qwen38-local-qol 专门填补这些缝隙,零核心补丁、零 pi-ai patchfile,完全在配置层工作,兼容 llama.cpp llama-server、NInfer 和 TabbyAPI(ExLlamaV3)三种 OpenAI 兼容 /v1 后端。

核心能力有三点。其一,逐请求思考预算:llama.cpp 线每请求携带 reasoning_effort 与 reasoning_budget_tokens,覆盖服务端 --reasoning-budget;NInfer 线预算由启动参数决定,设置面板以只读说明呈现;TabbyAPI 线原生接受两者,按档逐请求下发。其二,加固的压缩后端:摘要 prefill 先裁剪(仅保留近 N 轮推理、图片降为文本占位、工具结果按字数截断),压缩调用强制 thinking off 并启用完整输出帽,checkpoint 不再被截断。其三,DSH 设置中的 Qwen3.8 本地面板:连接、窗口、预算、裁剪旋钮即时生效并持久化到 settings.yaml(热加载),颜色状态点一目了然地标识当前默认 preset 状态。

适合自托管 Qwen3.8(含配置层的 Qwen3.8-Flash-Next)并希望通过 DSH 获得开箱即用体验的开发者。如果你已经跑着上述任一后端,希望完整掌控思考预算并获得压缩保护,而不必手工拼环境变量或修补核心,这个插件就是那个即插即用的中间层。

使用场景

  • 本地 llama-server 跑 Qwen3.8 并按 effort 档位控制每轮推理深度
  • 通过 NInfer 或 TabbyAPI 后端在 DSH 中逐请求下发思考预算
  • 摘要 checkpoint 被 token 上限截断,需要加固的压缩调用路径

适合人员

  • 自托管 Qwen3.8 并希望 DSH 开箱即用的开发者
  • 使用 llama.cpp、NInfer 或 TabbyAPI 后端的本地推理用户
  • 不想手动拼环境变量或修补核心即可调控思考预算与窗口参数的人