DSH Plugins
返回列表
dsh-force-compact

dsh-force-compact

模型推理 更新于 2026.08.26

在终端中运行以下命令:

dsh plugin install falling-ts/dsh-force-compact

将以下提示词粘贴到 DeepSeek Harness 对话框中:

在 DeepSeek Harness 终端中执行 dsh plugin install falling-ts/dsh-force-compact 即可安装该插件,完整源码仓库见 https://github.com/falling-ts/dsh-force-compact 。

插件介绍

自托管 llama.cpp 推理时,上下文窗口往往只有数十 K token,对话稍长便撞上硬墙。dsh-force-compact 的解决思路是主动压缩会话本身:在触发阈值前将较早历史摘要为紧凑头注,同时逐字保留最近 N token 的完整对话,让模型始终在小而精的提示上推理,兼顾深度记忆与低延迟。

核心能力包括两套压缩引擎(官方服务优先、内置持久化事务兜底)自动切换,无需手动干预;压缩调用单独关闭思考模式而不影响其他业务请求;实时 UI 徽章展示压缩状态(压缩中/完成/工作中);阈值与保留量均可热更新,无需重启实例。所有数据本地处理,零 API 费用、零出站流量。

适合使用本地 llama.cpp 或 OpenAI 兼容端点部署大模型、上下文窗口有限、注重隐私与成本、希望在不牺牲推理质量的前提下延长有效会话长度的开发者与自托管用户。

截图预览

使用场景

  • 自托管 llama.cpp 模型上下文窗口有限,希望在不扩展硬件的前提下延长有效会话
  • 需要频繁进行长对话且不希望支付按 token 计费的 API 费用
  • 部署在离线或内网环境,要求所有推理数据不出本地

适合人员

  • 使用 llama.cpp 或 OpenAI 兼容端点自托管大模型的开发者
  • 注重隐私、零出站流量的本地推理用户
  • 使用 DeepSeek Harness 并依赖 Cordis 插件体系的 agent 构建者