DSH Plugins
返回列表
dsh-realtime-voice

dsh-realtime-voice

工作流 更新于 2026.08.20

在终端中运行以下命令:

dsh plugin install zfu691531-hash/dsh-realtime-voice

将以下提示词粘贴到 DeepSeek Harness 对话框中:

在 DeepSeek Harness 终端中运行 dsh plugin install zfu691531-hash/dsh-realtime-voice,即可从 GitHub 仓库(https://github.com/zfu691531-hash/dsh-realtime-voice)安装预构建插件包,重启 Harness 后在设置中展开实时语音即可使用。

插件介绍

在 DeepSeek Harness 工作流中,实时语音交互长期卡在两段式困境:要么部署 Docker 与本地模型才能跑通,要么让浏览器直连多家语音 API 却绕过了 Harness 的会话调度、工具编排与记忆体系。dsh-realtime-voice 把这条管线收敛为三步——浏览器采集 PCM、Harness Host 以同源 WebSocket 代理 ASR 与 TTS、完整语句经原生输入框自动交给当前会话——无需 Python、无需本地权重,重启 Harness 即可使用。

核心能力围绕三个设计原则展开。其一,语音转写与播报全部走 Harness 原生输入框和发送流程,推理、记忆、联网、插件与工具调度仍由 Harness 完成,语音厂商没有独立回答的机会。其二,严格的 TurnCoordinator 为每轮分配唯一 ID,串行处理 ASR 状态事件,旧轮的迟到回调不会覆盖新轮或触发重复播报;播报期间新语音只追加到输入框,键盘编辑、粘贴、清空或连接断开都会撤销自动提交,杜绝长句中途截断。其三,自适应对话接场器在等待超过 800 ms 时生成不超过三句的自然承接,快回答则取消未播接场,让等待体验更平滑。千问线路支持腾讯云声纹软门控与候选插话回声复核,OpenAI 线路默认使用 gpt-realtime-2.1,两条管线共用同一 TTS 单写者队列。

适合在 Harness 桌面版或浏览器版中需要说一句自然口语就能驱动完整工作流的开发者与团队:无需维护本地推理栈,无需为语音单独建一条旁路会话,一条安装命令加对应线路的 API Key 即可让麦克风成为工作流的自然入口。

截图预览

使用场景

  • 用一句口语驱动 Harness 完整工作流,无需逐字打字输入
  • 在推理或工具执行期间自然插话,语音自动合并到原生输入框
  • 在千问与 OpenAI 语音线路间切换,无需改动工作流配置

适合人员

  • 需要语音交互但不想维护本地推理栈的开发团队
  • 已在 DeepSeek Harness 中构建工作流、希望加入自然口语入口的用户
  • 需要多语音线路灵活切换且不引入额外 Agent 服务的架构师