DSH Plugins
返回列表
🧰

dsh-realtime-voice

联网工具 更新于 2026.08.25

在终端中运行以下命令:

dsh plugin install AlexKaiqi/dsh-realtime-voice

将以下提示词粘贴到 DeepSeek Harness 对话框中:

在 DeepSeek Harness 中执行 dsh plugin install AlexKaiqi/dsh-realtime-voice 即可安装该插件,完整源码地址为 https://github.com/AlexKaiqi/dsh-realtime-voice

插件介绍

构建实时语音产品意味着要与 WebRTC 握手、WebSocket 帧协议、语音识别、大模型调度、语音合成以及各家供应商不同的事件模型打交道。dsh-realtime-voice 将这些复杂性全部隐藏在 DSH Host 边界之后,将产品侧的接口简化为四步:开启语音对话、观察标准化事件、执行产品自有的业务动作、结束对话。调用方只需选择已注册的模型路由,无需关心底层是 OpenAI Realtime 还是豆包 Realtime Duplex,更无需自行管理传输协议。

插件覆盖了完整的实时语音闭环:边听边说、自然的打断机制(浏览器端保守检测叠加供应商 VAD 作为权威轮次边界)、排他性麦克风租约防止多个会话争抢同一输入设备、标准化对话事件流、产品层动作注册与执行循环,以及低开销的待机原语 recognize()——它本身不打开任何供应商实时会话,仅在唤醒词匹配后才将缓冲音频作为首轮真实交互回放。浏览器媒体异常被归一为稳定的可本地化错误码,豆包输出额外提供有界音频电平事件用于数字人动画驱动,且不向消费方暴露原始 PCM 数据。

该插件适合在 DeepSeek Harness 上构建语音 Agent 的产品团队:需要在中国供应商(豆包)与 OpenAI 等海外供应商之间灵活切换,同时希望保持授权策略、持久上下文和业务语义与底层线路协议彻底解耦。插件本身不创建第二个 Agent、不拥有长期记忆、不决定动作是否被授权——这些职责始终保留在集成它的产品插件中。

使用场景

  • 在 DeepSeek Harness 上构建支持自然打断的实时语音 Agent 对话界面
  • 在中国豆包与海外 OpenAI 实时语音之间无缝切换供应商而不改动产品代码
  • 通过有界音频电平事件驱动数字人面部动画,同时保持原始 PCM 不暴露给前端

适合人员

  • 在 DeepSeek Harness 上构建语音产品的团队,希望抽象掉 WebRTC、WebSocket 和 VAD 等底层细节
  • 需要在多个语音供应商之间灵活路由、同时保持授权与业务逻辑在产品层的架构师
  • 为浏览器端数字人或语音交互产品提供全双工实时语音能力的开发团队