DSH Plugins
返回列表
🤖

dsh-speech

模型推理 更新于 2026.09.09

在终端中运行以下命令:

dsh plugin install agent-mobile/dsh-speech

将以下提示词粘贴到 DeepSeek Harness 对话框中:

在 DeepSeek Harness 终端中执行 dsh plugin install agent-mobile/dsh-speech 即可安装语音能力插件,源码:https://github.com/agent-mobile/dsh-speech

插件介绍

DSH 官方宿主没有任何语音能力位——LLM 扩展点只认 chat 模态,附件通道只收图片。dsh-speech 通过标准 webServer 路由注册扩展点旁挂一组独立的语音服务面:/s/api 提供批量语音转写与合成,/s/ws 提供实时转录 WebSocket 会话通道。手机 App 或局域网内任意客户端凭同一个 Bearer token 即可直接调用,无需改动 DSH 源码,也无需重新编译下载。

四族适配器撑起核心能力层:阿里云百炼原生协议(批量 ASR/TTS 加句级实时转录)、OpenAI 兼容接口(OpenAI、Groq、硅基流动、自建网关,换厂商只改配置)、本地自建服务直连(SenseVoice 与 CosyVoice2,含流式合成与声纹说话人分离)、流式 WebSocket 上游(Deepgram、FunASR、sherpa-onnx、讯飞 IAT/RTASR/TTS)。批量识别、语音合成、实时转录三个选择器互相独立,可自由混搭,例如百炼批量识别加本地合成加 Deepgram 实时转录。实时转写支持 VAD 句级分段、伪流式逐字预览、本地声纹聚类说话人分离,以及讯飞长音频多人实时转写(roleType=2)与在线多方言合成。编辑器内置拉取平台最新模型按钮,模型改名时一键刷新,无需改代码。

适合需要为移动端或局域网桌面客户端接入语音输入与语音输出的团队;需要在一条管线中同时调度多家云端及本地语音模型的开发人员;以及希望一条插件命令即可在 DSH 宿主上获得完整 ASR/TTS/实时转录服务面、不 fork 不编译的用户。

使用场景

  • 手机 App 通过局域网调用语音转写与合成,无需公网暴露
  • 批量识别用百炼、合成用本地 CosyVoice、实时转录用 Deepgram,三条链路独立混搭
  • 会议长音频实时多人转写,声纹聚类自动分离说话人

适合人员

  • 为移动端或桌面客户端接入语音能力的产品团队
  • 需要同时调度多家云端与本地语音模型的开发人员
  • 希望一条命令获得完整语音服务面、不 fork 不编译的 DSH 用户