DSH Plugins
返回列表
🖥️

dsh-cyberdog-speech-sherpa

客户端 更新于 2026.08.15

在终端中运行以下命令:

dsh plugin install wuxinzhe/dsh-cyberdog-speech-sherpa

将以下提示词粘贴到 DeepSeek Harness 对话框中:

在 DeepSeek Harness 中运行 dsh plugin install wuxinzhe/dsh-cyberdog-speech-sherpa 即可安装本插件,源码仓库地址为 https://github.com/wuxinzhe/dsh-cyberdog-speech-sherpa 。

插件介绍

语音交互是 AI 助手最自然的入口,但多数方案依赖云端 API,意味着数据出网、按量计费、断网即失效。dsh-cyberdog-speech-sherpa 基于 Sherpa-ONNX 将整条语音链路搬进本地:中文流式语音识别采用 Zipformer 模型,语音合成采用 VITS 多音色引擎,全程离线、不联网、不收费,普通 CPU 即可流畅运行。

插件提供三个核心工具:stt_transcribe 将音频转写为文字,tts_speak 将文字合成为多音色语音,sherpa_models_download 在模型缺失时由 Agent 自动触发下载与断点续传,实现模型自愈。WebUI 侧内置按住说话按钮——按住录音、松开发送,最长 120 秒并带倒计时,转写结果自动填入输入框并提交,体验接近主流语音助手。

适合注重数据隐私的开发者、需要在离线或内网环境中部署中文语音交互的场景,以及希望以极低硬件成本(纯 CPU)为 DeepSeek Harness 添加语音能力的用户。整个插件零运行时框架依赖,模型总占用约 156 MB,MIT 协议,可直接集成进现有工作流。

使用场景

  • 在内网或离线环境中为 AI 助手添加中文语音交互能力
  • 保护语音数据隐私,避免音频上传到云端服务
  • 以纯 CPU 低成本部署多音色中文语音合成与流式识别

适合人员

  • 注重数据隐私、不希望语音数据出网的独立开发者
  • 需要在内网或离线环境中交付中文语音功能的团队
  • 希望以纯 CPU 低成本为 Harness 添加语音插件的使用者