DSH Plugins
返回列表
🤖

dsh-voice-mimo

模型推理 更新于 2026.09.14

在终端中运行以下命令:

dsh plugin install ch1bug/dsh-voice-mimo

将以下提示词粘贴到 DeepSeek Harness 对话框中:

在 DeepSeek Harness 终端执行 dsh plugin install ch1bug/dsh-voice-mimo 即可安装本插件,源码见 https://github.com/ch1bug/dsh-voice-mimo

插件介绍

在 DeepSeek Harness 里做语音交互,最容易被卡住的一点是后端选型:小米 MiMo 没有 OpenAI 兼容的音频端点,通用的语音插件(走 /audio/speech 或 /audio/transcriptions)直接接不上。dsh-voice-mimo 就是为此而生——它绕过兼容层,按 MiMo 官方 chat-completions 格式直接调用 mimo-v2.5-asr 做转写、mimo-v2.5-tts 做合成,把语音能力完整地嵌进 Harness 的对话流程里。

能力覆盖从输入到输出整条链路:输入端用浏览器 Web Speech API 实现零密钥的麦克风按钮,转写文字直接落进输入框;输出端每条助手回复都挂一个朗读按钮,走同源 host 路由合成,不受 Node 64 KB stdout 上限影响。Agent 工具层面,voice_transcribe 把拖入工作区的音频文件转成文本供模型阅读,voice_speak 则把文本合成为可播放的语音条或卡片,支持自然语言风格指令(如"轻快上扬")、唱歌模式,以及超过 2500 字的显式截断与标记。音色通道覆盖 preset、voicedesign、voiceclone 三种,Settings 页面里的朗读音色、语音映射和音频保留策略全部实时生效,改完点下一次朗读就换上新音色。

适合在 DeepSeek Harness 中需要中文语音交互场景的开发者:想让 Agent 能"听"音频文件并基于内容继续推理、想给回复加一键朗读、想通过风格指令控制朗读情绪,或者需要语音克隆和自定义音色设计的用户,装上即插即用。

使用场景

  • 在 Harness 对话中让 Agent 听取音频文件并基于内容继续推理
  • 给每条助手回复加一键朗读,支持风格指令和实时音色切换
  • 用自然语言控制朗读情绪,或开启唱歌模式合成歌词音频

适合人员

  • 在 DeepSeek Harness 中搭建中文语音工作流的开发者
  • 需要 Agent 处理语音输入并输出可播放音频的应用用户
  • 想探索 MiMo 音色克隆与自定义语音设计的技术爱好者