dsh-minimax-asr
在终端中运行以下命令:
dsh plugin install moluyao/dsh-minimax-asr
将以下提示词粘贴到 DeepSeek Harness 对话框中:
在终端执行 dsh plugin install moluyao/dsh-minimax-asr 即可从 GitHub(https://github.com/moluyao/dsh-minimax-asr)安装该插件,重启 dsh 后生效。
插件介绍
在 DeepSeek Harness 里,语音一直是个空白:让模型理解一段录音、任务结束后用喇叭念一句凝练的结论、或者完全不用手就完成一轮对话,过去都得自己搭。dsh-minimax-asr 把 MiniMax 的 asr-1.0 语音识别和 speech-2.8-hd 语音合成接成 Harness 全局插件,一次性补齐了从听、说到转写、播报的完整语音管线。它为模型注册了一个 transcribe_audio 工具,接受 wav、mp3、flac、opus、ogg 等格式,输出可以是纯文本、带说话人和词级时间戳的 verbose_json、srt 或 vtt;浏览器里,输入框旁多了一个麦克风按钮,两下点击完成录音、转写、追加草稿;每轮任务结束时,模型会调用 announce_speech 写一句专为耳朵设计的口语简报,经 SSE 推送给浏览器,用 TTS 念出来,绝不把正文念一遍。
完整免手模式是「对话」按钮:点一下,麦克风自动打开,自适应能量门限(噪声三倍、下限 0.0025、上限 0.03)判断你何时停顿,1.2 秒静音即视为一句结束,自动转写并提交;模型思考期间麦克风关闭,避免录回喇叭声;回复念完的那一刻麦克风重新为你打开,轮次计数显示在按钮上。30 秒无人说话就释放麦克风并暂停循环,不浪费额度。音色方面,插件从 MiniMax 拉取当前账号的全部 303 个系统音色,按语言分组,支持在线试听后再保存;凭据经 credentials seam 逐次解析,默认读 MINIMAX_API_KEY,放在配置文件或环境变量里均可。
适合日常用 DeepSeek Harness 做工程、写代码或跑研究的开发者:如果你经常把会议录音、播客片段或随手口述的想法喂给 agent,或者想在散步时用语音发起任务、听完结论再决定是否深挖,这个插件就是为那种场景造的。也适合想快速评估 MiniMax ASR 与 TTS 接口的团队——本地四条路由加一个实时诊断页,不用自己起服务就能把整条链路跑通、把电平门限和浏览器接线状态看得清清楚楚。
截图预览
使用场景
- 把会议录音丢给 agent 自动转写并提取要点
- 任务跑完用喇叭念一句口语结论,不用盯着屏幕
- 散步或开车时用语音发起和追问任务,全程不碰键鼠
适合人员
- 日常用 DeepSeek Harness 做编码或研究的开发者
- 经常把播客、会议录音等音频喂给 agent 的工程师
- 想评估 MiniMax ASR/TTS 接口而不想自建服务的团队