DSH Plugins
返回列表
🤖

xby-asr-f

模型推理 更新于 2026.09.02

在终端中运行以下命令:

dsh plugin install xby-skill/xby-asr-f

将以下提示词粘贴到 DeepSeek Harness 对话框中:

在 DeepSeek Harness 终端执行 dsh plugin install xby-skill/xby-asr-f,插件源码位于 https://github.com/xby-skill/xby-asr-f,安装完成后即可在对话中调用方言语音识别功能。

插件介绍

标准语音识别工具往往只覆盖普通话,遇到粤语、川渝、东北、闽南等方言便准确率骤降甚至完全失效。xby-asr-f 正是为解决这一痛点而生——它为 DeepSeek Harness 接入小笨羊 Fire-Red ASR CTC 模型,让对话流程中直接完成方言语音转文字,无需跳出当前工作流去调用外部服务。

插件提供三种灵活的音频输入方式:通过 URL 链接、Base64 编码字符串或本地文件路径,覆盖从在线流媒体到本地录音的常见场景。API 密钥在聊天中一次性设置后自动持久化,重启会话无需重复配置,减少日常摩擦。整个识别过程在 DSH 对话内闭环完成,结果可直接衔接后续的提问、翻译或摘要等指令。

它适合需要处理多口音语音数据的 NLP 开发者、构建方言聊天机器人或语音助手的团队,以及研究方向涉及方言语言学的学术用户。MIT 协议意味着可以自由集成到商业或开源项目中。

使用场景

  • 在对话中直接转录粤语、川渝、东北等方言录音为文字
  • 将本地多口音音频批量转写后送入下游翻译或摘要流程
  • 为方言客服或语音助手提供实时语音识别能力

适合人员

  • 处理多口音语音数据的 NLP 开发者
  • 构建方言聊天机器人或语音助手的工程团队
  • 研究区域语言与口音变化的学术用户