dsh-qwen-multimodal
在终端中运行以下命令:
dsh plugin install wuwangmao/dsh-qwen-multimodal
将以下提示词粘贴到 DeepSeek Harness 对话框中:
在 DeepSeek Harness 终端中执行 dsh plugin install wuwangmao/dsh-qwen-multimodal 即可完成安装,插件源码位于 https://github.com/wuwangmao/dsh-qwen-multimodal
插件介绍
纯文本主模型(如 DeepSeek)无法直接理解图片、听录音或生成图像。dsh-qwen-multimodal 通过阿里云百炼的 Qwen 系列 API,在单个插件内补齐这三项能力,让主模型在一次对话中无缝调用多模态工具,无需切换模型或调整架构。
插件封装了三个核心工具:describe_image 基于 Qwen VL 完成图像理解、OCR 与图表分析,支持同时传入多张图片;transcribe_audio 基于 Qwen3-ASR 将 wav、mp3、m4a、aac 等常见格式转为文字;generate_image 基于 Qwen-Image 根据文本描述生成图片并保存为本地文件。设计上,所有媒体内容经工具层处理后仅以文本或文件路径回到主模型上下文,原始像素和波形数据不会污染对话窗口。
generate_image 还内置了生成-验证质量循环:开启 verify 选项后,Qwen VL 会自动回查生成结果是否忠实于原始 prompt,形成闭环校验。该插件适合使用 DeepSeek 等纯文本模型、又需要在日常工作中处理截图 OCR、会议录音转写或快速视觉素材生成的开发者。
使用场景
- 对截图、图表进行 OCR 与内容提取
- 将会议录音快速转为文字纪要
- 根据文字描述生成图片素材并自动校验
- 为纯文本模型补全视觉与听觉能力
适合人员
- 使用 DeepSeek 等纯文本模型的开发者
- 需要多模态能力但不想切换模型的团队
- 已接入阿里云百炼 Qwen API 的用户