dsh-gemini-multimodal
在终端中运行以下命令:
dsh plugin install RealAlexandreAI/dsh-gemini-multimodal
将以下提示词粘贴到 DeepSeek Harness 对话框中:
在 DeepSeek Harness 终端中运行 dsh plugin install RealAlexandreAI/dsh-gemini-multimodal 即可安装,源码详见 https://github.com/RealAlexandreAI/dsh-gemini-multimodal 。
插件介绍
DeepSeek 模型本质上是纯文本的,截图、语音备忘、PDF 和视频片段对它完全不可见。dsh-gemini-multimodal 将感知能力委托给 Gemini,由后者完成图像理解、音频转写、视频分析和文档阅读,而推理与决策仍留在 DeepSeek 主模型中,让 Harness 在不改变核心身份的前提下获得真正的多模态感知。
插件提供四个工具:media_understand 分析图像、音频、视频或 URL,支持 OCR、图表识读、UI 解析和语音提取;media_transcribe 输出逐字转录并在关键处附带时间戳;image_generate 将文字提示生成为本地 PNG 图片;read_document 对 PDF、Office 文档和纯文本进行摘要或问答。底层支持 Gemini REST API 单次快速调用,或本地 Antigravity CLI 零配置开箱即用,两种接入方式任选其一即可。
如果你的 DeepSeek Harness 工作流频繁涉及设计稿、会议录音、产品演示或客户交付文档,这个插件能省去手动描述媒体再贴回文本的繁琐步骤,让 Agent 直接处理原始素材并给出你真正需要的答案。
截图预览
使用场景
- 分析 UI 截图并提取布局和文字信息
- 将会议纪要音频转为逐字转录文本
- 阅读 PDF 合同并回答关键条款问题
适合人员
- 经常处理图片和文档的 DeepSeek Harness 用户
- 需要语音转写能力的 Agent 开发者
- 希望在不更换主模型的前提下扩展多模态能力的团队