dsh-multimodal
在终端中运行以下命令:
dsh plugin install MC5lan/dsh-multimodal
将以下提示词粘贴到 DeepSeek Harness 对话框中:
在 DeepSeek Harness 中,使用命令 ‘dsh plugin install MC5lan/dsh-multimodal’ 安装插件,完整源码地址为 https://github.com/MC5lan/dsh-multimodal。
插件介绍
DeepSeek Harness 默认专注于文本交互,用户处理图像时常常需要切换工具或手动描述内容,这打断了工作流程并降低了效率。dsh-multimodal 插件解决了这一痛点,为对话添加了多模态视觉能力,让您可以直接粘贴或拖拽图片到聊天中,插件会自动识别并转录内容,然后由 DeepSeek 继续分析和解决问题,全程无需额外步骤。
插件的核心能力包括图像转录和生成两个方面。转录时,它调用您配置的视觉端点(支持任何 OpenAI 兼容 API,如智谱、阿里云、本地 Ollama 等)将图片转换为文本,DeepSeek 再基于转录结果提供帮助;生成图像时,DeepSeek 会触发配置的图像后端产生图片并直接嵌入对话。其“空白石板”设计意味着不内置任何模型,赋予您完全的配置自由,同时提供转录缓存、视觉回退链、安全防护(如 API 密钥白名单和本地端点支持)等实用功能,确保高效且安全地使用。
该插件非常适合希望增强 DeepSeek Harness 多模态交互的用户,包括开发者调试错误截图、设计师处理界面原型、研究人员分析图表数据,以及任何需要在对话中无缝处理图像的场景。无论是依赖云端服务还是注重隐私的本地模型用户,都能通过灵活配置获得定制化体验,从而提升工作效率和对话的丰富性。
使用场景
- 诊断错误截图并提供代码修复。
- 从图表转换为SQL和Pandas代码。
- 从设计稿生成HTML和CSS代码。
适合人员
- 需要调试图像相关错误的程序员。
- 从视觉设计快速生成代码的设计师。
- 处理图表数据的研究人员和分析师。