mimo-vision
在终端中运行以下命令:
dsh plugin install wulusai2333/mimo-vision
将以下提示词粘贴到 DeepSeek Harness 对话框中:
在终端执行 dsh plugin install wulusai2333/mimo-vision 即可安装该插件,源码见 https://github.com/wulusai2333/mimo-vision
插件介绍
当主模型不具备视觉输入能力时,让 AI 看懂一张图片往往需要额外的工具链和流程。mimo-vision 正是为此而生:它作为 DeepSeek Harness 的原生插件,注册一个 describe_image 工具,将图片发送到 mimo-v2.5 多模态模型,再把文字描述交还主模型,充当一座简洁的视觉桥梁。
核心能力方面,该插件原生支持 PNG、JPEG、GIF、WebP、BMP 等常见格式;对于 SVG、TIFF、HEIC、PSD、AVIF 等扩展格式,则在本地安装 ImageMagick 的情况下自动转码为 PNG 并缩放到 2048px 以内,节省 token 消耗。路由策略上,请求优先走免费通道,失败后自动回退到付费通道,也可一键关闭付费回退。架构层面,整个注册、依赖声明、卸载清理均通过 DSH 原生的能力接缝完成,结构上保证卸载零残留。
适合使用 DeepSeek Harness、主模型缺少视觉能力、又需要频繁让 AI 描述或分析图片的开发者。无论是处理设计稿、截图还是用户上传图片,只需一句自然语言即可调用,无需自行搭建多模态推理管道。
使用场景
- 主模型无视觉能力时让 AI 描述图片
- 批量处理 SVG、HEIC、TIFF 等多种格式图片并获取文字描述
- 让 AI 分析设计稿、截图或用户上传图片
适合人员
- 使用 DSH 且主模型缺少视觉能力的开发者
- 需要轻量级多模态推理管道的团队
- 想避免自建推理链路的独立开发者