按标签浏览
# 多模态推理 / Multimodal Reasoning(20)
为 DeepSeek Harness 补充视觉能力:当主模型不支持图片时,调用独立视觉模型分析原图,并以附件上下文形式辅助 DeepSeek 生成最终答案,支持云视觉与本地 OCR 回退。
Guide Dog 插件通过 MiniMax 为 DeepSeek Harness 添加多模态能力,支持图像描述、内容生成和语音交互。
全模态推理工作站:多卡VLM图像分析、本地视觉工具、图像与视频生成、语音合成与克隆,统一设置页即时生效。
dsh-vision 让纯文本模型自动通过视觉模型桥接看图,将图片消息转为文字描述附加到会话中。
为纯文本代理提供 read_image 工具,调用任意 OpenAI 兼容视觉模型按工作区路径识图并回答。
将 Qwen-MM-Plugins 集成至 DeepSeek Harness,赋予纯文本模型图片、视频、文档理解及网络搜索、3D/CAD 等多模态能力。
为 DSH 智能体注册 vision_analyze 视觉分析工具,通过可配置的多模态模型实现图片 OCR、截图分析与图表理解,零依赖且持久化全局可用。
为 DeepSeek 纯文本模型接入视觉能力,由独立视觉模型将图片描述为文字后交由文本模型推理,文本模型无需直接处理图片。
将 Grok 订阅接入 DSH 作为 LLM 提供方,支持 grok-4.6/4.5 原生多模态推理,通过 chat-completions 端点发送文本与图像。
为纯文本 Agent 提供视觉能力,通过调用 DeepSeek VL、GPT-4V 等视觉 API 实现图像描述、元素定位、检测与裁剪。
为 DeepSeek Harness 接入 Seedance 2 公共 API,支持多引擎图像与视频生成,并提供任务查询及账户辅助工具。
通过 NanoBananaPro API 为 DeepSeek Harness 提供原生图像生成、视频生成、任务查询与余额管理等工具。