按标签浏览
# 视觉理解 / Vision understanding(22)
ModLens 是 DeepSeek Harness 的视觉插件,让纯文本模型直接读取聊天中粘贴的图片,无需保存文件或传路径,零配置并支持多引擎。
给 DeepSeek Harness 增加免费视觉识图与图像生成技能,支持视觉模型路由与多引擎回退。
dsh-vision-tools 为 DeepSeek 纯文本模型提供视觉理解能力,通过粘贴、拖拽或选择图片调用外部 API 识别内容。
dsh-computer-use 插件让 DeepSeek Harness 获得真实桌面控制能力,通过截屏/录屏、视觉模型分析和键鼠操作,实现自主循环任务。
将 Qwen-MM-Plugins 集成至 DeepSeek Harness,赋予纯文本模型图片、视频、文档理解及网络搜索、3D/CAD 等多模态能力。
为纯文本 LLM 提供看图能力,调用视觉模型将图片转为带百分比坐标的结构化空间文字,支持任意 OpenAI 兼容视觉模型,零硬编码可配置。
为纯文本模型提供即插即用的图片读取:粘贴图片以[Image #N]注入,经可配置视觉模型转写为文本描述,无需修改预设。
截图后自动粘贴至 DSH 输入框,支持全局快捷键、相机按钮与生命周期绑定监听器,仅限 Windows 与 DSH Desktop。
该插件允许 DeepSeek Harness 代理使用本地 CloakBrowser 进行网页自动化与视觉理解。
为DeepSeek Harness提供图像理解、生成及浏览器自动化功能的插件。
提供图片描述与问答能力的模型推理工具,集成于 DeepSeek Harness。
为纯文本 Agent 提供视觉能力,通过调用 DeepSeek VL、GPT-4V 等视觉 API 实现图像描述、元素定位、检测与裁剪。