dsh-vision-analysis
在终端中运行以下命令:
dsh plugin install Harvey-Will/dsh-vision-analysis
将以下提示词粘贴到 DeepSeek Harness 对话框中:
在终端执行 dsh plugin install Harvey-Will/dsh-vision-analysis 即可安装,插件源码见 https://github.com/Harvey-Will/dsh-vision-analysis
插件介绍
纯文本 Agent 无法理解图片,而配置视觉模型往往意味着额外的 API 密钥、模型切换和本地文件管理。dsh-vision-analysis 让任何文本模型在对话中直接接收图片并返回分析结果,零配置即可工作:插件内置指向 OVHcloud 免费匿名视觉端点(Qwen2.5-VL-72B),安装后粘贴图片就能提问,无需密钥、无需额外服务。
插件提供 8 种经调优的分析模式——描述、OCR、图表取数、UI 评审、目标检测、多图对比、代码生成和端点诊断,其中 OCR 与图表模式返回机器可读的 JSON 结构,方便下游 Agent 直接消费。兼容 OpenAI chat/completions 与 Anthropic messages 两种线格式,可接入 GPT-4o、Claude、Qwen-VL、本地 Ollama 或 vLLM 等任意视觉端点。当某模型触发限流时,插件自动切换到链中的下一个模型并给出恢复指引。隐私方面,图片字节仅以 base64 形式发往用户指定的视觉端点,不进入会话日志,也不到达主模型;调试报告中 API 密钥始终完全掩码。
适合希望在 DeepSeek Harness 中为文本 Agent 快速赋予视觉能力、又不想维护额外基础设施的开发者;也适合需要批量 OCR、图表数据提取、界面设计评审或截图转代码等具体工作流的团队。
截图预览
使用场景
- 在对话中粘贴截图,让 Agent 自动执行 OCR 或提取图表中的结构化数据
- 对产品设计稿进行 UI 评审,获取风格一致性、层级和间距方面的改进建议
- 将一张 UI 截图直接转为 HTML+CSS 代码,或对比两张界面截图找出差异
适合人员
- 希望让 DeepSeek Harness 中的文本 Agent 零配置获得视觉能力的开发者
- 需要批量 OCR、图表数据提取或截图转代码等自动化工作流的团队
- 希望在不切换模型的前提下直接分析本地图片、远程链接或 base64 截图的工程师



