dsh-plugin-mm-vision
在终端中运行以下命令:
dsh plugin install Elohia/dsh-plugin-mm-vision
将以下提示词粘贴到 DeepSeek Harness 对话框中:
在已安装并初始化 profile 的 DSH CLI 中执行 dsh plugin install Elohia/dsh-plugin-mm-vision 即可安装该插件,源码见 https://github.com/Elohia/dsh-plugin-mm-vision 。
插件介绍
纯文本大模型有一个天然盲区:它看不见图片。一张 K 线图、一份 UI 截图、一帧自然照片,到了 DeepSeek、GPT-4 base 或 Claude 面前都只是无法解析的比特流。dsh-plugin-mm-vision 作为 DeepSeek Harness 的客户端插件,让任何纯文本 LLM 获得看图能力——调用你指定的视觉模型,把图片翻译成紧凑的结构化空间文字,文本模型据此重建空间认知、推理位置关系。
核心能力围绕通感编码展开:所有关键元素附带精确的百分比坐标,覆盖图表转折点、标注、按钮、文字块;当 prompt 含像素或重建等关键词时,还能输出 40x30 色块网格供原图还原。模式自适应可自动识别图表与自然图并调整编码策略,也支持手动指定 brief、full、coords、pixel 等粒度。内置 TTL 缓存让重复分析秒回,模型、baseUrl、API key 全部可配置,零硬编码。
适合需要让文本模型理解图片内容的开发者与团队:量化分析师让 LLM 读盘面截图、前端工程师让模型解析 UI 布局、研究人员让模型描述实验图表——只要你的工作流涉及文本模型与视觉内容的交叉,这个插件都能无缝嵌入。
使用场景
- 让文本模型读取 K 线图或盘面截图并提取关键数据点坐标
- 解析 UI 截图中的按钮、文字块等元素及其相对位置关系
- 将自然照片转为结构化空间描述供下游推理使用
适合人员
- 使用纯文本 LLM 构建应用、需要引入图片理解能力的开发者
- 量化分析师或金融工程师,需要让模型解读盘面与图表
- 前端或产品设计团队,需要模型自动解析 UI 截图布局