DSH Plugins
返回列表
🤖

dsh-siliconflow-vision

模型推理 更新于 2026.08.18

在终端中运行以下命令:

dsh plugin install ShiXiangYu2/dsh-siliconflow-vision

将以下提示词粘贴到 DeepSeek Harness 对话框中:

在终端执行 dsh plugin install ShiXiangYu2/dsh-siliconflow-vision 即可安装,插件源码见 https://github.com/ShiXiangYu2/dsh-siliconflow-vision

插件介绍

DSH 的主对话模型通常只接受文本输入,当用户在会话中发来一张截图、一份扫描件或一张产品照片时,模型既无法描述画面,也无法据此回答问题。dsh-siliconflow-vision 正是为此而生:它向 DSH 注册一个 analyze_image 工具,把图片转发给硅基流动的视觉大模型(默认 Qwen/Qwen3-VL-32B-Instruct),再将识别结果注入对话上下文,让模型真正"看见"图片并基于视觉内容继续推理,全程不离开当前会话。

插件支持三种图片来源——服务器本地文件路径、http(s) URL 和 base64 data URL,用户只需在对话中说明"识别这张图"即可触发调用。识别指令可自由定制,例如"提取所有文字"或"画面里有什么动物";模型也可按需切换,从追求速度的 Qwen3-VL-8B 到主打 OCR 的 PaddleOCR-VL-1.5,覆盖通用理解与专项文字识别场景。底层使用 Node.js 原生 fetch 调用 OpenAI 兼容接口,本地图片读取后直接转 base64 发送,不产生磁盘临时文件,对运行环境几乎零额外依赖。

适合在 DSH 工作流中需要图片理解能力的开发者或运营人员:客服场景里用户粘贴截图要求解读报错、内容审核需要自动提取图中文字、产品经理在对话中丢一张竞品截图询问差异——这些过去需要切换到独立工具才能完成的步骤,现在一句自然语言即可完成。

使用场景

  • 用户在对话中粘贴截图,要求模型解读报错信息或提取关键内容
  • 批量识别文档图片中的文字,完成 OCR 文字提取与会话内摘要
  • 在会话中分析产品照片或竞品截图,获得画面描述、元素识别与对比说明

适合人员

  • 在 DSH 工作流中需要图片理解能力的开发者
  • 处理用户截图、扫描件等图片输入的客服或运营团队
  • 搭建 OCR 文字提取或通用视觉分析自动化流程的工程师