DSH Plugins
返回列表
🤖

xby-extract-image

模型推理 更新于 2026.09.02

在终端中运行以下命令:

dsh plugin install xby-skill/xby-extract-image

将以下提示词粘贴到 DeepSeek Harness 对话框中:

在 DeepSeek Harness 终端中执行 dsh plugin install xby-skill/xby-extract-image 即可安装该插件,完整源码地址:https://github.com/xby-skill/xby-extract-image

插件介绍

当你想让大模型"看"一张图,第一步往往不是分析,而是折腾:图可能在本地磁盘、某个网页链接里、或者刚从剪贴板剪下来的 base64 串中。格式不一、编码不同,手动拼接既容易出错也拖慢节奏。xby-extract-image 把这条链路收敛成三个工具调用——本地文件、HTTP/HTTPS URL、base64 数据各取所需,统一输出为 LLM 可直接消化的 base64 图像,省掉你重复编写读取、编码、清洗的胶水代码。

在提取之上,它同时提供视觉内容理解、OCR 文字提取和物体识别三项分析能力,覆盖截图、照片、流程图、文档扫描件等常见素材。配合 set_xby_apikey 一次设置、持久化生效的密钥管理,整个从"拿到图"到"读懂图"的过程可以在对话内连续完成,不需要中途切换终端或手动贴文件。

如果你正在构建需要多模态理解的 Agent 流程、做竞品截图批量化读取、或者只是想让模型帮你把一张网页图里的表格文字抽出来,这个插件都能作为轻量级的前置图像管道,直接嵌进现有工作流中。

使用场景

  • 对网页截图进行视觉内容理解和文字提取
  • 批量处理本地文档扫描件中的 OCR 文字
  • 将剪贴板中的动态图像直接送入 LLM 分析

适合人员

  • 构建多模态 Agent 流程的开发者
  • 需要批量读取竞品截图或报表的团队
  • 希望免去手动编码、直接把图喂给模型的工程师