DSH Plugins
返回列表
🖥️

dsh-video-lens

客户端 更新于 2026.08.27

在终端中运行以下命令:

dsh plugin install dundunhan/dsh-video-lens

将以下提示词粘贴到 DeepSeek Harness 对话框中:

在 DeepSeek Harness 中安装该插件,可执行命令 `dsh plugin install dundunhan/dsh-video-lens`,源码位于 https://github.com/dundunhan/dsh-video-lens。

插件介绍

许多基于 DeepSeek Harness 的智能体只具备文本理解能力,面对本地视频文件时往往无能为力,难以完成摘要、检索或基于片段的问答。dsh-video-lens 正是为解决这一缺口而生——它让纯文本模型也能“看懂”和“听懂”视频。

插件的核心能力围绕三个工具展开:video_probe 通过 ffprobe 快速返回容器、时长、分辨率、帧率、音视频编码等元数据;video_analyze 利用 ffmpeg 的场景检测进行内容感知抽帧,并可选择性叠加语音转写,再将视觉信息交给任意 OpenAI 兼容的视觉模型,输出包含时间戳与证据的结构化 JSON;video_ask 则支持时间锚定问答,能识别“3分20秒”“第2分钟”等表达,或根据转录关键词定位相关片段并重新采样后作答。

该插件不将用户锁定在特定服务商:视觉与语音识别端点均可通过 baseUrl、模型名和环境变量灵活配置。所有媒体处理都委托给本机 ffmpeg/ffprobe,代理本身无需进行原生解码,降低了集成复杂度。

适合希望在 DeepSeek Harness 工作流中处理视频内容的开发者,无论是构建视频摘要与内容索引,还是开发基于时间点的检索问答助手,都能借助它快速为文本型代理扩展多模态感知能力。

使用场景

  • 快速获取本地视频的时长、分辨率、编码等元数据
  • 对视频进行场景感知抽帧并生成结构化内容分析
  • 根据时间点或关键词对视频片段进行定位与问答

适合人员

  • 需要为文本型智能体扩展视频理解能力的开发者
  • 构建视频摘要、索引或检索问答助手的团队
  • 在 DeepSeek Harness 工作流中集成多模态处理的用户