dsh-vision
在终端中运行以下命令:
dsh plugin install HarryLi-7/dsh-vision
将以下提示词粘贴到 DeepSeek Harness 对话框中:
在 DeepSeek Harness 终端中执行 dsh plugin install HarryLi-7/dsh-vision 即可安装,插件源码位于 https://github.com/HarryLi-7/dsh-vision ,安装后重启 dsh web 生效。
插件介绍
DSH(DeepSeek Harness)的纯文本模型天然"看不见"图片:GUI 会拦截粘贴,模型侧只接受文字。dsh-vision 插件正是为此而生——它在窗口层拦截图片和拖拽,将图片上传到本地后以文件路径的形式注入输入框,让模型始终只处理文本,却在幕后完成真正的图像识别与生成。
识别侧输出结构化 JSON 证据(自然语言描述、OCR 逐行像素框、布局区域、实体),也可切换为纯文本简述;生成侧支持 auto、HD、4K 三档质量,图片以卡片 + 灯箱形式内嵌在对话中,可下载或直接在 Finder 中打开。两条链路均走 Codex → Gemini → Zhipu 多引擎故障转移,任一引擎不可用时自动降级,所有临时数据遵循"用完即焚"策略,上传文件默认 7 天自动清理。
如果你的 DSH harness 跑的是纯文本模型,手里已有 ChatGPT / Codex 登录态,偶尔又需要"看一眼图"或"出一张图",dsh-vision 就是一个零额外账号、参数全可在设置页调整、对现有 Codex 数据只读的个人级视觉补全层。
使用场景
- 纯文本模型对话中需要让模型看懂粘贴或拖入的本地图片
- 从提示词生成图像并以卡片形式内嵌在 DSH 对话中查看和下载
- 单个视觉引擎不可用时自动降级到下一个引擎保证识别或生成不中断
适合人员
- 已登录 Codex / ChatGPT 账户、在 DSH harness 中跑纯文本模型的个人用户
- 需要免费或低门槛图像识别与生成而不愿额外注册付费服务的开发者
- 希望所有视觉参数在 DSH 设置页统一调整、临时数据用完即焚的轻量工作流使用者