dsh-vision-3090-fix
在终端中运行以下命令:
dsh plugin install pureexe/dsh-vision-3090-fix
将以下提示词粘贴到 DeepSeek Harness 对话框中:
在 DeepSeek Harness 中运行安装命令即可引入该插件,源码见 https://github.com/pureexe/dsh-vision-3090-fix 。
插件介绍
自托管单卡 RTX 3090 上的 vLLM 视觉模型通常以 --limit-mm-per-prompt image=1 启动,任何携带多张图片的请求都会被直接 400 拒绝。而 DeepSeek Harness 内置的 LLM 适配器只按累计字节数限制图片,从不限制数量,导致多轮对话或同一轮中多个工具各自返回一张图的场景轻松超限。dsh-vision-3090-fix 正是为填补这一缺口而生:它是一个随插件生命周期启停的本地 HTTP 反向代理,放在现有 provider baseURL 前面,逐条解析 messages 数组中所有 image_url 内容(含 tool 角色消息),将超出 maxImagesPerRequest 上限的旧图替换为稳定文本占位符,再以改写后的 body 转发上游。响应逐字节流式回传,SSE 分块行为与直连完全一致。
无需改动任何现有配置结构:dsh-llm-pi-ai 仍然拥有 provider 路由、模型列表和凭据,只需将该 provider 的 baseURL 指向本地代理端口即可。可选的 models 字段限定哪些模型 ID 受图片上限约束;不在范围内的请求经代理透传、字节级不变。请求 body 需完整缓冲后再转发(为解析 JSON 所必需),适合聊天与视觉负载,不适合大文件上传。代理刻意保持薄透传,无重试、无排队,不做负载均衡。
如果你正在用单 GPU vLLM 部署视觉模型、通过 DeepSeek Harness 的 OpenAI 兼容接口调用、并在多轮对话或并行工具调用中反复遭遇 400 错误,这个插件是最轻量的解法:无需重新部署模型、无需改动 Harness 内核,改一行 baseURL 即可让多图会话恢复正常。
使用场景
- 多轮对话中逐轮附加图片导致超限
- 同一轮内多个工具各自返回一张图片
- 单卡 vLLM 视觉模型部署遇到 400 拒绝
适合人员
- 在单张 RTX 3090 上自托管视觉模型的用户
- 通过 DeepSeek Harness 调用 OpenAI 兼容视觉接口的开发者
- 多图请求反复遭遇 400 错误的 vLLM 部署维护者