dsh-llm-deepseek-vision
在终端中运行以下命令:
dsh plugin install NagasakiSoyo-ui/dsh-llm-deepseek-vision
将以下提示词粘贴到 DeepSeek Harness 对话框中:
在终端执行 dsh plugin install NagasakiSoyo-ui/dsh-llm-deepseek-vision 即可安装该视觉插件,插件源码位于 https://github.com/NagasakiSoyo-ui/dsh-llm-deepseek-vision
插件介绍
DeepSeek v4-flash 和 v4-pro 是强大的纯文本推理模型,但遇到用户发来的图片便束手无策。dsh-llm-deepseek-vision 插件为这些模型装上一双「眼睛」,让它们在不改动推理内核的前提下获得图片理解能力。
工作原理非常直观:插件在 Harness 中注册一条名为 DeepSeek (Vision) 的 provider 路由。当请求不带图片时,流量零开销透传到默认文本推理路由(opencode-go);当请求携带图片时,一个独立的视觉模型(默认 mimo-v2.5)先将每张图描述为一段文字,纯文本模型再基于这些文字描述进行推理。文本推理引擎始终不直接接触原始图片字节,职责清晰、互不干扰。
适合在 DeepSeek Harness 环境中使用纯文本模型、又希望支持图文混合对话的开发者。插件提供视觉 provider、视觉模型、描述提示词、单次输出 token 上限、推理路由等配置项,可按需替换更便宜或更精细的视觉模型,灵活适配不同成本与精度需求。
使用场景
- 在 DeepSeek 纯文本模型对话中附加图片进行问答
- 需要理解用户上传的截图、图表或照片时
- 希望保持文本推理引擎不变、仅扩展图片输入能力时
适合人员
- 使用 DeepSeek Harness 部署文本推理服务的开发者
- 需要在纯文本模型上支持图文混合对话的产品团队
- 关注推理成本、希望灵活替换视觉模型的工程师