dsh-multimodal-router
在终端中运行以下命令:
dsh plugin install hanchn/dsh-multimodal-router
将以下提示词粘贴到 DeepSeek Harness 对话框中:
在 DeepSeek Harness 中执行 dsh plugin install hanchn/dsh-multimodal-router 即可安装,详见 https://github.com/hanchn/dsh-multimodal-router
插件介绍
在本地跑 DeepSeek 时,推理能力往往不是瓶颈——真正让人头疼的是它看不到图片。把一张 UI 截图或数据图表贴进对话,模型只能回一句我无法识别图片。dsh-multimodal-router 正是为这个缺口而生:它把图像理解静默地委托给本机 Ollama 上的视觉模型,将结果以文本证据的形式交回 DeepSeek,整个对话流程对用户透明,无需手写 prompt 或配置端点。
核心能力围绕三条线展开。第一,零配置发现:插件自动扫描 Ollama 的模型元数据,找出具备视觉能力的 Gemma 4 等模型,支持拖拽、粘贴、纸夹按钮三种图像输入方式,并提供 OCR、图表、UI、代码等预设分析模式。第二,本地实时语音:当本机同时具备音频感知模型(Gemma 4 E2B/E4B/12B)和 Qwen3-TTS 语音合成时,插件会开启完整的语音对话——每 1.5 秒增量转写、静默自动发送、本地 TTS 朗读回复,点击即可打断。第三,隐私优先:所有路由默认仅在 localhost 完成,远程回退默认关闭,API 密钥只从环境变量读取,归档文件名仅含 SHA-256 摘要,不保留原始文件名。
如果你是在 Apple Silicon 或 x86 Mac 上做本地 LLM 开发、希望在不把图片出机的前提下获得多模态能力,或者想体验一套完全离线的实时语音对话,这个插件提供了一条极低门槛的路径——装完就能用,不装语音组件也完全不影响图像功能。
截图预览
使用场景
- 把 UI 截图贴进本地 DeepSeek 对话获取界面与代码分析
- 在离线环境下用 Gemma 4 完成 OCR 和数据图表识别
- 在 Apple Silicon 上体验完全离线的实时语音对话循环
适合人员
- 需要多模态能力但不愿图片离开本机的本地 LLM 开发者
- 在离线环境中通过 Ollama 使用视觉模型的工程师
- 要求隐私优先并探索实时语音交互的技术爱好者