dsh-vision-bridge
Verified@acc1143/dsh-vision-bridge · v0.1.1 · MIT
DSH 双模型路由插件:主对话留在 DeepSeek,图片任务自动分发到显式配置的视觉模型,再把分析结果交回 DeepSeek 继续。
Install
dsh plugin add @acc1143/dsh-vision-bridge Confirm the layer applied with dsh --profile default --dump-config — see the install guide.
Source
Tags
Creators
Readme
🚀 dsh-vision-bridge —— 让 DeepSeek 学会「看图」的双模型路由插件
重磅! DeepSeek Harness 专属视觉外挂来了!主对话永远留在 DeepSeek,图片自动交给视觉模型分析,整轮推理不换人!
DSH Plugin · LlmAdapter · 双模型路由 · OpenAI 兼容视觉网关 · 图片分析缓存
✨ 一句话说清它是干嘛的
DeepSeek 是纯文本模型——你以前传图,DSH 直接拒绝(Model does not support image input)。
装了它,你的 DSH 多了一个 auto 模型:图片进来,自动交给视觉模型翻译成文字,再交回 DeepSeek 完成整轮思考。你全程无感,就像 DeepSeek 突然长了眼睛 👀
| 以前 | 现在(auto) | |
|---|---|---|
| 传图片 | ❌ 直接被拒 | ✅ 自动分发 |
| 谁看图 | — | 你配的视觉模型(有界分析,≤1024 token) |
| 谁做整轮推理 | DeepSeek(但看不见图) | 还是 DeepSeek,图片只是它的"翻译文本" |
| 纯文字对话 | 正常 | 正常,零额外开销 |
| 要手动切模型吗 | 不用(但也没图可看) | 不用,auto 全自动 |
🔥 三大卖点,每一个都值得
- 主对话永远留在 DeepSeek —— 推理、工具调用、作答全在 DeepSeek,不换模型、不切来切去、上下文贯穿全程
- 纯文本轮次零开销 —— 没图就不调视觉模型,一分钱不多花
- 图片分析按内容缓存 —— 同一张图只分析一次,历史里重复出现不重复烧钱,DeepSeek 每轮看到的分析文本逐字一致
附赠:文本大脑也能换——delegateModel 改成 deepseek-v4-pro 或你任何已注册渠道,一行配置,热生效。
🛠️ 快速上手(3 步,5 分钟)
# 1️⃣ 安装(从 npm 一键安装,自动追加到 profile bundles)
dsh plugin --profile web add @acc1143/dsh-vision-bridge
# 2️⃣ 重启 dsh web
没有 npm 也没关系,同样一条命令:
dsh plugin --profile web add github:Acc1143/dsh-vision-bridge#v0.1.1
# 3️⃣ 在 settings.yaml 配好你的视觉模型
vision-bridge:
visionProvider: openai # 你在 设置→Models 配的视觉渠道(任意 OpenAI 兼容视觉网关都行)
visionModel: gpt-4o # 该渠道下的视觉模型 id
保存即生效(热加载),新会话默认就是 auto。传一张图试试 → 成了 🎉
完整配置项、换文本大脑、已知限制与故障排查见 README-fake.md(技术文档)。
🧠 原理一张图
用户传图 ──► auto-hybrid(本插件路由,声明支持图片)
│ 无图:直接委托 DeepSeek(零开销)
├─► deepseek-official(文本轮次)
│ 有图:先视觉分析(有界子任务)
├─► 视觉模型 ──► 分析文本替换图片块
└─► deepseek-official(推理 / 工具 / 作答)
密钥解析交给视觉渠道自己的适配器(llm-pi-ai),本插件不接触任何凭据。
🆚 和同类项目有什么不一样
生态里已有视觉插件,但思路不同,三者可以互补:
| 项目 | 思路 | 差异点 |
|---|---|---|
| liustack/modlens(1.4k⭐) | 图片 → 结构化 JSON 证据(OCR/版面/语义) | 把视觉做成"证据工具",输出数据 |
| Anionex/dsh-vision-toolkit(362⭐) | 视觉工具集(长截图 OCR/UI 还原/pixel diff) | 工具面更宽,偏 agent 集成 |
| dsh-vision-bridge(就是本仓库) | 双模型路由 | 主对话永不换模型,图片只是"过一道视觉翻译",整轮推理留在 DeepSeek |
🔍 检索关键词
DeepSeek Harness DSH 视觉 多模态 图片识别 双模型 自动路由 LlmAdapter vision multimodal OCR OpenAI 兼容 图片分析 auto-hybrid plugin
📜 许可证
MIT —— 详见 LICENSE。