Skip to main content
A

dsh-vision-bridge

acc1143/dsh-vision-bridge

DSH 双模型路由插件:主对话留在 DeepSeek,图片任务自动分发到显式配置的视觉模型,再把分析结果交回 DeepSeek 继续。

Install

dsh plugin --profile web add github:acc1143/dsh-vision-bridge

README

dsh-vision-bridge 👀

给 DeepSeek Harness 的纯文本模型配一副眼镜:主对话留在 DeepSeek,图片自动交给视觉模型翻译成文字,再拿回来接着聊。DeepSeek 全程只看到文字——它自己不知道,你也别告诉它。🤫

免费、MIT、无界面、无魔法。就是一个认真做二传手的 LlmAdapter。🧤

它绕过了什么 🔓

DSH 对图片有准入检查:模型声明 inputModalities 不含 image 时,图片在发送阶段就被拦下。DeepSeek 官方适配器是纯文本的,所以图片永远进不了会话——问题不在于模型不会看图,而在于图片连门都进不去。🚪💥

本插件注册自己的路由 auto-hybrid/auto,声明支持图片,然后在请求层做两件事:

  1. 带图轮次先把图片交给视觉模型做有界分析(固定提示词 + 输出上限);🖼️➡️📝
  2. 把图片块替换成分析文本,再委托给 DeepSeek 完成整轮推理。

于是图片进得来,DeepSeek 看到的仍是纯文本,整轮推理不换模型,使用者全程无感。🤯

顺带一提:图片分析是"有界子任务"(maxVisionTokens 兜底),视觉模型只负责描述,不负责接管你的人生。🗣️

特性 ✨

  • 纯文本轮次直接委托 DeepSeek,零额外开销 💸🚫
  • 图片分析按内容缓存:同一张图只分析一次,历史里重复出现不重复花钱 💰
  • 文本大脑与视觉大脑都可配置,换 deepseek-v4-pro 或任意已注册渠道都行 🧠🔁
  • 委托目标不支持推理档位时自动不转发 reasoningEffort,不会莫名报错 🙅
  • 密钥由视觉渠道自己的适配器解析,本插件不接触任何凭据 🔑🤐

安装 📦

# npm
dsh plugin --profile web add @acc1143/dsh-vision-bridge

# 或 GitHub(按 tag)
dsh plugin --profile web add github:Acc1143/dsh-vision-bridge#v0.1.1

# 或本地 tgz
dsh plugin --profile web add .\dsh-vision-bridge-0.1.1.tgz

装完重启 dsh web。🔁

配置 ⚙️

settings.yaml 加两行,保存即热生效:

vision-bridge:
  visionProvider: openai      # 你配的视觉渠道
  visionModel: gpt-4o         # 该渠道下的视觉模型

想换文本大脑(可选):

vision-bridge:
  delegateProvider: deepseek-official
  delegateModel: deepseek-v4-pro

它怎么工作 🗺️

传图 → auto-hybrid(声明 text+image)
        ├─ 无图:直接委托 DeepSeek
        └─ 有图:视觉模型 → 分析文本 → 委托 DeepSeek(推理/工具/作答)

同类参考 🫂

生态里其他思路的视觉方案,可互补: modlens(图片 → 结构化 JSON 证据)、dsh-vision-toolkit(长截图 OCR / UI 还原等工具集)。不打架,各干各的。🤝

技术细节 🔬

完整配置项、已知限制、故障排查见 README-fake.md。那份文档很正经,这份负责搞笑,分工明确。📑

检索关键词 🔍

DeepSeek Harness DSH vision multimodal 图片 双模型路由 LlmAdapter auto-hybrid dsh-plugin

MIT License —— LICENSE 💚

Related plugins