视觉、语音与多模态
视觉、语音与多模态类插件让 DeepSeek-Harness(dsh)里纯文本的 DeepSeek 模型也能"看图""听声""开口"。包含把粘贴的截图交给智谱 GLM、Gemini、豆包或本地 Ollama 做 OCR 与图像描述的 vision 工具和供应商路由、基于浏览器 Web Speech API 或 Whisper 兼容接口的麦克风语音输入、使用 Edge TTS 或自定义音色的朗读回复与全双工语音模式,以及图片、视频、音乐生成工具。
共 86 个插件
dsh-web-ui (dsh-tool-describe-image)
damonkoy/dsh-web-ui
describe_image 模型工具:让纯文本模型通过视觉语言模型获得图像理解能力。
dsh-vision-bridge
gxx182/dsh-vision-bridge
将会话图片转交可配置视觉服务,并向符合条件的 DeepSeek Harness 模型路由返回纯文本分析。
dsh-llm-vision-bridge
einskyle/dsh-llm-vision-bridge
DeepSeek 视觉桥接:注册原生 LLM provider,聊天内粘贴的图片自动由视觉模型(pi-ai/llama.cpp 上的 Qwen3-VL)转成文字描述后交给纯文本 DeepSeek 作答——图片准入、路由与会话压缩全部走 harness 原生机制,带 LRU 描述缓存与 503 重试。
dsh-vision-bridge
ximengxiaolan/dsh-vision-bridge
输入框贴图自动识别:由 OpenAI 兼容视觉模型转成文字描述后,再交给纯文本 DeepSeek 模型处理。
dsh-mic-input
qt-chen/dsh-mic-input
输入框麦克风语音输入:浏览器 Web Speech API 实时转写,自动去重/续听、智能标点,支持语言与自动发送设置。
dsh-voice
stardustlc666/dsh-voice
语音双件套:edge-tts 免费微软神经语音合成 + OpenAI 兼容 ASR 转写。
voco-input-sh
nothree-code/voco-input-sh
Web UI 语音输入:输入框麦克风按钮驱动本地 VocoType 离线识别,识别结果自动插入输入框(自动部署/防重复/持续输入)。
dsh-voice-input
0nt-one/dsh-voice-input
输入框麦克风语音输入:浏览器 Web Speech API 实时转写(Chrome/Edge),多语言切换与可选自动发送,零依赖零密钥。
dsh-draw-router
xiaozhe7772222/dsh-draw-router
DeepSeek Harness 统一生图路由:自动识别任意 OpenAI 兼容端点的绘图模型(商汤、阶跃、Agnes、千问、Flux、SD、Imagen 等),提供 Agent 工具与 REST API。
dsh-vision
xiaoshihou514/dsh-vision
极简的原生视觉能力增强,支持免费的智谱模型或本地千问视觉模型。
visual-review
wang-bool/visual-review
在 DSH Web 聊天界面内联渲染粘贴/上传的图片,并让纯文本模型“看见”图片:visual_review 工具优先调用任意 OpenAI 兼容多模态 API,未配置时回退本机 Qwen3-VL。
dsh-llm-deepseek-vision
nagasakisoyo-ui/dsh-llm-deepseek-vision
视觉增强的 DeepSeek 适配器:由视觉模型把图片描述成文字,纯文本 DeepSeek 模型再基于描述推理。
dsh-vision-tools
moon09300731/dsh-vision-tools
DeepSeek Harness 视觉能力全家桶:vision_understand 工具(OpenAI 兼容视觉 API,默认免费智谱 GLM-4V-Flash)+ 粘贴/拖拽/按钮三入口识图。
dsh-tesseract-ocr
maxwell-feng/dsh-tesseract-ocr
本地 Tesseract 识别附加图片:只把识别出的文字发送给模型,图片字节不进入上下文;视觉直通可选开启。
dsh-image-gen
leemancheung/dsh-image-gen
GPT Image 2 `image_gen`:默认复用 Codex 订阅 OAuth,也可显式使用 API Key;显影卡片、最多 3 张 API 实时局部图、持久附件回放/灯箱/下载、纯文本模型输出和受限的凭据安全请求。
dsh-open-eyes
hyp6666/dsh-open-eyes
为纯文本 DeepSeek 路由提供视觉桥接:通过可配置的 OpenAI Responses、Chat Completions 或 Anthropic Messages 端点分析附件与本地图片,同时保持支持图片的路由走原生路径。
dsh-vision-mix
haiziyao/dsh-vision-mix
把文本、识图和生图 API 组合成一个 Mix 模型并按对话内容自动路由:纯文本走聊天模型,用户图片和 Agent 截图走识图模型,后续可继续追问同一张图;还支持图片生成与编辑及会话级调用记录。
dsh-free-vision
fuzzysoul/dsh-free-vision
免费视觉插件:纯文本模型看图 / OCR / UI / 报错分析,优先免费模型(千问 Qwen3-VL-Flash、豆包、DeepSeek-OCR),设置界面可配置。
dsh-voice-call
pandapolo/dsh-voice-call
agent 主动打来的语音电话:`offer_call` 向人类振铃(接听/拒接/稍后再说),接听后由本地 CrispASR + Qwen3-TTS 合成并播放(9 个音色,含 2 个中文方言);拒接则把决定返回给 agent。
dsh-chatvoice
fuzzysoul/dsh-chatvoice
Web UI 免费语音闭环:浏览器语音识别输入(实时中间结果上屏)+ 助手回复朗读与自动朗读,零配置、免 API key。
dsh-stt-input
baisama-cloud/dsh-stt-input
Web UI 语音输入:输入框旁麦克风按钮语音转文字填入输入框;支持浏览器 Web Speech API 本地识别(零配置、无需密钥)与 OpenAI 兼容 Whisper API(OpenAI/Groq),模型与语言可在设置中选择。
dsh-image-vision
xsoc1/dsh-image-vision
纯文本 DeepSeek 的聊天识图插件:view_image 工具转发任意 OpenAI 兼容 VLM(本地 Ollama 或云端),对话框粘贴/拖拽的图片自动改写为 view_image 路径标记供模型查看。
mimo-vision
wulusai2333/mimo-vision
`describe_image` 视觉桥:经 opencode Zen API(凭据 `OPENCODE_GO_API_KEY`,免费线路优先、付费兜底)把图片发给 mimo-v2.5、返回文字描述给纯文本模型,原生格式直发,SVG/TIFF/HEIC 等格式经 ImageMagick 自动转码。
dsh-tool-vision
wanshichenguang/dsh-tool-vision
通过 DashScope OpenAI 兼容视觉接口提供 image_describe 识图工具;在纯文本模型会话中,将粘贴图片保存为模型可读取的本地路径,并在聊天记录中回显图片。