跳过主要内容

视觉、语音与多模态

视觉、语音与多模态类插件让 DeepSeek-Harness(dsh)里纯文本的 DeepSeek 模型也能"看图""听声""开口"。包含把粘贴的截图交给智谱 GLM、Gemini、豆包或本地 Ollama 做 OCR 与图像描述的 vision 工具和供应商路由、基于浏览器 Web Speech API 或 Whisper 兼容接口的麦克风语音输入、使用 Edge TTS 或自定义音色的朗读回复与全双工语音模式,以及图片、视频、音乐生成工具。

共 312 个插件

A

dsh-voice-kit

aaaadrop/dsh-voice-kit

DSH 网页端语音输入与朗读套件:Web Speech 识别、Edge 神经音色 TTS。

1上个月视觉、语音与多模态MIT
E

dsh-sight

ericfetch/dsh-sight

多模态图片直传与会话图片清除:粘贴、拖入即发原图,并可移除模型可见图片。

1上个月视觉、语音与多模态MIT
H

dsh-open-file

hyper-dsh-plugins/dsh-open-file

为 DeepSeek Harness 提供工作区文件上传、读取、OCR 与渲染工具。

1上个月视觉、语音与多模态MIT
Y

dsh-multimodal

yauntyour/dsh-multimodal

按文件类型串联多模态模型:先把图片、视频、音频转成提示词,再送入纯文本会话模型。

12个月前视觉、语音与多模态MIT
L

dsh-voice-input

lhenlihai-hub/dsh-voice-input

12个月前视觉、语音与多模态MIT
A

dsh-vision-bridge

acc1143/dsh-vision-bridge

DSH 双模型视觉路由:图片交给指定视觉模型分析,再将结果交回 DeepSeek 继续对话。

12个月前视觉、语音与多模态MIT
3

dsh-vision

314857493/dsh-vision

DeepSeek Harness 视觉插件:声明图像输入的 deepseek-vision 路由,先用免费智谱 GLM 视觉模型转写粘贴图片再交给 DeepSeek 适配器。

12个月前视觉、语音与多模态MIT
A

dsh-image-plugins

alanzhao0128/dsh-image-plugins

DeepSeek Harness 多模态插件:通过可配置的 OpenAI 兼容或 DashScope 端点实现图像理解与图像生成。

12个月前视觉、语音与多模态MIT
Z

dsh-plugins

zjcdkj/dsh-plugins

为纯文本编码模型装上「眼睛」:通过 ctx.llm 将图片路由给 Qwen-VL(DashScope)识别后返回文本。

12个月前视觉、语音与多模态MIT
H

dsh-open-file

hyp6666/dsh-open-file

工作区限定的任意格式文件上传、读取、本地 OCR 与页面渲染,把各类文档带进 DeepSeek Harness 对话。

12个月前视觉、语音与多模态MIT
X

dsh-image-vision

xsoc1/dsh-image-vision

纯文本 DeepSeek 的聊天识图插件:view_image 工具转发任意 OpenAI 兼容 VLM(本地 Ollama 或云端),对话框粘贴/拖拽的图片自动改写为 view_image 路径标记供模型查看。

12个月前视觉、语音与多模态
W

mimo-vision

wulusai2333/mimo-vision

`describe_image` 视觉桥:经 opencode Zen API(凭据 `OPENCODE_GO_API_KEY`,免费线路优先、付费兜底)把图片发给 mimo-v2.5、返回文字描述给纯文本模型,原生格式直发,SVG/TIFF/HEIC 等格式经 ImageMagick 自动转码。

12个月前视觉、语音与多模态MIT
W

dsh-tool-vision

wanshichenguang/dsh-tool-vision

面向模型的 image_describe(识图)工具(DashScope OpenAI 兼容接口,qwen3.7-flash)+ 粘贴桥:纯文本模型会话里粘贴的图片在发送时自动转为文件路径并在聊天记录中回显,不再触发图片准入拦截。自带 DASHSCOPE_API_KEY;端点/模型/预算可配置,重定向防护 HTTP 客户端,所有 Agent 预设均可用。

12个月前视觉、语音与多模态MIT
R

dsh-vision-subagent

ruby1304/dsh-vision-subagent

为任意 DSH 路由装上眼睛:Web 输入框贴图按意图自动聚焦分析,视觉子代理代读工作区图片,原图可随时物化编辑。

123天前视觉、语音与多模态MIT
N

dsh-auto-vision

normanfxxkingrockwell/dsh-auto-vision

为纯文本 DeepSeek Harness 主模型搭视觉桥:自动从已配置模型中挑选多模态模型,通过 vision 工具把图片描述以纯文本返回。

118天前视觉、语音与多模态MIT
N

dsh-llm-deepseek-vision

nagasakisoyo-ui/dsh-llm-deepseek-vision

视觉增强的 DeepSeek 适配器:由视觉模型把图片描述成文字,纯文本 DeepSeek 模型再基于描述推理。

12个月前视觉、语音与多模态MIT
L

dsh-eyes

leeminjing/dsh-eyes

为纯文本 DeepSeek 模型提供按需视觉:上传图片后,模型通过 view_image 工具调用任意 OpenAI 兼容视觉端点(默认 Qwen/DashScope)。

12个月前视觉、语音与多模态MIT
K

dsh-mindseye

kanchengw/dsh-mindseye

为 DSH 上的纯文本模型提供视觉插件:通过分层证据记忆与缓存,实现图片理解与生成的原生交互及 GUI 自动化。

1上个月视觉、语音与多模态MIT
G

dsh-tool-vision

gloryxpnv/dsh-tool-vision

本地优先的结构化视觉插件:图片交给本地 OpenAI 兼容 VLM,返回 JSON 证据(摘要、逐字 OCR、版面区域、实体/关系、配色、显式不确定项),带反幻觉回退与可选粘贴/上传桥;零云端成本,图片不出本机。

12个月前视觉、语音与多模态MIT
E

dsh-plugin-mm-vision

elohia/dsh-plugin-mm-vision

通感编码器(Synesthesia Encoder):调用视觉模型把图片翻译成紧凑的结构化空间文字(画布/元素/百分比坐标),让纯文本 LLM 获得像素级看图能力(`mm_vision` 工具)。

12个月前视觉、语音与多模态MIT
C

dsh-deepseek-vision

cheng-cheng9669/dsh-deepseek-vision

复用 DeepSeek 网页端识图模式给纯文本模型补上看图能力:deepseek_vision 工具调用本地 deepseek-vision-cli 浏览器自动化(手动登录助手、自动开启深度思考、用后自动关窗),把图片描述以文字返回给模型。

12个月前视觉、语音与多模态MIT
1

dsh-vision-fallback

1helloman1/dsh-vision-fallback

将聊天图片交给固定的 OpenAI 兼容视觉模型,把事实性观察交给当前主模型,并在事件回放、上下文压缩和重启时复用会话内观察。

1上个月视觉、语音与多模态MIT
Z

dsh-voice

zhuiyueya/dsh-voice

Voice for DeepSeek Harness(dsh) — speech-to-text input + read-aloud TTS for text-only DeepSeek, zero API key.

12个月前视觉、语音与多模态MIT
S

multimodal-bridge

spirit4471/multimodal-bridge

DeepSeek Harness plugin bundle: qwen_vision (Qwen-VL image understanding) and qwen_generate (Qwen-Image text-to-image) tools for text-only models

12个月前视觉、语音与多模态MIT