视觉、语音与多模态
视觉、语音与多模态类插件让 DeepSeek-Harness(dsh)里纯文本的 DeepSeek 模型也能"看图""听声""开口"。包含把粘贴的截图交给智谱 GLM、Gemini、豆包或本地 Ollama 做 OCR 与图像描述的 vision 工具和供应商路由、基于浏览器 Web Speech API 或 Whisper 兼容接口的麦克风语音输入、使用 Edge TTS 或自定义音色的朗读回复与全双工语音模式,以及图片、视频、音乐生成工具。
共 312 个插件
dsh-voice-kit
aaaadrop/dsh-voice-kit
DSH 网页端语音输入与朗读套件:Web Speech 识别、Edge 神经音色 TTS。
dsh-sight
ericfetch/dsh-sight
多模态图片直传与会话图片清除:粘贴、拖入即发原图,并可移除模型可见图片。
dsh-open-file
hyper-dsh-plugins/dsh-open-file
为 DeepSeek Harness 提供工作区文件上传、读取、OCR 与渲染工具。
dsh-multimodal
yauntyour/dsh-multimodal
按文件类型串联多模态模型:先把图片、视频、音频转成提示词,再送入纯文本会话模型。
dsh-voice-input
lhenlihai-hub/dsh-voice-input
dsh-vision-bridge
acc1143/dsh-vision-bridge
DSH 双模型视觉路由:图片交给指定视觉模型分析,再将结果交回 DeepSeek 继续对话。
dsh-vision
314857493/dsh-vision
DeepSeek Harness 视觉插件:声明图像输入的 deepseek-vision 路由,先用免费智谱 GLM 视觉模型转写粘贴图片再交给 DeepSeek 适配器。
dsh-image-plugins
alanzhao0128/dsh-image-plugins
DeepSeek Harness 多模态插件:通过可配置的 OpenAI 兼容或 DashScope 端点实现图像理解与图像生成。
dsh-plugins
zjcdkj/dsh-plugins
为纯文本编码模型装上「眼睛」:通过 ctx.llm 将图片路由给 Qwen-VL(DashScope)识别后返回文本。
dsh-open-file
hyp6666/dsh-open-file
工作区限定的任意格式文件上传、读取、本地 OCR 与页面渲染,把各类文档带进 DeepSeek Harness 对话。
dsh-image-vision
xsoc1/dsh-image-vision
纯文本 DeepSeek 的聊天识图插件:view_image 工具转发任意 OpenAI 兼容 VLM(本地 Ollama 或云端),对话框粘贴/拖拽的图片自动改写为 view_image 路径标记供模型查看。
mimo-vision
wulusai2333/mimo-vision
`describe_image` 视觉桥:经 opencode Zen API(凭据 `OPENCODE_GO_API_KEY`,免费线路优先、付费兜底)把图片发给 mimo-v2.5、返回文字描述给纯文本模型,原生格式直发,SVG/TIFF/HEIC 等格式经 ImageMagick 自动转码。
dsh-tool-vision
wanshichenguang/dsh-tool-vision
面向模型的 image_describe(识图)工具(DashScope OpenAI 兼容接口,qwen3.7-flash)+ 粘贴桥:纯文本模型会话里粘贴的图片在发送时自动转为文件路径并在聊天记录中回显,不再触发图片准入拦截。自带 DASHSCOPE_API_KEY;端点/模型/预算可配置,重定向防护 HTTP 客户端,所有 Agent 预设均可用。
dsh-vision-subagent
ruby1304/dsh-vision-subagent
为任意 DSH 路由装上眼睛:Web 输入框贴图按意图自动聚焦分析,视觉子代理代读工作区图片,原图可随时物化编辑。
dsh-auto-vision
normanfxxkingrockwell/dsh-auto-vision
为纯文本 DeepSeek Harness 主模型搭视觉桥:自动从已配置模型中挑选多模态模型,通过 vision 工具把图片描述以纯文本返回。
dsh-llm-deepseek-vision
nagasakisoyo-ui/dsh-llm-deepseek-vision
视觉增强的 DeepSeek 适配器:由视觉模型把图片描述成文字,纯文本 DeepSeek 模型再基于描述推理。
dsh-eyes
leeminjing/dsh-eyes
为纯文本 DeepSeek 模型提供按需视觉:上传图片后,模型通过 view_image 工具调用任意 OpenAI 兼容视觉端点(默认 Qwen/DashScope)。
dsh-mindseye
kanchengw/dsh-mindseye
为 DSH 上的纯文本模型提供视觉插件:通过分层证据记忆与缓存,实现图片理解与生成的原生交互及 GUI 自动化。
dsh-tool-vision
gloryxpnv/dsh-tool-vision
本地优先的结构化视觉插件:图片交给本地 OpenAI 兼容 VLM,返回 JSON 证据(摘要、逐字 OCR、版面区域、实体/关系、配色、显式不确定项),带反幻觉回退与可选粘贴/上传桥;零云端成本,图片不出本机。
dsh-plugin-mm-vision
elohia/dsh-plugin-mm-vision
通感编码器(Synesthesia Encoder):调用视觉模型把图片翻译成紧凑的结构化空间文字(画布/元素/百分比坐标),让纯文本 LLM 获得像素级看图能力(`mm_vision` 工具)。
dsh-deepseek-vision
cheng-cheng9669/dsh-deepseek-vision
复用 DeepSeek 网页端识图模式给纯文本模型补上看图能力:deepseek_vision 工具调用本地 deepseek-vision-cli 浏览器自动化(手动登录助手、自动开启深度思考、用后自动关窗),把图片描述以文字返回给模型。
dsh-vision-fallback
1helloman1/dsh-vision-fallback
将聊天图片交给固定的 OpenAI 兼容视觉模型,把事实性观察交给当前主模型,并在事件回放、上下文压缩和重启时复用会话内观察。
dsh-voice
zhuiyueya/dsh-voice
Voice for DeepSeek Harness(dsh) — speech-to-text input + read-aloud TTS for text-only DeepSeek, zero API key.
multimodal-bridge
spirit4471/multimodal-bridge
DeepSeek Harness plugin bundle: qwen_vision (Qwen-VL image understanding) and qwen_generate (Qwen-Image text-to-image) tools for text-only models