跳过主要内容

视觉、语音与多模态

视觉、语音与多模态类插件让 DeepSeek-Harness(dsh)里纯文本的 DeepSeek 模型也能"看图""听声""开口"。包含把粘贴的截图交给智谱 GLM、Gemini、豆包或本地 Ollama 做 OCR 与图像描述的 vision 工具和供应商路由、基于浏览器 Web Speech API 或 Whisper 兼容接口的麦克风语音输入、使用 Edge TTS 或自定义音色的朗读回复与全双工语音模式,以及图片、视频、音乐生成工具。

共 312 个插件

H

dsh-vision-mix

haiziyao/dsh-vision-mix

把文本、识图和生图 API 组合成一个 Mix 模型并按对话内容自动路由:纯文本走聊天模型,用户图片和 Agent 截图走识图模型,后续可继续追问同一张图;还支持图片生成与编辑及会话级调用记录。

324天前视觉、语音与多模态MIT
O

dsh-ernie-image

omdsh-dev/dsh-ernie-image

32个月前视觉、语音与多模态BSD-3-Clause
Z

openflowframes

zerohackz/openflowframes

32个月前视觉、语音与多模态GPL-3.0
O

dsh-paddle-ocr

omdsh-dev/dsh-paddle-ocr

32个月前视觉、语音与多模态BSD-3-Clause
H

dsh-plugin-aigc-canvas

huanlinoto/dsh-plugin-aigc-canvas

provider-agnostic 的 AIGC HTTP 桥 + 无限画布 + ffmpeg 后处理,13 个工具,含画布连边/重新生成/媒体编辑。

32个月前视觉、语音与多模态
J

dsh-voice

jesse-njx/dsh-voice

语音输入、语音输出:把口述音频转写为用户消息(transcribe),让 agent 朗读回复(speak),本地优先,音频存于 ~/.dsh/voice。

32个月前视觉、语音与多模态MIT
E

dsh-llm-vision-bridge

einskyle/dsh-llm-vision-bridge

DeepSeek 视觉桥接:注册原生 LLM provider,聊天内粘贴的图片自动由视觉模型(pi-ai/llama.cpp 上的 Qwen3-VL)转成文字描述后交给纯文本 DeepSeek 作答——图片准入、路由与会话压缩全部走 harness 原生机制,带 LRU 描述缓存与 503 重试。

32个月前视觉、语音与多模态MIT
Q

dsh-mic-input

qt-chen/dsh-mic-input

输入框麦克风语音输入:浏览器 Web Speech API 实时转写,自动去重/续听、智能标点,支持语言与自动发送设置。

32个月前视觉、语音与多模态MIT
H

dsh-open-eyes

hyper-dsh-plugins/dsh-open-eyes

为纯文本 DeepSeek 路由提供视觉桥接:通过可配置的 OpenAI Responses、Chat Completions 或 Anthropic Messages 端点分析附件与本地图片,同时保持支持图片的路由走原生路径。

227天前视觉、语音与多模态MIT
C

dsh-gpt-image

cai-mh/dsh-gpt-image

控制已登录的网页版 ChatGPT 生成图片并下载到本地。

224天前视觉、语音与多模态MIT
M

dsh-ui-mockup

mackwan84/dsh-ui-mockup

ui_mockup 工具 Consumer:研讨阶段生成 UI 线框图/高保真草图,落盘设计稿并提示确认后锁定设计规格;含客户端卡片、图片路由与 i18n

222天前视觉、语音与多模态MIT
B

dsh-voice-call

biliye/dsh-voice-call

DSH Web GUI 的个人语音通话助手:可拖拽悬浮球通话面板、浏览器端 VAD(停顿自动发送)、FunASR HTTP 或流式语音识别、MiniMax / OpenAI 兼容 TTS 语音回复、可开关的唤醒词模式(沉默自动休眠),以及把任务分发给独立子代理会话并跟踪进度、停止与完成播报。

25天前视觉、语音与多模态MIT
Y

dsh-tool-lipsync

yu-wenchao/dsh-tool-lipsync

DSH 免费对口型口语视频生成插件,支持 3000+ 声音和 500+ 语言。

228天前视觉、语音与多模态MIT
B

dsh-vision-plugin

bug-huntter/dsh-vision-plugin

为纯文本 DSH 模型增加可配置识图能力:开启后图片消息先由任意 OpenAI 兼容视觉模型转写为文字描述,再交给主模型处理;设置页可配置 Base URL、Model ID 与密钥,并可选择密钥的鉴权方式(OpenAI / Anthropic / Gemini / Azure 风格请求头);未填写密钥时会在发起请求前明确提示。

25天前视觉、语音与多模态MIT
B

dseyesopen

balue8246-maker/dseyesopen

视觉桥:纯文本 DeepSeek 也能收图(单独发、图文混发均可),快速小识图模型后台描述,对话框里图还在、模型只见文字;纯插件,卸载即复原。

2上个月视觉、语音与多模态
L

dsh-visibridge

lhbsaa/dsh-visibridge

结构化视觉证据(OCR/版面/语义)+ USB 摄像头拍摄工具,支持"拍-看-改"调试闭环;后端支持 Ollama、DeepSeek、小米。

2上个月视觉、语音与多模态MIT
F

dsh-short-video-studio

fengyungithub/dsh-short-video-studio

基于 DeepSeek Harness 的类 MiniMax-Design 短剧/动画创作工作台:图片与视频生成全部跑在本地 ComfyUI,免费零云端依赖。

2上个月视觉、语音与多模态Apache-2.0
Z

dsh-watch-video

zeshuochen/dsh-watch-video

字幕优先的视频转录,支持 SRT 导出与可取消任务控制;字幕不可用时回退到 faster-whisper `large-v3`。

2上个月视觉、语音与多模态
W

dsh-voice-agent (voice-app)

wayneyu430/dsh-voice-agent

dsh 的对话式语音前端 Agent:通过 ByteDance Duplex 自然对话,把语音请求委派给后台任务,并用语音回报异步结果。

2上个月视觉、语音与多模态
M

dsh-voice-chat

maoyuching/dsh-voice-chat

豆包式语音对话插件:聊天框麦克风按钮(按住说话)语音转文字并自动发送,AI 回复自动朗读。可选 LLM 转述精简(长回复压缩成口语再播,跟随当前对话模型)、朗读前清洗 markdown/emoji/特殊符号、Edge TTS 多种音色、静音自动结束时长可调,设置嵌入 DSH 自带设置弹窗(voice chat 类目)。

28天前视觉、语音与多模态MIT
Y

phone-lens (phone-lens)

yxqfg/phone-lens

把手机相机变成 dsh 会话的实时取景与拍照输入,经局域网或 USB 直连。

23天前视觉、语音与多模态MIT
M

dsh-capture

max-null/dsh-capture

DSH 双引擎截图:思灵桌面壳内,全局快捷键/托盘打开全屏框选浮层(多显示器、逐屏像素级抓帧),选区定格后工具条就地画红框,一次确认送进输入框;纯 DSH(浏览器)下由输入框相机按钮经 getDisplayMedia 捕获屏幕,复用同一套单阶段框选+标注遮罩。均走官方附件通道。

24天前视觉、语音与多模态MIT
Y

phone-lens (lens-mate)

yxqfg/phone-lens

把手机相机变成 dsh 会话的实时取景与拍照输入,经局域网或 USB 直连。

2上个月视觉、语音与多模态MIT
E

dsh-labnana

exoticknight/dsh-labnana

为 DeepSeek Harness 接入 Labnana 图片生成:文生图 / 图生图 / 精准编辑,含积分预估、余额查询与网页设置界面。

29天前视觉、语音与多模态Apache-2.0