跳过主要内容

视觉、语音与多模态

视觉、语音与多模态类插件让 DeepSeek-Harness(dsh)里纯文本的 DeepSeek 模型也能"看图""听声""开口"。包含把粘贴的截图交给智谱 GLM、Gemini、豆包或本地 Ollama 做 OCR 与图像描述的 vision 工具和供应商路由、基于浏览器 Web Speech API 或 Whisper 兼容接口的麦克风语音输入、使用 Edge TTS 或自定义音色的朗读回复与全双工语音模式,以及图片、视频、音乐生成工具。

共 312 个插件

G

dsh-tts

goodandready/dsh-tts

在 DeepSeek Harness 网页 UI 中朗读智能体回复,采用服务商回退链(OpenAI、ElevenLabs、Google、Azure、Groq、Deepgram、OpenRouter、Edge、Piper、eSpeak),某个服务商失败或被限流时自动切换到下一个,而不是直接静音。

26天前视觉、语音与多模态MIT
O

DSH-dseyes

okkay712/dsh-dseyes

为纯文本 DeepSeek 提供原生图片上传体验:在 Web GUI 粘贴/拖入图片即以缩略图附件进入会话,发送前由 host 用免费智谱 GLM-4V-Flash 视觉 API(glm-4v-flash 降级链)读取并替换为文字描述,DeepSeek 据此回答,原图保留在聊天历史中。

2上个月视觉、语音与多模态MIT
W

dsh-wm

waynejin0918/dsh-wm

World-model 研究工具包:检视帧、命名 3D/像素/潜在路线、对比预测与真值评分,以及 RSI 技能/wm.yaml。

22个月前视觉、语音与多模态MIT
I

dsh-tool-visual-primitives

inkshadewoods/dsh-tool-visual-primitives

通过模式化提示分析对话图片(描述、UI、文档、定位、拓扑等),将含坐标原语(框、点、引用)的结构化证据以文本注入上下文,会话级缓存跨回放与压缩复用。

23天前视觉、语音与多模态MIT
V

dsh-smart-input

v-quest123456/dsh-smart-input

智能输入插件 for DeepSeek Harness — 语音输入 + 提示词优化

22个月前视觉、语音与多模态MIT
G

dsh-vision-bridge

goodandready/dsh-vision-bridge

将图片交给所选的视觉模型处理(自动改写、显式工具或混合模式),使纯文本聊天模型也能处理包含图片的对话。

26天前视觉、语音与多模态MIT
P

muxiva-dsh-voice

piyotahu/muxiva-dsh-voice

由 Muxiva 编排的 DeepSeek Harness 本地优先全双工语音:麦克风、VAD、ASR、句子调度、TTS、播放与打断链路全部在 Mac 本机运行

22个月前视觉、语音与多模态Apache-2.0
P

dsh-voice-call

pandapolo/dsh-voice-call

agent 主动打来的语音电话:`offer_call` 向人类振铃(接听/拒接/稍后再说),接听后由本地 CrispASR + Qwen3-TTS 合成并播放(9 个音色,含 2 个中文方言);拒接则把决定返回给 agent。

23天前视觉、语音与多模态MIT
M

dsh-fish-tts

mari23333/dsh-fish-tts

朗读助手回复(仅支持 Fish Audio API,需自备 Key):逐条朗读、自动朗读开关,设置页可配模型、音色 reference_id、加密 API Key 与代理。

2前天视觉、语音与多模态MIT
X

dsh-vision

xiaoshihou514/dsh-vision

极简的原生视觉能力增强,支持免费的智谱模型或本地千问视觉模型。

2上个月视觉、语音与多模态MIT
K

dsh-vision-recognizer

kaixinbaba/dsh-vision-recognizer

视觉模型路由:把附加图片经可配置模型(15+ OpenAI 兼容与 Anthropic 供应商)转译为文字,对话仍由 DeepSeek 作答。

2上个月视觉、语音与多模态MIT
H

dsh-open-eyes

hyp6666/dsh-open-eyes

为纯文本 DeepSeek 路由提供视觉桥接:通过可配置的 OpenAI Responses、Chat Completions 或 Anthropic Messages 端点分析附件与本地图片,同时保持支持图片的路由走原生路径。

227天前视觉、语音与多模态MIT
5

dsh-youreyes

54xkeee/dsh-youreyes

纯文本 DeepSeek 的识图工具包:模型可主动调用的 `vision` 工具、deepseek/opencode-go 包装适配器(v4 flash/pro)、反重力额度(默认,flash/pro)/ 任意 OpenAI 兼容 VLM / Gemini / 本地 Ollama 通道、证据记忆与会话压缩恢复、内容哈希缓存、双语客户端面板。

22个月前视觉、语音与多模态MIT
3

dsh-vision (vision-tool)

314857493/dsh-vision

给 DeepSeek Harness 的纯文本模型补上免费识图:`vision` 工具直连智谱 GLM 视觉 API 描述/OCR 图片文件(glm-4v-flash 降级链),无需任何外部 CLI。

228天前视觉、语音与多模态MIT
3

dsh-vision (vision-route)

314857493/dsh-vision

注册 `deepseek-vision` 路由:Web GUI 直接粘贴图片,由免费智谱 GLM 视觉模型转译为文字后,再交给 DeepSeek 适配器作答。

228天前视觉、语音与多模态MIT
X

dsh-vision-bridge

ximengxiaolan/dsh-vision-bridge

输入框贴图自动识别:由 OpenAI 兼容视觉模型转成文字描述后,再交给纯文本 DeepSeek 模型处理。

22个月前视觉、语音与多模态MIT
J

dsh-live2d-voice

john-walks-slow/dsh-live2d-voice

Live2D 实时语音会话视图:连续语音输入、流式 TTS、字幕翻译、多模型目录与独立入口

14天前视觉、语音与多模态MIT
W

dsh-multi-tts

wyr-233/dsh-multi-tts

每条回复旁的朗读按钮与输入框自动朗读开关,设置页可选服务商与音色:MiniMax 或任意 OpenAI 兼容的 /audio/speech 端点,可调音色、情绪、语速与模型。

121天前视觉、语音与多模态
V

dsh-live-voice

victorwads/dsh-live-voice

本地优先的 DSH 语音对话:本地语音识别与合成、可选外部供应商,支持连续对话与自动朗读

118天前视觉、语音与多模态GPL-3.0
C

dsh-vision-autoswitch

cultofluna/dsh-vision-autoswitch

含图请求自动切到 deepseek-v4-flash-vision-exp,回合结束自动回落到原模型,模型栏所见即所得

1上个月视觉、语音与多模态MIT
N

dsh-dictate

navneetset/dsh-dictate

通过 OpenRouter 的 STT 接口把实时语音转写进 dsh Web 输入框,边说边插入文字,可与键盘输入混用

127天前视觉、语音与多模态MIT
M

dsh-minimax-asr

moluyao/dsh-minimax-asr

MiniMax 语音识别(asr-1.0)+ 语音合成(speech-2.8-hd)的 DeepSeek Harness 全局插件:转写工具、任务结束后用喇叭念一句的播报、实时免手对话、303 个音色可选

119天前视觉、语音与多模态MIT
N

dsh-imgdraw

ninjasln-labs/dsh-imgdraw

DeepSeek Harness 文生图:draw_image 工具、生图弹窗(四宫格、下载/保留/删除)、/imgdraw 路由;后端 DashScope。

128天前视觉、语音与多模态MIT
D

dsh-voice-talk

duoduoqian708/dsh-voice-talk

DSH Web 的语音对话模式:点一下麦克风进入全屏通话,边说边听,AI 回复边生成边朗读。界面中英双语,适配明暗主题,支持语速调节与音色切换。

120天前视觉、语音与多模态MIT