视觉、语音与多模态
视觉、语音与多模态类插件让 DeepSeek-Harness(dsh)里纯文本的 DeepSeek 模型也能"看图""听声""开口"。包含把粘贴的截图交给智谱 GLM、Gemini、豆包或本地 Ollama 做 OCR 与图像描述的 vision 工具和供应商路由、基于浏览器 Web Speech API 或 Whisper 兼容接口的麦克风语音输入、使用 Edge TTS 或自定义音色的朗读回复与全双工语音模式,以及图片、视频、音乐生成工具。
共 312 个插件
dsh-tts
goodandready/dsh-tts
在 DeepSeek Harness 网页 UI 中朗读智能体回复,采用服务商回退链(OpenAI、ElevenLabs、Google、Azure、Groq、Deepgram、OpenRouter、Edge、Piper、eSpeak),某个服务商失败或被限流时自动切换到下一个,而不是直接静音。
DSH-dseyes
okkay712/dsh-dseyes
为纯文本 DeepSeek 提供原生图片上传体验:在 Web GUI 粘贴/拖入图片即以缩略图附件进入会话,发送前由 host 用免费智谱 GLM-4V-Flash 视觉 API(glm-4v-flash 降级链)读取并替换为文字描述,DeepSeek 据此回答,原图保留在聊天历史中。
dsh-wm
waynejin0918/dsh-wm
World-model 研究工具包:检视帧、命名 3D/像素/潜在路线、对比预测与真值评分,以及 RSI 技能/wm.yaml。
dsh-tool-visual-primitives
inkshadewoods/dsh-tool-visual-primitives
通过模式化提示分析对话图片(描述、UI、文档、定位、拓扑等),将含坐标原语(框、点、引用)的结构化证据以文本注入上下文,会话级缓存跨回放与压缩复用。
dsh-smart-input
v-quest123456/dsh-smart-input
智能输入插件 for DeepSeek Harness — 语音输入 + 提示词优化
dsh-vision-bridge
goodandready/dsh-vision-bridge
将图片交给所选的视觉模型处理(自动改写、显式工具或混合模式),使纯文本聊天模型也能处理包含图片的对话。
muxiva-dsh-voice
piyotahu/muxiva-dsh-voice
由 Muxiva 编排的 DeepSeek Harness 本地优先全双工语音:麦克风、VAD、ASR、句子调度、TTS、播放与打断链路全部在 Mac 本机运行
dsh-voice-call
pandapolo/dsh-voice-call
agent 主动打来的语音电话:`offer_call` 向人类振铃(接听/拒接/稍后再说),接听后由本地 CrispASR + Qwen3-TTS 合成并播放(9 个音色,含 2 个中文方言);拒接则把决定返回给 agent。
dsh-fish-tts
mari23333/dsh-fish-tts
朗读助手回复(仅支持 Fish Audio API,需自备 Key):逐条朗读、自动朗读开关,设置页可配模型、音色 reference_id、加密 API Key 与代理。
dsh-vision
xiaoshihou514/dsh-vision
极简的原生视觉能力增强,支持免费的智谱模型或本地千问视觉模型。
dsh-vision-recognizer
kaixinbaba/dsh-vision-recognizer
视觉模型路由:把附加图片经可配置模型(15+ OpenAI 兼容与 Anthropic 供应商)转译为文字,对话仍由 DeepSeek 作答。
dsh-open-eyes
hyp6666/dsh-open-eyes
为纯文本 DeepSeek 路由提供视觉桥接:通过可配置的 OpenAI Responses、Chat Completions 或 Anthropic Messages 端点分析附件与本地图片,同时保持支持图片的路由走原生路径。
dsh-youreyes
54xkeee/dsh-youreyes
纯文本 DeepSeek 的识图工具包:模型可主动调用的 `vision` 工具、deepseek/opencode-go 包装适配器(v4 flash/pro)、反重力额度(默认,flash/pro)/ 任意 OpenAI 兼容 VLM / Gemini / 本地 Ollama 通道、证据记忆与会话压缩恢复、内容哈希缓存、双语客户端面板。
dsh-vision (vision-tool)
314857493/dsh-vision
给 DeepSeek Harness 的纯文本模型补上免费识图:`vision` 工具直连智谱 GLM 视觉 API 描述/OCR 图片文件(glm-4v-flash 降级链),无需任何外部 CLI。
dsh-vision (vision-route)
314857493/dsh-vision
注册 `deepseek-vision` 路由:Web GUI 直接粘贴图片,由免费智谱 GLM 视觉模型转译为文字后,再交给 DeepSeek 适配器作答。
dsh-vision-bridge
ximengxiaolan/dsh-vision-bridge
输入框贴图自动识别:由 OpenAI 兼容视觉模型转成文字描述后,再交给纯文本 DeepSeek 模型处理。
dsh-live2d-voice
john-walks-slow/dsh-live2d-voice
Live2D 实时语音会话视图:连续语音输入、流式 TTS、字幕翻译、多模型目录与独立入口
dsh-multi-tts
wyr-233/dsh-multi-tts
每条回复旁的朗读按钮与输入框自动朗读开关,设置页可选服务商与音色:MiniMax 或任意 OpenAI 兼容的 /audio/speech 端点,可调音色、情绪、语速与模型。
dsh-live-voice
victorwads/dsh-live-voice
本地优先的 DSH 语音对话:本地语音识别与合成、可选外部供应商,支持连续对话与自动朗读
dsh-vision-autoswitch
cultofluna/dsh-vision-autoswitch
含图请求自动切到 deepseek-v4-flash-vision-exp,回合结束自动回落到原模型,模型栏所见即所得
dsh-dictate
navneetset/dsh-dictate
通过 OpenRouter 的 STT 接口把实时语音转写进 dsh Web 输入框,边说边插入文字,可与键盘输入混用
dsh-minimax-asr
moluyao/dsh-minimax-asr
MiniMax 语音识别(asr-1.0)+ 语音合成(speech-2.8-hd)的 DeepSeek Harness 全局插件:转写工具、任务结束后用喇叭念一句的播报、实时免手对话、303 个音色可选
dsh-imgdraw
ninjasln-labs/dsh-imgdraw
DeepSeek Harness 文生图:draw_image 工具、生图弹窗(四宫格、下载/保留/删除)、/imgdraw 路由;后端 DashScope。
dsh-voice-talk
duoduoqian708/dsh-voice-talk
DSH Web 的语音对话模式:点一下麦克风进入全屏通话,边说边听,AI 回复边生成边朗读。界面中英双语,适配明暗主题,支持语速调节与音色切换。