视觉、语音与多模态
视觉、语音与多模态类插件让 DeepSeek-Harness(dsh)里纯文本的 DeepSeek 模型也能"看图""听声""开口"。包含把粘贴的截图交给智谱 GLM、Gemini、豆包或本地 Ollama 做 OCR 与图像描述的 vision 工具和供应商路由、基于浏览器 Web Speech API 或 Whisper 兼容接口的麦克风语音输入、使用 Edge TTS 或自定义音色的朗读回复与全双工语音模式,以及图片、视频、音乐生成工具。
共 312 个插件
dsh-vision-sidecar
121103qwq/dsh-vision-sidecar
为 DeepSeek Harness 提供托管视觉侧车,并持久化会话证据。
dsh-image-subagent
yuqingsh/dsh-image-subagent
dsh-vision-bridge
gxx182/dsh-vision-bridge
将会话图片转交可配置视觉服务,并向符合条件的 DeepSeek Harness 模型路由返回纯文本分析。
dsh-omni-workstation
huashenglian/dsh-omni-workstation
面向 DSH 的全模态工作站:analyze_image 走有序多卡片 VLM 故障转移链;六个视觉工具箱工具(局部放大、色调采样、像素比对、OCR、元素检测、内联展示)共用同一套图片来源解析;generate_image 支持 OpenAI/DashScope/ComfyUI 协议;多卡片异步 generate_video 配 /build-video-tool 构建器;speak/clone_voice 语音合成覆盖七家供应商;全部由一个自动保存的设置页驱动。
dsh-hold-to-talk
wangzhanchao883/dsh-hold-to-talk
输入框上的单手、免键盘输入:鼠标在输入框按住、说话、松手,文字直接进草稿;上滑取消,不留半句。不用去瞄麦克风按钮,也不用记快捷键,手始终不用离开输入区——另一只手正忙的时候,这一点才是关键。识别完全在本机完成(SenseVoice + sherpa-onnx),无需 API key,音频不出本机。
dsh-plugin-speech
nakamuraia/dsh-plugin-speech
在 DeepSeek Harness 中朗读助手回复:支持多种 TTS 服务并边生成边流式播放。
dsh-voice-assistant
supersyh-sss/dsh-voice-assistant
dsh web 语音助手:说出唤醒词(如「小鲸」)即可免手听写,说话内容自动转成文字填入输入框;支持口述编辑指令(发送、清空、换行、停止朗读),并可用中文朗读 AI 回复。语音识别基于 sherpa-onnx WASM 在浏览器本地运行,离线可用、无需 API Key。
dsh-audiogen
shimingming520/dsh-audiogen
面向 DeepSeek Harness Web 的 AI 音频插件 —— 多厂商 TTS、音乐、音效与音色设计,含侧边栏面板、模型对比、资源库与 Agent 工具。
dsh-voco
lgquan/dsh-voco
为 DSH 提供持续语音对话,支持免提监听、按住说话、语音识别、TTS 语音回复和后台 Agent 任务委派。
dsh-gsv
taoruiliu19/dsh-gsv
将本地高性能 TTS 引擎 GSV-TTS-Lite 实时接入 DeepSeek Harness:语音预设、自动朗读、引擎配置助手、朗读按钮与设置面板。
dsh-ximalaya
jerryqx/dsh-ximalaya
在 DSH Web 界面收听喜马拉雅播客/有声书:搜索专辑、分页浏览曲目,播放条支持上下集/进度/音量/倍速;扫码登录后「我的」页可看收藏的声音(点击即播)、我的订阅(带最新一集提示)与关注的主播(含其公开专辑);Host 端音频流代理支持 Range 拖动,并注册 `ximalaya_play` 模型工具让 agent 按需搜索播放。
phone-eye
boheastill/phone-eye
让 AI 助手看见并操作真实安卓手机:phone_look(视觉+UI 树融合判读)、点击/滑动/输入、截图——经 adb,适用于任何 MCP 客户端。
dsh-image-vision
xiaoyuink/dsh-image-vision
让任意 DSH 模型都能识图:提供 vision/OCR/定位/裁剪四件套工具,内置病理、细胞、解剖、临床与科研统计图等专业预设。
Deepseek-Continuity
linxuhao/deepseek-continuity
本地生成图像/配音/音乐/音效并听写,同一性锁定:角色、动物、道具与配音角色定妆定声一次,之后每次调用复用同一份参考;退化产物(接近纯色的图、静音的音频)被拒绝而不是当成成功返回;生成的台词可以听写回文字,好让吞掉结尾的克隆暴露出来。空闲时引擎卸载显存,生图与听写也可改指向任意 OpenAI 形状的 API 而不用本地 Vulkan 后端。
dsh-ui-spec
yumimanji/dsh-ui-spec
把 UI 截图转成实现级 Web 规格书的 DSH 插件:OCR、确定性几何分析、场景图与渲染对比。
deepseekeyes
dttxorg/deepseekeyes
为 DeepSeek Harness 提供可审计的视觉与跨平台 Computer Use 运行时,保留源证据。
voco-input-sh
nothree-code/voco-input-sh
Web UI 语音输入:输入框麦克风按钮驱动本地 VocoType 离线识别,识别结果自动插入输入框(自动部署/防重复/持续输入)。
dsh-stt-input
baisama-cloud/dsh-stt-input
Web UI 语音输入:输入框旁麦克风按钮语音转文字填入输入框;支持浏览器 Web Speech API 本地识别(零配置、无需密钥)与 OpenAI 兼容 Whisper API(OpenAI/Groq),模型与语言可在设置中选择。
visual-review
wang-bool/visual-review
在 DSH Web 聊天界面内联渲染粘贴/上传的图片,并让纯文本模型“看见”图片:visual_review 工具优先调用任意 OpenAI 兼容多模态 API,未配置时回退本机 Qwen3-VL。
dsh-plugins (dsh-vision)
tzhr-invest/dsh-plugins
Agent 可调用的视觉工具:通过你配置的任意 OpenAI 兼容视觉端点描述本地图片,支持多模型交叉核对,不内置任何密钥。
dsh-plugin-multimodal
shinjiyu/dsh-plugin-multimodal
在纯文本 DeepSeek 线路上开放贴图准入,用视觉 sidecar 把附件转成文字,原生视觉模型不改写。
dsh-vision-tools
moon09300731/dsh-vision-tools
DeepSeek Harness 视觉能力全家桶:vision_understand 工具(OpenAI 兼容视觉 API,默认免费智谱 GLM-4V-Flash)+ 粘贴/拖拽/按钮三入口识图。
dsh-plugin-grok2api-media-tool
lsjspl/dsh-plugin-grok2api-media-tool
让 dsh 通过 grok2api 的 API 获得生成图片与视频能力。
dsh-image-gen
leemancheung/dsh-image-gen
GPT Image 2 `image_gen`:默认复用 Codex 订阅 OAuth,也可显式使用 API Key;显影卡片、最多 3 张 API 实时局部图、持久附件回放/灯箱/下载、纯文本模型输出和受限的凭据安全请求。