跳过主要内容

视觉、语音与多模态

视觉、语音与多模态类插件让 DeepSeek-Harness(dsh)里纯文本的 DeepSeek 模型也能"看图""听声""开口"。包含把粘贴的截图交给智谱 GLM、Gemini、豆包或本地 Ollama 做 OCR 与图像描述的 vision 工具和供应商路由、基于浏览器 Web Speech API 或 Whisper 兼容接口的麦克风语音输入、使用 Edge TTS 或自定义音色的朗读回复与全双工语音模式,以及图片、视频、音乐生成工具。

共 312 个插件

1

dsh-vision-sidecar

121103qwq/dsh-vision-sidecar

为 DeepSeek Harness 提供托管视觉侧车,并持久化会话证据。

42个月前视觉、语音与多模态MIT
Y

dsh-image-subagent

yuqingsh/dsh-image-subagent

42个月前视觉、语音与多模态MIT
G

dsh-vision-bridge

gxx182/dsh-vision-bridge

将会话图片转交可配置视觉服务,并向符合条件的 DeepSeek Harness 模型路由返回纯文本分析。

42个月前视觉、语音与多模态MIT
H

dsh-omni-workstation

huashenglian/dsh-omni-workstation

面向 DSH 的全模态工作站:analyze_image 走有序多卡片 VLM 故障转移链;六个视觉工具箱工具(局部放大、色调采样、像素比对、OCR、元素检测、内联展示)共用同一套图片来源解析;generate_image 支持 OpenAI/DashScope/ComfyUI 协议;多卡片异步 generate_video 配 /build-video-tool 构建器;speak/clone_voice 语音合成覆盖七家供应商;全部由一个自动保存的设置页驱动。

314天前视觉、语音与多模态MIT
W

dsh-hold-to-talk

wangzhanchao883/dsh-hold-to-talk

输入框上的单手、免键盘输入:鼠标在输入框按住、说话、松手,文字直接进草稿;上滑取消,不留半句。不用去瞄麦克风按钮,也不用记快捷键,手始终不用离开输入区——另一只手正忙的时候,这一点才是关键。识别完全在本机完成(SenseVoice + sherpa-onnx),无需 API key,音频不出本机。

322小时前视觉、语音与多模态MIT
N

dsh-plugin-speech

nakamuraia/dsh-plugin-speech

在 DeepSeek Harness 中朗读助手回复:支持多种 TTS 服务并边生成边流式播放。

318天前视觉、语音与多模态MIT
S

dsh-voice-assistant

supersyh-sss/dsh-voice-assistant

dsh web 语音助手:说出唤醒词(如「小鲸」)即可免手听写,说话内容自动转成文字填入输入框;支持口述编辑指令(发送、清空、换行、停止朗读),并可用中文朗读 AI 回复。语音识别基于 sherpa-onnx WASM 在浏览器本地运行,离线可用、无需 API Key。

3上个月视觉、语音与多模态MIT
S

dsh-audiogen

shimingming520/dsh-audiogen

面向 DeepSeek Harness Web 的 AI 音频插件 —— 多厂商 TTS、音乐、音效与音色设计,含侧边栏面板、模型对比、资源库与 Agent 工具。

324天前视觉、语音与多模态Apache-2.0
L

dsh-voco

lgquan/dsh-voco

为 DSH 提供持续语音对话,支持免提监听、按住说话、语音识别、TTS 语音回复和后台 Agent 任务委派。

3上个月视觉、语音与多模态MIT
T

dsh-gsv

taoruiliu19/dsh-gsv

将本地高性能 TTS 引擎 GSV-TTS-Lite 实时接入 DeepSeek Harness:语音预设、自动朗读、引擎配置助手、朗读按钮与设置面板。

3上个月视觉、语音与多模态MIT
J

dsh-ximalaya

jerryqx/dsh-ximalaya

在 DSH Web 界面收听喜马拉雅播客/有声书:搜索专辑、分页浏览曲目,播放条支持上下集/进度/音量/倍速;扫码登录后「我的」页可看收藏的声音(点击即播)、我的订阅(带最新一集提示)与关注的主播(含其公开专辑);Host 端音频流代理支持 Range 拖动,并注册 `ximalaya_play` 模型工具让 agent 按需搜索播放。

3上个月视觉、语音与多模态MIT
B

phone-eye

boheastill/phone-eye

让 AI 助手看见并操作真实安卓手机:phone_look(视觉+UI 树融合判读)、点击/滑动/输入、截图——经 adb,适用于任何 MCP 客户端。

3上个月视觉、语音与多模态MIT
X

dsh-image-vision

xiaoyuink/dsh-image-vision

让任意 DSH 模型都能识图:提供 vision/OCR/定位/裁剪四件套工具,内置病理、细胞、解剖、临床与科研统计图等专业预设。

329天前视觉、语音与多模态
L

Deepseek-Continuity

linxuhao/deepseek-continuity

本地生成图像/配音/音乐/音效并听写,同一性锁定:角色、动物、道具与配音角色定妆定声一次,之后每次调用复用同一份参考;退化产物(接近纯色的图、静音的音频)被拒绝而不是当成成功返回;生成的台词可以听写回文字,好让吞掉结尾的克隆暴露出来。空闲时引擎卸载显存,生图与听写也可改指向任意 OpenAI 形状的 API 而不用本地 Vulkan 后端。

312天前视觉、语音与多模态MIT
Y

dsh-ui-spec

yumimanji/dsh-ui-spec

把 UI 截图转成实现级 Web 规格书的 DSH 插件:OCR、确定性几何分析、场景图与渲染对比。

32个月前视觉、语音与多模态MIT
D

deepseekeyes

dttxorg/deepseekeyes

为 DeepSeek Harness 提供可审计的视觉与跨平台 Computer Use 运行时,保留源证据。

32个月前视觉、语音与多模态MIT
N

voco-input-sh

nothree-code/voco-input-sh

Web UI 语音输入:输入框麦克风按钮驱动本地 VocoType 离线识别,识别结果自动插入输入框(自动部署/防重复/持续输入)。

319天前视觉、语音与多模态MIT
B

dsh-stt-input

baisama-cloud/dsh-stt-input

Web UI 语音输入:输入框旁麦克风按钮语音转文字填入输入框;支持浏览器 Web Speech API 本地识别(零配置、无需密钥)与 OpenAI 兼容 Whisper API(OpenAI/Groq),模型与语言可在设置中选择。

3上个月视觉、语音与多模态MIT
W

visual-review

wang-bool/visual-review

在 DSH Web 聊天界面内联渲染粘贴/上传的图片,并让纯文本模型“看见”图片:visual_review 工具优先调用任意 OpenAI 兼容多模态 API,未配置时回退本机 Qwen3-VL。

32个月前视觉、语音与多模态MIT
T

dsh-plugins (dsh-vision)

tzhr-invest/dsh-plugins

Agent 可调用的视觉工具:通过你配置的任意 OpenAI 兼容视觉端点描述本地图片,支持多模型交叉核对,不内置任何密钥。

35天前视觉、语音与多模态MIT
S

dsh-plugin-multimodal

shinjiyu/dsh-plugin-multimodal

在纯文本 DeepSeek 线路上开放贴图准入,用视觉 sidecar 把附件转成文字,原生视觉模型不改写。

32个月前视觉、语音与多模态MIT
M

dsh-vision-tools

moon09300731/dsh-vision-tools

DeepSeek Harness 视觉能力全家桶:vision_understand 工具(OpenAI 兼容视觉 API,默认免费智谱 GLM-4V-Flash)+ 粘贴/拖拽/按钮三入口识图。

32个月前视觉、语音与多模态MIT
L

dsh-plugin-grok2api-media-tool

lsjspl/dsh-plugin-grok2api-media-tool

让 dsh 通过 grok2api 的 API 获得生成图片与视频能力。

3上个月视觉、语音与多模态
L

dsh-image-gen

leemancheung/dsh-image-gen

GPT Image 2 `image_gen`:默认复用 Codex 订阅 OAuth,也可显式使用 API Key;显影卡片、最多 3 张 API 实时局部图、持久附件回放/灯箱/下载、纯文本模型输出和受限的凭据安全请求。

35天前视觉、语音与多模态MIT