跳过主要内容

视觉、语音与多模态

视觉、语音与多模态类插件让 DeepSeek-Harness(dsh)里纯文本的 DeepSeek 模型也能"看图""听声""开口"。包含把粘贴的截图交给智谱 GLM、Gemini、豆包或本地 Ollama 做 OCR 与图像描述的 vision 工具和供应商路由、基于浏览器 Web Speech API 或 Whisper 兼容接口的麦克风语音输入、使用 Edge TTS 或自定义音色的朗读回复与全双工语音模式,以及图片、视频、音乐生成工具。

共 312 个插件

F

dsh-vision-proxy

flyvhidbwo/dsh-vision-proxy

DeepSeek 大脑 + 自动识图:GUI 附加的每张图片自动经官方 deepseek-v4-flash-vision-exp 原生识图转译,再交给纯文本的 DeepSeek 作答(纯文本 V4-Pro 也能看图);支持任意 OpenAI 兼容 VLM 与本地 Ollama 作为备选。

15上个月视觉、语音与多模态MIT
D

dsh-video-lens

dundunhan/dsh-video-lens

为纯文本 DeepSeek Harness Agent 提供视频理解:场景感知抽帧、VLM 与可选 ASR 转录融合为时间线证据。

13上个月视觉、语音与多模态MIT
P

dsh-vision-opencode

poiuyjie/dsh-vision-opencode

给纯文本主模型加可配置识图模型:vision_read_image 工具、输入框识图模型选择器,以及纯文本路由的图片自动转文字。

1323天前视觉、语音与多模态MIT
Z

dsh-agnes-studio

zmm863-commits/dsh-agnes-studio

一站式 AI 影视创作工作站,作为 DSH 全局浮层面板运行,不占用对话框:生图(文生图 / 图生图 / 多图合成,1K–4K、8 种宽高比)、生视频(文生视频 / 图生视频,4–12 秒、支持首帧控制)、短剧(导入 .txt/.md/.json 剧本自动拆解分镜,故事板预览与批量生成)与提示词专家工作区。零运行时依赖。

123天前视觉、语音与多模态
B

dsh-voice-ai-girlfriend-plugin

beiyege-01/dsh-voice-ai-girlfriend-plugin

Web UI 语音 AI 女友:FunASR 麦克风语音输入、Qwen3-TTS 语音回复、数字人动画窗、QQ 双向聊天(文本/语音/图片推送,经 NapCat)。

1219天前视觉、语音与多模态
P

dsh-plugin-xiaomi-mimo-tts

ppy-web/dsh-plugin-xiaomi-mimo-tts

为 DSH Web 添加 Xiaomi MiMo 语音朗读,支持助手消息朗读、PCM 流式播放、预置与自定义音色、浏览器语音兜底、播放控制和可选 UI 音效。

113天前视觉、语音与多模态MIT
A

dsh-speak

alan2z/dsh-speak

零外部依赖、事件驱动、无需额外模型、不消耗任何 token的语音播报插件。使用系统自带自然语音进行播报,支持win/mac双平台;最终回复、审批与提问提醒、可选事件播报(回合结束/命令完成/目标变更/工具出错/待办更新)、最终回复可重播、双语言可视化设置。

117天前视觉、语音与多模态MIT
C

Gemini-Eyes

consolesun/gemini-eyes

接入 gemini.google.com 的 MCP 桥:图片/视频视觉识别、Imagen 生图、Veo 生视频与历史对话管理,复用浏览器登录态,无需 API Key。

11上个月视觉、语音与多模态
P

dsh-draw

perrylink/dsh-draw

多引擎文生图(OpenAI Images 与智谱 CogView 预设):按会话配额、引擎故障切换、凭证安全配置,结果卡片支持重新生成。

98天前视觉、语音与多模态Apache-2.0
S

dsh-deepseek-vision

siegfly/dsh-deepseek-vision

视觉语言网关:注册支持图片输入的 DeepSeek provider 路由,图片先由可配置 VL 模型(默认 Qwen-VL)描述成文字再发送。

921天前视觉、语音与多模态MIT
L

dsh-vision

linenxi-ctrl/dsh-vision

外挂识图插件:鲸鱼按钮配置面板、图片识图自动回传、模型自主截图识图工具。

92个月前视觉、语音与多模态MIT
A

dsh-highres-vision

azwosile/dsh-highres-vision

为 DeepSeek Harness 原生视觉模型 deepseek-v4-flash-vision-exp 提供高清识图:将图片准入上限提升至 32 MiB / 8192 px / 600 张,并新增 highres_read 工具,将大图切为整图与 800x800 分块后经宿主 read_image 注入模型。

822天前视觉、语音与多模态MIT
G

dsh-voice

goodandready/dsh-voice

Web UI 语音输入:按停顿分段的听写与语音消息,各自拥有独立的服务商回退链(Deepgram、Groq、HuggingFace、本地 whisper.cpp 或 OpenAI 兼容接口)。

8昨天视觉、语音与多模态MIT
3

dsh-voice

3274375092/dsh-voice

语音输入插件:对着麦克风说话,识别后的文字作为普通聊天消息发送(本地模型或浏览器语音识别)。

8前天视觉、语音与多模态MIT
F

dsh-free-vision

fuzzysoul/dsh-free-vision

免费视觉插件:纯文本模型看图 / OCR / UI / 报错分析,优先免费模型(千问 Qwen3-VL-Flash、豆包、DeepSeek-OCR),设置界面可配置。

8上个月视觉、语音与多模态MIT
C

dsh-chat-imagine

corrinehu/dsh-chat-imagine

在 DSH 聊天窗口自动调用生图工具(API 渠道,或本机 CLI:已支持 mmx / codex / agy)并展示图片,也支持利用对应 CLI 识别图片。

8上个月视觉、语音与多模态MIT
S

dsh-tool-vision

scorp1o117/dsh-tool-vision

通过 inspect_image 工具将本地图片或 HTTP(S) 图片链接发送至配置的 OpenAI 兼容视觉端点,并将文字结果带回对话。

83天前视觉、语音与多模态
W

dsh-appshots

wongyuye/dsh-appshots

给 DSH Desktop 用的窗口截图,支持 macOS 和 Windows:macOS 按两边 Command、Windows 按两边 Ctrl(或点输入框旁相机)捕获当前前台窗口并附加到会话,同时把 VoiceOver 风格的辅助功能树注入为隐藏上下文。

715天前视觉、语音与多模态MIT
5

dsh-vision

54xkeee/dsh-vision

纯文本 DeepSeek 的识图插件:默认走豆包 Web(零成本、免 API key,经 Windows CDP 桥接驱动已登录 Chrome),另有反重力额度(flash/pro)与 Gemini 降级通道;档位自动升级、视觉证据记忆与会话压缩恢复、内容哈希缓存、双语客户端面板。

72个月前视觉、语音与多模态MIT
Y

dsh-duet

yums/dsh-duet

基于全双工语音模型的 DSH 网页端中文语音交互:边听边说、随时插话,用语音输入和修改任务、提交请求、管理会话、回答 DSH 的问题,并简短播报任务完成结果。

63天前视觉、语音与多模态Apache-2.0
Y

deepseek-harness-plugins (vision-bridge)

yinxe/deepseek-harness-plugins

让纯文本模型也能看图:消息中出现图片占位符时模型调用 vision_describe 工具,插件把本轮图片引用与提问一起转交给多模态视觉模型识别,主模型失败时自动用备用模型重试。配置在设置页完成并通过官方 settings API 持久化到 settings.yaml,热重载不丢。

6昨天视觉、语音与多模态MIT
Z

dsh-voice-input-plugin

zhangbo-cn/dsh-voice-input-plugin

输入框麦克风:点击持续监控、按住对话;浏览器语音识别逐字上屏,回复由 host Edge TTS 边生成边朗读,朗读时暂停识别防回声,点击可停止。

6上个月视觉、语音与多模态MIT
G

dsh-ocr-local

grelvan/dsh-ocr-local

纯文本路由的本地 OCR 兜底:会话模型明确声明不接受图片时,把附件的图片存入本地缓存并注入路径,模型调 ocr_image 用 PP-OCRv5 + ONNX Runtime 在纯 CPU 上离线识别,无需 API key,图片不出本机;模型能看图时静默。

55天前视觉、语音与多模态
N

vision-exp-tile

nicholas023/vision-exp-tile

vision-exp 模型的大图识别:无损 800×800 分块识别(智能/流水线/全量)、带预处理与手写路由的本地 OCR,可选多厂商 GPU(DirectML/CUDA/OpenVINO)与自动 CPU 回退

5上个月视觉、语音与多模态MIT