跳过主要内容

视觉、语音与多模态

视觉、语音与多模态类插件让 DeepSeek-Harness(dsh)里纯文本的 DeepSeek 模型也能"看图""听声""开口"。包含把粘贴的截图交给智谱 GLM、Gemini、豆包或本地 Ollama 做 OCR 与图像描述的 vision 工具和供应商路由、基于浏览器 Web Speech API 或 Whisper 兼容接口的麦克风语音输入、使用 Edge TTS 或自定义音色的朗读回复与全双工语音模式,以及图片、视频、音乐生成工具。

共 312 个插件

Z

dsh-agnes-media

zlforward/dsh-agnes-media

123天前视觉、语音与多模态MIT
F

dsh-funasr-voice

fenglin-ai/dsh-funasr-voice

DSH Web 本地离线语音输入:麦克风经本地 FunASR(SenseVoiceSmall)识别后填入输入框,支持一键安装,全程离线。

1上个月视觉、语音与多模态MIT
I

dshtools-sensevoice-input

ilovedyou6666-hub/dshtools-sensevoice-input

基于 SenseVoiceSmall(iic/SenseVoiceSmall)多语言语音理解模型的 DSH Desktop 本地语音输入插件。

129天前视觉、语音与多模态MIT
Z

dsh-file-convert

zzy-12345678/dsh-file-convert

本地优先文件转换插件:支持图片、PDF(含 OCR)、数据、音视频和 Office 文档的 26 种转换,提供 7 个工具且无需 API Key。

1上个月视觉、语音与多模态
D

dsh-voice-input-npm

difimim/dsh-voice-input-npm

DeepSeek Harness 语音输入插件。

1上个月视觉、语音与多模态MIT
J

dsh-live-voice

jstn-1g/dsh-live-voice

DSH Web 的会话绑定单轮语音预览:提供无需凭证的本地合成演示和可选的 Qwen Audio,保持精确会话隔离,并仅在明确操作后将转写写入草稿,不会自动提交。

127天前视觉、语音与多模态MIT
Y

dsh-video-gen

yang-wudi/dsh-video-gen

通过阿里通义万相、火山引擎 Seedance、Google Veo 与 OpenAI Sora 生成文生视频与图生视频,结果保存到会话工作区,内置视频画廊(网格、灯箱、下载、删除),DSH 重启后仍可播放。

1上个月视觉、语音与多模态
W

dsh-image-viewer

wsl043/dsh-image-viewer

增强 DSH 原生图片查看体验,支持指针中心缩放、拖动、画廊、下载、键盘操作和图片区域备注。

1前天视觉、语音与多模态MIT
J

dsh-freecanvas

justinqiuck/dsh-freecanvas

将 DSH FreeCanvas 作为内置 DeepSeek Harness 应用安装,支持分屏布局和受管本地 Agent 连接。

1上个月视觉、语音与多模态MIT
M

dsh-bilibili

moxingovo/dsh-bilibili

DeepSeek Harness 插件:提供哔哩哔哩关键词搜索、视频元数据、字幕、直播放地址和多模态视频帧查看工具。默认匿名。

1上个月视觉、语音与多模态MIT
L

dsh-pianist

laplace-bit/dsh-pianist

让 Agent 弹一曲真钢琴:Salamander Grand 真实采样音色,Canvas2D 三角钢琴与沉浸式舞台渲染,88 键可弹。

123天前视觉、语音与多模态MIT
A

dsh-image-preview

algerkong/dsh-image-preview

DSH Web 会话图像预览:将 read_image 结果显示为缩略图,点击可全屏查看。

1上个月视觉、语音与多模态
J

dsh-mmroute

jmxsxwyzjdwl/dsh-mmroute

纯文本模型的透明多模态路由:每一次模型调用里的每张图片先由你自己配置的多模态理解模型全量转述(逐字 OCR、数据、不确定区、防注入),vision_relook 定点复看,图片类报错自动转述重试。不内置端点、不借登录态。

126天前视觉、语音与多模态MIT
C

aura-vision

ck-epsilon/aura-vision

免费视觉识别插件:自适应切块长文档识别,支持历史收藏与 MD/Word/长图/Excel 导出。

1上个月视觉、语音与多模态MIT
T

taxue-dsh-artisan

taxueseek/taxue-dsh-artisan

DSH 一体化视觉创作工具链:提示词反推与审计优化,多供应商生图,支持异步后台出图。

1上个月视觉、语音与多模态MIT
H

dsh-vision-analysis

harvey-will/dsh-vision-analysis

DeepSeek Harness 图像理解插件:8 种分析模式(描述、OCR、图表取数、UI 评审、目标检测、对比、代码生成、诊断),支持任意 OpenAI/Anthropic 兼容视觉 API,内置免费视觉模型与限流自动切换。

13天前视觉、语音与多模态MIT
C

remotion-video-plugin

chenjie1129/remotion-video-plugin

为 DeepSeek Harness 提供 Remotion 视频创作与验证工作流插件,支持诊断项目、发现合成、渲染图像和视频并核验输出元数据。

1上个月视觉、语音与多模态MIT
A

dsh-screenshot

alain-prot0s5/dsh-screenshot

为 DeepSeek Harness 提供截图输入:输入框相机按钮、全局快捷键(Alt+A)和随应用生命周期运行的监听器,均可在设置中配置。

1上个月视觉、语音与多模态MIT
A

dsh-composer-image-tools

ai-yucheng/dsh-composer-image-tools

为 DSH 聊天输入框提供图片上传和自定义区域截图,并将图片注入草稿;单张不超过 10MB,无外部依赖。

1上个月视觉、语音与多模态MIT
L

dsh-speech-input

liznee/dsh-speech-input

为 DeepSeek Harness 增加麦克风按钮,将浏览器语音识别结果写入输入框草稿。

1上个月视觉、语音与多模态MIT
S

dsh-voice-input-cn

schumchanvi/dsh-voice-input-cn

国内可用的输入框语音输入。需要先启动本地 Python bridge(pip install dashscope websockets,运行 bridge/voice-bridge.py)——只装插件不可用。浏览器麦克风采集 16kHz PCM 流式转发给 bridge,由阿里云 DashScope ASR(paraformer-realtime-v2)识别;识别文字在光标处实时填入草稿,静音自动停止,可选识别后自动发送。

116天前视觉、语音与多模态MIT
A

dsh-client-vision (tool-vision)

ankye/dsh-client-vision

屏幕截图与外部视觉识别:take_screenshot、list_windows、analyze_image、view_image 四个工具,可配置 GPT 视觉通道(gpt-5.5 / gpt-5.6-sol / gpt-5.6-terra),API Key 经凭据服务存储,带设置卡片;view_image 在 Web 对话中显示截图,模型上下文只保留文字。

123天前视觉、语音与多模态MIT
S

dsh-narrate

stuarthu/dsh-narrate

将一个想法制作成旁白视频:从自有素材文件夹剪辑画面、用 AI 配音并叠加字幕,流程中四次征求确认。

1上个月视觉、语音与多模态MIT
A

dsh-audio-copilot

ai-yucheng/dsh-audio-copilot

为 DSH 提供 ASR 音频转写和 TTS 语音合成,让纯文本 Agent 能听能说;支持 Windows SAPI 与 OpenAI 兼容端点。

1上个月视觉、语音与多模态MIT