跳过主要内容

视觉、语音与多模态

视觉、语音与多模态类插件让 DeepSeek-Harness(dsh)里纯文本的 DeepSeek 模型也能"看图""听声""开口"。包含把粘贴的截图交给智谱 GLM、Gemini、豆包或本地 Ollama 做 OCR 与图像描述的 vision 工具和供应商路由、基于浏览器 Web Speech API 或 Whisper 兼容接口的麦克风语音输入、使用 Edge TTS 或自定义音色的朗读回复与全双工语音模式,以及图片、视频、音乐生成工具。

共 312 个插件

Z

dsh-web-ui (dsh-tool-describe-image)

zhu1090093659/dsh-web-ui

给纯文本模型补视觉:describe_image 把本地路径/URL/附件图片交给可配置的 OpenAI 兼容视觉端点,进会话的只有返回文本。

8k6天前视觉、语音与多模态Apache-2.0
D

ipollowork

devin-axis/ipollowork

把 iPolloWork HyperFrames 视频工作室与 27 个可编辑视频模板作为原生对话视图接入 DeepSeek Harness。

4.2k上个月视觉、语音与多模态
L

modlens

liustack/modlens

为纯文本模型架起视觉桥梁:粘贴图片,输出结构化 JSON 证据(OCR、版面、语义)。

4.1k5天前视觉、语音与多模态MIT
Y

dsh-vision-router

ysr666/dsh-vision-router

为纯文本 Agent 提供视觉能力:内置免 Key 视觉链 + 像素级视觉工具(看图问答、定位、裁剪、像素对比、取色、OCR、矢量化、抠图、截图);粘贴图片即可用。

1.1k昨天视觉、语音与多模态MIT
A

dsh-vision-toolkit

anionex/dsh-vision-toolkit

让纯文本模型处理视觉任务:粘贴图片后自动切换到 Vision Toolkit 变体,支持图片问答、多图比较、长截图 OCR、截图还原前端 UI、元素定位与像素对比。默认无需 API Key——图片经作者自建的免费服务处理,每台机器每天 100 张;也可改为指向自己的服务商。

887前天视觉、语音与多模态MIT
T

tongflow

tong-io/tongflow

TongFlow DSH Studio 插件:电影剧组式项目模型、Agent 编写的 TongFlow 工作流、确定性媒体生成和嵌入式画布。

870上个月视觉、语音与多模态AGPL-3.0
S

dsh-image-gen

shanliuling/dsh-image-gen

为 DeepSeek Harness 提供原生对话生图能力:直接让 Agent 画图,插件自动完成生成并把结果保留在当前会话中。

5643天前视觉、语音与多模态Apache-2.0
O

watch-skill

oxbshw/watch-skill

把视频、音频与屏幕活动转成带时间戳的可检索证据(DeepWatch)。

37818天前视觉、语音与多模态MIT
D

dsh-imagegen

dickpy/dsh-imagegen

面向 DSH Web GUI 的 AI 生图插件:通过可配置的 OpenAI 兼容端点(gpt-image-2 / gpt-image-1 / dall-e-3)实现文生图与图生图,提供 api_url/api_key 设置卡片与侧边栏分栏生图工作台。

99前天视觉、语音与多模态Apache-2.0
F

dsh-comfyui

fandc520/dsh-comfyui

让 DeepSeek Harness 的 Agent 直接驱动本地或远程 ComfyUI:comfyui_run / comfyui_object_info / comfyui_workflow 工具生成与编辑图像、视频,附带工作流库(图工作流提取:按分量 / 主流程 / 整体)、加载区分辨率自动匹配、实时队列、SDXL 与 Wan 2.1 模板、配套 skill 与同源媒体代理。

936天前视觉、语音与多模态MIT
P

dsh-omi-voice

polinnizhong/dsh-omi-voice

DeepSeek Harness 对话内朗读:点一下即可朗读、暂停、继续 AI 回复,豆包 TTS 自然音色(BYOK),只读最终回答并过滤代码、表格与图形,本地引擎,插件零 Key。

74上个月视觉、语音与多模态MIT
C

deepseek-harness-video-director

chiphoton/deepseek-harness-video-director

🎬AI 导演:由 DeepSeek-Harness 执导的 MiniMax-H3 视频生成插件。🤖不只是提示词。🪄画布式 UI。

694天前视觉、语音与多模态MIT
S

dsh-design-qa

sunxin-ai/dsh-design-qa

给纯文本模型的设计稿保真判定:`deepseek_vision` 工具从任意 OpenAI 兼容视觉路由借来一只眼,让模型判断实现与设计稿是否一致——并附上支撑该判定的基准(4 组夹具、23 处注入缺陷、逐格原始输出)与其依赖的提问纪律。

4426天前视觉、语音与多模态MIT
J

picturereader

jing-hy/picturereader

给纯文本模型的"读图"能力:图片降分辨率+降色深+结构/色彩指纹渲染成文本网格喂回对话,模型像多模态一样自主缩放、取样、OCR 读图;纯本地零外部模型依赖,附读图方法论 skill 与可选 PaddleOCR。

37前天视觉、语音与多模态MIT
P

dsh-voice-scribe

pensivefei/dsh-voice-scribe

面向 Web UI 的语音输入插件:点按 Alt(或 Alt+空格)开始/停止听写,支持浏览器内置 Web Speech(零配置)或 OpenAI 兼容云端 ASR,可选经 DSH 已配置模型润色,带设置页。

343天前视觉、语音与多模态MIT
O

dsh-vision

oil-oil/dsh-vision

为 DeepSeek Harness 提供接近原生的图像理解能力。

242个月前视觉、语音与多模态MIT
D

dsh-web-ui (dsh-tool-describe-image)

damonkoy/dsh-web-ui

describe_image 模型工具:让纯文本模型通过视觉语言模型获得图像理解能力。

222个月前视觉、语音与多模态Apache-2.0
W

dsh-ears

wiziscool/dsh-ears

面向 DeepSeek Harness (dsh) 的语音输入插件:输入框的麦克风按钮把语音转成草稿文本,支持多种语音识别后端,可选经 dsh 自有 LLM 路由润色,并带原生设置页。

2121小时前视觉、语音与多模态MIT
1

dsh-plugin-tts

1624318455/dsh-plugin-tts

用免费 Edge TTS 或你自己的 RVC 音色朗读 AI 回复:消息朗读与自动朗读、长文自适应分块渐进播放(无缝衔接)、音色包仓库一键安装、便携 RVC 运行时。

216天前视觉、语音与多模态MIT
M

dsh-media-skills

mjorgin/dsh-media-skills

面向纯文本模型的免费视觉桥与生图:粘贴读图、GLM-4V-Flash 与 Gemini 引擎故障转移、modlens 同款结构化证据输出,并自动播种免费视觉模型路由。

1912天前视觉、语音与多模态MIT
D

dsh-aigc-canvas

dsh-external/dsh-aigc-canvas

AIGC 画布:文生图 / 视频 / 音频工具,生成结果作为节点连线存在画布上。

1721天前视觉、语音与多模态
P

dsh-talk

perrylink/dsh-talk

DeepSeek Harness 的语音输入输出:麦克风语音转文字与文字转语音。

168天前视觉、语音与多模态Apache-2.0
J

dsh-visual-plugin

jyh20030112/dsh-visual-plugin

给纯文本模型装上眼睛:把用户图片转发给任意 OpenAI 兼容的视觉模型生成描述,并在 Web UI 右侧面板展示结果。

163天前视觉、语音与多模态MIT
Q

dsh-voice-mode (dsh-voice-mode)

qishuilalala/dsh-voice-mode

DeepSeek Harness Web UI 全双工语音对话:按钮或 Ctrl+Shift+V 进入,持续聆听(停顿自动发送)或按住说话,zipformer2 流式识别入可编辑草稿、可选唤醒词;回复按句 Edge TTS 朗读并显示实时字幕,开口即打断播放与回合(真 barge-in);识别模型本地推理、Edge TTS 在线合成,无需 API Key。

156小时前视觉、语音与多模态MIT