视觉、语音与多模态
视觉、语音与多模态类插件让 DeepSeek-Harness(dsh)里纯文本的 DeepSeek 模型也能"看图""听声""开口"。包含把粘贴的截图交给智谱 GLM、Gemini、豆包或本地 Ollama 做 OCR 与图像描述的 vision 工具和供应商路由、基于浏览器 Web Speech API 或 Whisper 兼容接口的麦克风语音输入、使用 Edge TTS 或自定义音色的朗读回复与全双工语音模式,以及图片、视频、音乐生成工具。
共 312 个插件
dsh-web-ui (dsh-tool-describe-image)
zhu1090093659/dsh-web-ui
给纯文本模型补视觉:describe_image 把本地路径/URL/附件图片交给可配置的 OpenAI 兼容视觉端点,进会话的只有返回文本。
ipollowork
devin-axis/ipollowork
把 iPolloWork HyperFrames 视频工作室与 27 个可编辑视频模板作为原生对话视图接入 DeepSeek Harness。
modlens
liustack/modlens
为纯文本模型架起视觉桥梁:粘贴图片,输出结构化 JSON 证据(OCR、版面、语义)。
dsh-vision-router
ysr666/dsh-vision-router
为纯文本 Agent 提供视觉能力:内置免 Key 视觉链 + 像素级视觉工具(看图问答、定位、裁剪、像素对比、取色、OCR、矢量化、抠图、截图);粘贴图片即可用。
dsh-vision-toolkit
anionex/dsh-vision-toolkit
让纯文本模型处理视觉任务:粘贴图片后自动切换到 Vision Toolkit 变体,支持图片问答、多图比较、长截图 OCR、截图还原前端 UI、元素定位与像素对比。默认无需 API Key——图片经作者自建的免费服务处理,每台机器每天 100 张;也可改为指向自己的服务商。
tongflow
tong-io/tongflow
TongFlow DSH Studio 插件:电影剧组式项目模型、Agent 编写的 TongFlow 工作流、确定性媒体生成和嵌入式画布。
dsh-image-gen
shanliuling/dsh-image-gen
为 DeepSeek Harness 提供原生对话生图能力:直接让 Agent 画图,插件自动完成生成并把结果保留在当前会话中。
watch-skill
oxbshw/watch-skill
把视频、音频与屏幕活动转成带时间戳的可检索证据(DeepWatch)。
dsh-imagegen
dickpy/dsh-imagegen
面向 DSH Web GUI 的 AI 生图插件:通过可配置的 OpenAI 兼容端点(gpt-image-2 / gpt-image-1 / dall-e-3)实现文生图与图生图,提供 api_url/api_key 设置卡片与侧边栏分栏生图工作台。
dsh-comfyui
fandc520/dsh-comfyui
让 DeepSeek Harness 的 Agent 直接驱动本地或远程 ComfyUI:comfyui_run / comfyui_object_info / comfyui_workflow 工具生成与编辑图像、视频,附带工作流库(图工作流提取:按分量 / 主流程 / 整体)、加载区分辨率自动匹配、实时队列、SDXL 与 Wan 2.1 模板、配套 skill 与同源媒体代理。
dsh-omi-voice
polinnizhong/dsh-omi-voice
DeepSeek Harness 对话内朗读:点一下即可朗读、暂停、继续 AI 回复,豆包 TTS 自然音色(BYOK),只读最终回答并过滤代码、表格与图形,本地引擎,插件零 Key。
deepseek-harness-video-director
chiphoton/deepseek-harness-video-director
🎬AI 导演:由 DeepSeek-Harness 执导的 MiniMax-H3 视频生成插件。🤖不只是提示词。🪄画布式 UI。
dsh-design-qa
sunxin-ai/dsh-design-qa
给纯文本模型的设计稿保真判定:`deepseek_vision` 工具从任意 OpenAI 兼容视觉路由借来一只眼,让模型判断实现与设计稿是否一致——并附上支撑该判定的基准(4 组夹具、23 处注入缺陷、逐格原始输出)与其依赖的提问纪律。
picturereader
jing-hy/picturereader
给纯文本模型的"读图"能力:图片降分辨率+降色深+结构/色彩指纹渲染成文本网格喂回对话,模型像多模态一样自主缩放、取样、OCR 读图;纯本地零外部模型依赖,附读图方法论 skill 与可选 PaddleOCR。
dsh-voice-scribe
pensivefei/dsh-voice-scribe
面向 Web UI 的语音输入插件:点按 Alt(或 Alt+空格)开始/停止听写,支持浏览器内置 Web Speech(零配置)或 OpenAI 兼容云端 ASR,可选经 DSH 已配置模型润色,带设置页。
dsh-vision
oil-oil/dsh-vision
为 DeepSeek Harness 提供接近原生的图像理解能力。
dsh-web-ui (dsh-tool-describe-image)
damonkoy/dsh-web-ui
describe_image 模型工具:让纯文本模型通过视觉语言模型获得图像理解能力。
dsh-ears
wiziscool/dsh-ears
面向 DeepSeek Harness (dsh) 的语音输入插件:输入框的麦克风按钮把语音转成草稿文本,支持多种语音识别后端,可选经 dsh 自有 LLM 路由润色,并带原生设置页。
dsh-plugin-tts
1624318455/dsh-plugin-tts
用免费 Edge TTS 或你自己的 RVC 音色朗读 AI 回复:消息朗读与自动朗读、长文自适应分块渐进播放(无缝衔接)、音色包仓库一键安装、便携 RVC 运行时。
dsh-media-skills
mjorgin/dsh-media-skills
面向纯文本模型的免费视觉桥与生图:粘贴读图、GLM-4V-Flash 与 Gemini 引擎故障转移、modlens 同款结构化证据输出,并自动播种免费视觉模型路由。
dsh-aigc-canvas
dsh-external/dsh-aigc-canvas
AIGC 画布:文生图 / 视频 / 音频工具,生成结果作为节点连线存在画布上。
dsh-talk
perrylink/dsh-talk
DeepSeek Harness 的语音输入输出:麦克风语音转文字与文字转语音。
dsh-visual-plugin
jyh20030112/dsh-visual-plugin
给纯文本模型装上眼睛:把用户图片转发给任意 OpenAI 兼容的视觉模型生成描述,并在 Web UI 右侧面板展示结果。
dsh-voice-mode (dsh-voice-mode)
qishuilalala/dsh-voice-mode
DeepSeek Harness Web UI 全双工语音对话:按钮或 Ctrl+Shift+V 进入,持续聆听(停顿自动发送)或按住说话,zipformer2 流式识别入可编辑草稿、可选唤醒词;回复按句 Edge TTS 朗读并显示实时字幕,开口即打断播放与回合(真 barge-in);识别模型本地推理、Edge TTS 在线合成,无需 API Key。