跳过主要内容

视觉、语音与多模态

视觉、语音与多模态类插件让 DeepSeek-Harness(dsh)里纯文本的 DeepSeek 模型也能"看图""听声""开口"。包含把粘贴的截图交给智谱 GLM、Gemini、豆包或本地 Ollama 做 OCR 与图像描述的 vision 工具和供应商路由、基于浏览器 Web Speech API 或 Whisper 兼容接口的麦克风语音输入、使用 Edge TTS 或自定义音色的朗读回复与全双工语音模式,以及图片、视频、音乐生成工具。

共 312 个插件

B

dsh-ocr-local

balcoz/dsh-ocr-local

DeepSeek Harness 本地 OCR 插件:粘贴/附加图片即得文字,PP-OCRv5 + ONNX Runtime,完全离线,支持 TUI 与 Web。

52个月前视觉、语音与多模态
S

dsh-vision-bridge

sfyyy/dsh-vision-bridge

为纯文本 DSH 会话按需提供视觉能力:图片变为标记,vision_describe 工具只把图片和问题发给 OpenAI 兼容的视觉模型。

52个月前视觉、语音与多模态MIT
0

dsh-voice-input

0nt-one/dsh-voice-input

输入框麦克风语音输入:浏览器 Web Speech API 实时转写(Chrome/Edge),多语言切换与可选自动发送,零依赖零密钥。

52个月前视觉、语音与多模态MIT
T

dsh-plugin-appshot

tauruswood/dsh-plugin-appshot

DSH 版 Codex Appshots:全局快捷键精准捕获当前工作窗口,零摩擦挂载至 Composer 作为上下文向 Agent 提问。

55天前视觉、语音与多模态MIT
P

dsh-screenshot

paicat1/dsh-screenshot

DSH 轻量截图插件:轻——零依赖零二进制;摆——一键全屏、窗口排版、悬停吸附截取被遮挡窗口;自助——Agent 可自助截屏,传路径不传图,路径通用,接上 modlens(选装)一步读出结构化内容。

524天前视觉、语音与多模态MIT
A

dsh-guide-dog

atropinoltt/dsh-guide-dog

基于 MiniMax 的多模态插件:实时语音通话模式(流式对话、悬浮胶囊 UI)、语音模式与麦克风语音输入,并提供图像/视频/音乐/语音生成与视觉检查工具。

52个月前视觉、语音与多模态MIT
E

canvas-workbench

elangan1997-cmyk/canvas-workbench

本地生图工作台:用自己的 API 生图,支持画布排版、修图擦除、去背景、OCR 与转矢量,可交付可编辑 PSD/AI

43天前视觉、语音与多模态MIT
Y

dsh-tts-bridge

yuuyuko-uu/dsh-tts-bridge

用 DeepSeek 网页端自带的朗读,把 DSH 里的对话念出来,靠一个小浏览器扩展驱动。

43天前视觉、语音与多模态
C

dsh-cycle-image-gen

chengzzzi44/dsh-cycle-image-gen

DSH 生图工具:可经任意 OpenAI 兼容端点文生图/图生图,结果既作为耐久附件进入会话,也内联显示在 Web UI 对话中并可在侧栏浏览

422天前视觉、语音与多模态MIT
V

tripo3d-plugin-dsh

vast-ai-research/tripo3d-plugin-dsh

面向 DSH 的 Tripo 3D 技能包:通过 tripo-cli 用文本或参考图生成可用于引擎的 3D 资产,一次完成贴图、绑骨、重拓扑与格式转换

423天前视觉、语音与多模态
L

deepseek-vl-support

limccn/deepseek-vl-support

让纯文本的 DeepSeek 模型拥有视觉:通过任意 OpenAI 兼容视觉端点描述图片(适用于 Claude Code、Codex 等客户端)

4上个月视觉、语音与多模态MIT
L

screenshot-feedback-hook-mcp (dsh-plugin)

lkh081231/screenshot-feedback-hook-mcp

一个截图工具,外加两个默认关闭的自动截图时机。需要模型支持图片输入。

4上个月视觉、语音与多模态MIT
A

dsh-pdf-reader

angeloszou/dsh-pdf-reader

面向视觉模型的内容感知 PDF 读取插件:逐页分析图(矢量与栅格)、表格、公式风险与双栏排版,基于内容识别进行混合提取,图表/公式页渲染成高 DPI 区域裁切。提供低清预览以理解页面概况并支持指定选区获取高清渲染。功能包装为多个工具供Agent使用。

4上个月视觉、语音与多模态MIT
N

dsh-hos-scrcpy

ns-zzj/dsh-hos-scrcpy

在 DSH 网页中用 AI 操控鸿蒙手机:实时 H.264 投屏、触控与系统按键、hilog 日志,并让模型读屏、定位 UI 控件,再执行点击/长按/按键/输入。

4前天视觉、语音与多模态MIT
X

dsh-vision-hub (tool-vision)

xing666173/dsh-vision-hub

增强版视觉工具箱:14 个像素级视觉工具(看图问答/定位/检测/裁剪/像素比对/OCR/长截图OCR/矢量化/取色/抠图/截图/展示/落盘/网页截图),单一 OpenAI 兼容端点驱动,桥接标记极简、规则下沉系统提示,带内容安全识别与限流自动重试。

4上个月视觉、语音与多模态
D

dsh-image-pathify

dami9527/dsh-image-pathify

让纯文本模型也能处理聊天贴图,提供原生视觉体验,支持批量看图,走内置 OpenAI 兼容识图工具 analyze_image;具备视觉能力的模型不受影响。

48天前视觉、语音与多模态MIT
S

dsh-voice

stardustlc666/dsh-voice

语音五工具:edge-tts 免费微软神经语音合成、OpenAI 兼容 ASR 转写、音色清单、批量音色试听与健康自检。

48小时前视觉、语音与多模态MIT
H

dsh-voice

haoku123/dsh-voice

Web UI 全双工语音对话:点按切换或按住说话(发送键或 `Ctrl`)并显示实时字幕,宿主端 SenseVoice(sherpa-onnx)转写,回复按句流式朗读,开口说话即打断播放与正在运行的回合(真 barge-in),无需 API key。

4上个月视觉、语音与多模态MIT
F

dsh-chatvoice

fuzzysoul/dsh-chatvoice

Web UI 免费语音闭环:浏览器语音识别输入(实时中间结果上屏)+ 助手回复朗读与自动朗读,零配置、免 API key。

42个月前视觉、语音与多模态MIT
X

dsh-draw-router

xiaozhe7772222/dsh-draw-router

DeepSeek Harness 统一绘图路由器:自动识别任意 OpenAI 兼容接口的绘图模型,提供 draw_image 和 draw_list_sources 工具,支持商汤、阶跃、Agnes、千问、Flux、SD、Imagen 等。

4上个月视觉、语音与多模态MIT
N

free-vision-skill

niyongsheng/free-vision-skill

基于 macOS Vision Framework 的全本地识图插件:`ocr_image`(文字提取,表格结构+坐标)与 `view_image`(场景/人脸/二维码);web 输入框可直接粘贴多张图片,图片永不离开你的 Mac。

4上个月视觉、语音与多模态MIT
G

deepseek-vision (dsh-plugin-deepseek-vision)

gou-gee/deepseek-vision

面向纯文本 DeepSeek 的视觉 MCP + DSH 插件:analyze_image / analyze_clipboard / compare_images / vision_status 四个工具、可视化配置页、默认免费 GLM-4.6V-Flash、结果缓存与限流容错,Key 不入日志。

426天前视觉、语音与多模态MIT
F

dsh-plugin-deepeye

favio8/dsh-plugin-deepeye

DeepEye 视觉插件:为 DeepSeek Harness(DSH)提供图像描述、OCR、VQA、UI 布局和剪贴板分析。

42个月前视觉、语音与多模态
H

dsh-her-eyes

huashenglian/dsh-her-eyes

一个可以让ai自动调用VLM(多模态模型)进行视觉分析的dsh插件。A dsh plugin that allows AI to automatically invoke VLMs (multimodal models) for visual analysis.

42个月前视觉、语音与多模态MIT