视觉、语音与多模态
视觉、语音与多模态类插件让 DeepSeek-Harness(dsh)里纯文本的 DeepSeek 模型也能"看图""听声""开口"。包含把粘贴的截图交给智谱 GLM、Gemini、豆包或本地 Ollama 做 OCR 与图像描述的 vision 工具和供应商路由、基于浏览器 Web Speech API 或 Whisper 兼容接口的麦克风语音输入、使用 Edge TTS 或自定义音色的朗读回复与全双工语音模式,以及图片、视频、音乐生成工具。
共 312 个插件
dsh-ocr-local
balcoz/dsh-ocr-local
DeepSeek Harness 本地 OCR 插件:粘贴/附加图片即得文字,PP-OCRv5 + ONNX Runtime,完全离线,支持 TUI 与 Web。
dsh-vision-bridge
sfyyy/dsh-vision-bridge
为纯文本 DSH 会话按需提供视觉能力:图片变为标记,vision_describe 工具只把图片和问题发给 OpenAI 兼容的视觉模型。
dsh-voice-input
0nt-one/dsh-voice-input
输入框麦克风语音输入:浏览器 Web Speech API 实时转写(Chrome/Edge),多语言切换与可选自动发送,零依赖零密钥。
dsh-plugin-appshot
tauruswood/dsh-plugin-appshot
DSH 版 Codex Appshots:全局快捷键精准捕获当前工作窗口,零摩擦挂载至 Composer 作为上下文向 Agent 提问。
dsh-screenshot
paicat1/dsh-screenshot
DSH 轻量截图插件:轻——零依赖零二进制;摆——一键全屏、窗口排版、悬停吸附截取被遮挡窗口;自助——Agent 可自助截屏,传路径不传图,路径通用,接上 modlens(选装)一步读出结构化内容。
dsh-guide-dog
atropinoltt/dsh-guide-dog
基于 MiniMax 的多模态插件:实时语音通话模式(流式对话、悬浮胶囊 UI)、语音模式与麦克风语音输入,并提供图像/视频/音乐/语音生成与视觉检查工具。
canvas-workbench
elangan1997-cmyk/canvas-workbench
本地生图工作台:用自己的 API 生图,支持画布排版、修图擦除、去背景、OCR 与转矢量,可交付可编辑 PSD/AI
dsh-tts-bridge
yuuyuko-uu/dsh-tts-bridge
用 DeepSeek 网页端自带的朗读,把 DSH 里的对话念出来,靠一个小浏览器扩展驱动。
dsh-cycle-image-gen
chengzzzi44/dsh-cycle-image-gen
DSH 生图工具:可经任意 OpenAI 兼容端点文生图/图生图,结果既作为耐久附件进入会话,也内联显示在 Web UI 对话中并可在侧栏浏览
tripo3d-plugin-dsh
vast-ai-research/tripo3d-plugin-dsh
面向 DSH 的 Tripo 3D 技能包:通过 tripo-cli 用文本或参考图生成可用于引擎的 3D 资产,一次完成贴图、绑骨、重拓扑与格式转换
deepseek-vl-support
limccn/deepseek-vl-support
让纯文本的 DeepSeek 模型拥有视觉:通过任意 OpenAI 兼容视觉端点描述图片(适用于 Claude Code、Codex 等客户端)
screenshot-feedback-hook-mcp (dsh-plugin)
lkh081231/screenshot-feedback-hook-mcp
一个截图工具,外加两个默认关闭的自动截图时机。需要模型支持图片输入。
dsh-pdf-reader
angeloszou/dsh-pdf-reader
面向视觉模型的内容感知 PDF 读取插件:逐页分析图(矢量与栅格)、表格、公式风险与双栏排版,基于内容识别进行混合提取,图表/公式页渲染成高 DPI 区域裁切。提供低清预览以理解页面概况并支持指定选区获取高清渲染。功能包装为多个工具供Agent使用。
dsh-hos-scrcpy
ns-zzj/dsh-hos-scrcpy
在 DSH 网页中用 AI 操控鸿蒙手机:实时 H.264 投屏、触控与系统按键、hilog 日志,并让模型读屏、定位 UI 控件,再执行点击/长按/按键/输入。
dsh-vision-hub (tool-vision)
xing666173/dsh-vision-hub
增强版视觉工具箱:14 个像素级视觉工具(看图问答/定位/检测/裁剪/像素比对/OCR/长截图OCR/矢量化/取色/抠图/截图/展示/落盘/网页截图),单一 OpenAI 兼容端点驱动,桥接标记极简、规则下沉系统提示,带内容安全识别与限流自动重试。
dsh-image-pathify
dami9527/dsh-image-pathify
让纯文本模型也能处理聊天贴图,提供原生视觉体验,支持批量看图,走内置 OpenAI 兼容识图工具 analyze_image;具备视觉能力的模型不受影响。
dsh-voice
stardustlc666/dsh-voice
语音五工具:edge-tts 免费微软神经语音合成、OpenAI 兼容 ASR 转写、音色清单、批量音色试听与健康自检。
dsh-voice
haoku123/dsh-voice
Web UI 全双工语音对话:点按切换或按住说话(发送键或 `Ctrl`)并显示实时字幕,宿主端 SenseVoice(sherpa-onnx)转写,回复按句流式朗读,开口说话即打断播放与正在运行的回合(真 barge-in),无需 API key。
dsh-chatvoice
fuzzysoul/dsh-chatvoice
Web UI 免费语音闭环:浏览器语音识别输入(实时中间结果上屏)+ 助手回复朗读与自动朗读,零配置、免 API key。
dsh-draw-router
xiaozhe7772222/dsh-draw-router
DeepSeek Harness 统一绘图路由器:自动识别任意 OpenAI 兼容接口的绘图模型,提供 draw_image 和 draw_list_sources 工具,支持商汤、阶跃、Agnes、千问、Flux、SD、Imagen 等。
free-vision-skill
niyongsheng/free-vision-skill
基于 macOS Vision Framework 的全本地识图插件:`ocr_image`(文字提取,表格结构+坐标)与 `view_image`(场景/人脸/二维码);web 输入框可直接粘贴多张图片,图片永不离开你的 Mac。
deepseek-vision (dsh-plugin-deepseek-vision)
gou-gee/deepseek-vision
面向纯文本 DeepSeek 的视觉 MCP + DSH 插件:analyze_image / analyze_clipboard / compare_images / vision_status 四个工具、可视化配置页、默认免费 GLM-4.6V-Flash、结果缓存与限流容错,Key 不入日志。
dsh-plugin-deepeye
favio8/dsh-plugin-deepeye
DeepEye 视觉插件:为 DeepSeek Harness(DSH)提供图像描述、OCR、VQA、UI 布局和剪贴板分析。
dsh-her-eyes
huashenglian/dsh-her-eyes
一个可以让ai自动调用VLM(多模态模型)进行视觉分析的dsh插件。A dsh plugin that allows AI to automatically invoke VLMs (multimodal models) for visual analysis.