跳过主要内容

视觉、语音与多模态

视觉、语音与多模态类插件让 DeepSeek-Harness(dsh)里纯文本的 DeepSeek 模型也能"看图""听声""开口"。包含把粘贴的截图交给智谱 GLM、Gemini、豆包或本地 Ollama 做 OCR 与图像描述的 vision 工具和供应商路由、基于浏览器 Web Speech API 或 Whisper 兼容接口的麦克风语音输入、使用 Edge TTS 或自定义音色的朗读回复与全双工语音模式,以及图片、视频、音乐生成工具。

共 86 个插件

L

modlens

liustack/modlens

为纯文本模型架起视觉桥梁:粘贴图片,输出结构化 JSON 证据(OCR、版面、语义)。

3.1k4小时前视觉、语音与多模态MIT
Y

dsh-vision-router

ysr666/dsh-vision-router

为纯文本 Agent 提供视觉能力:内置免 Key 视觉链 + 像素级视觉工具(看图问答、定位、裁剪、像素对比、取色、OCR、矢量化、抠图、截图);粘贴图片即可用。

7404小时前视觉、语音与多模态MIT
A

dsh-vision-toolkit

anionex/dsh-vision-toolkit

让纯文本模型更好地做视觉任务:带意图的图片问答、长截图 OCR、UI 还原等。

6947小时前视觉、语音与多模态MIT
J

picturereader

jing-hy/picturereader

给纯文本模型的"读图"能力:图片降分辨率+降色深+结构/色彩指纹渲染成文本网格喂回对话,模型像多模态一样自主缩放、取样、OCR 读图;纯本地零外部模型依赖,附读图方法论 skill 与可选 PaddleOCR。

209小时前视觉、语音与多模态MIT
L

dsh-vision

linenxi-ctrl/dsh-vision

外挂识图插件:鲸鱼按钮配置面板、图片识图自动回传、模型自主截图识图工具。

123天前视觉、语音与多模态MIT
M

dsh-media-skills

mjorgin/dsh-media-skills

面向纯文本模型的免费视觉桥与生图:粘贴读图、GLM-4V-Flash 与 Gemini 引擎故障转移、modlens 同款结构化证据输出,并自动播种免费视觉模型路由。

11昨天视觉、语音与多模态MIT
F

dsh-vision-proxy

flyvhidbwo/dsh-vision-proxy

DeepSeek 大脑 + 自动识图:GUI 附加的每张图片自动经 OpenAI 兼容 VLM 转译成文字,再交给纯文本的 DeepSeek 作答——有 key 自动走快速通道(默认 qwen3.7-flash,支持百炼/智谱/OpenRouter 等任意 OpenAI 兼容端点),无 key 自动探测本地 Ollama(零配置,图片不出本机)。

11前天视觉、语音与多模态MIT
P

dsh-vision-opencode

poiuyjie/dsh-vision-opencode

给纯文本主模型加可配置识图模型:vision_read_image 工具、输入框识图模型选择器,以及纯文本路由的图片自动转文字。

1013小时前视觉、语音与多模态MIT
J

dsh-visual-plugin

jyh20030112/dsh-visual-plugin

给纯文本模型装上眼睛:把用户图片转发给任意 OpenAI 兼容的视觉模型生成描述,并在 Web UI 右侧面板展示结果。

913小时前视觉、语音与多模态MIT
C

Gemini-Eyes

consolesun/gemini-eyes

接入 gemini.google.com 的 MCP 桥:图片/视频视觉识别、Imagen 生图、Veo 生视频与历史对话管理,复用浏览器登录态,无需 API Key。

84天前视觉、语音与多模态
1

dsh-plugin-tts

1624318455/dsh-plugin-tts

用免费 Edge TTS 或你自己的 RVC 音色朗读 AI 回复:消息朗读与自动朗读、长文自适应分块渐进播放(无缝衔接)、音色包仓库一键安装、便携 RVC 运行时。

79小时前视觉、语音与多模态MIT
D

dsh-imagegen

dickpy/dsh-imagegen

面向 DSH Web GUI 的 AI 生图插件:通过可配置的 OpenAI 兼容端点(gpt-image-2 / gpt-image-1 / dall-e-3)实现文生图与图生图,提供 api_url/api_key 设置卡片与侧边栏分栏生图工作台。

76小时前视觉、语音与多模态Apache-2.0
C

dsh-chat-imagine

corrinehu/dsh-chat-imagine

在 DSH 聊天窗口自动调用生图工具(API 渠道,或本机 CLI:已支持 mmx / codex / agy)并展示图片。

7昨天视觉、语音与多模态MIT
5

dsh-vision

54xkeee/dsh-vision

纯文本 DeepSeek 的识图插件:默认走豆包 Web(零成本、免 API key,经 Windows CDP 桥接驱动已登录 Chrome),另有反重力额度(flash/pro)与 Gemini 降级通道;档位自动升级、视觉证据记忆与会话压缩恢复、内容哈希缓存、双语客户端面板。

73天前视觉、语音与多模态MIT
Z

dsh-voice-input-plugin

zhangbo-cn/dsh-voice-input-plugin

输入框麦克风:点击持续监控、按住对话;浏览器语音识别逐字上屏,回复由 host Edge TTS 边生成边朗读,朗读时暂停识别防回声,点击可停止。

6昨天视觉、语音与多模态MIT
S

dsh-deepseek-vision

siegfly/dsh-deepseek-vision

视觉语言网关:注册支持图片输入的 DeepSeek provider 路由,图片先由可配置 VL 模型(默认 Qwen-VL)描述成文字再发送。

6昨天视觉、语音与多模态MIT
M

dsh-windows-ocr

maxwell-feng/dsh-windows-ocr

本地 Windows 引擎(Windows.Media.Ocr)识别附加图片:只把识别出的文字发送给模型,图片字节不进入上下文;视觉直通可选开启。

6昨天视觉、语音与多模态MIT
3

dsh-voice

3274375092/dsh-voice

语音输入插件:对着麦克风说话,识别后的文字作为普通聊天消息发送(本地模型或浏览器语音识别)。

43天前视觉、语音与多模态MIT
G

deepseek-vision (dsh-plugin-deepseek-vision)

gou-gee/deepseek-vision

面向纯文本 DeepSeek 的视觉 MCP + DSH 插件:analyze_image / analyze_clipboard / compare_images / vision_status 四个工具、可视化配置页、默认免费 GLM-4.6V-Flash、结果缓存与限流容错,Key 不入日志。

4前天视觉、语音与多模态MIT
A

dsh-guide-dog

atropinoltt/dsh-guide-dog

基于 MiniMax 的多模态插件:实时语音通话模式(流式对话、悬浮胶囊 UI)、语音模式与麦克风语音输入,并提供图像/视频/音乐/语音生成与视觉检查工具。

4昨天视觉、语音与多模态MIT
H

dsh-her-eyes

huashenglian/dsh-her-eyes

一个可以让ai自动调用VLM(多模态模型)进行视觉分析的dsh插件。A dsh plugin that allows AI to automatically invoke VLMs (multimodal models) for visual analysis.

45天前视觉、语音与多模态MIT
A

dsh-speak

alan2z/dsh-speak

语音播报 agent 最终回复:Windows SAPI5 自然语音 / macOS 系统语音,自动跳过思考与工具调用,npm 一行安装。

3前天视觉、语音与多模态MIT
S

dsh-plugin-multimodal

shinjiyu/dsh-plugin-multimodal

在纯文本 DeepSeek 线路上开放贴图准入,用视觉 sidecar 把附件转成文字,原生视觉模型不改写。

3前天视觉、语音与多模态MIT
N

free-vision-skill

niyongsheng/free-vision-skill

基于 macOS Vision Framework 的全本地识图插件:`ocr_image`(文字提取,表格结构+坐标)与 `view_image`(场景/人脸/二维码);web 输入框可直接粘贴多张图片,图片永不离开你的 Mac。

33天前视觉、语音与多模态MIT