跳过主要内容

视觉、语音与多模态

视觉、语音与多模态类插件让 DeepSeek-Harness(dsh)里纯文本的 DeepSeek 模型也能"看图""听声""开口"。包含把粘贴的截图交给智谱 GLM、Gemini、豆包或本地 Ollama 做 OCR 与图像描述的 vision 工具和供应商路由、基于浏览器 Web Speech API 或 Whisper 兼容接口的麦克风语音输入、使用 Edge TTS 或自定义音色的朗读回复与全双工语音模式,以及图片、视频、音乐生成工具。

共 86 个插件

D

dsh-web-ui (dsh-tool-describe-image)

damonkoy/dsh-web-ui

describe_image 模型工具:让纯文本模型通过视觉语言模型获得图像理解能力。

33天前视觉、语音与多模态Apache-2.0
G

dsh-vision-bridge

gxx182/dsh-vision-bridge

将会话图片转交可配置视觉服务,并向符合条件的 DeepSeek Harness 模型路由返回纯文本分析。

312小时前视觉、语音与多模态MIT
E

dsh-llm-vision-bridge

einskyle/dsh-llm-vision-bridge

DeepSeek 视觉桥接:注册原生 LLM provider,聊天内粘贴的图片自动由视觉模型(pi-ai/llama.cpp 上的 Qwen3-VL)转成文字描述后交给纯文本 DeepSeek 作答——图片准入、路由与会话压缩全部走 harness 原生机制,带 LRU 描述缓存与 503 重试。

34天前视觉、语音与多模态MIT
X

dsh-vision-bridge

ximengxiaolan/dsh-vision-bridge

输入框贴图自动识别:由 OpenAI 兼容视觉模型转成文字描述后,再交给纯文本 DeepSeek 模型处理。

34天前视觉、语音与多模态MIT
Q

dsh-mic-input

qt-chen/dsh-mic-input

输入框麦克风语音输入:浏览器 Web Speech API 实时转写,自动去重/续听、智能标点,支持语言与自动发送设置。

3前天视觉、语音与多模态MIT
S

dsh-voice

stardustlc666/dsh-voice

语音双件套:edge-tts 免费微软神经语音合成 + OpenAI 兼容 ASR 转写。

27小时前视觉、语音与多模态MIT
N

voco-input-sh

nothree-code/voco-input-sh

Web UI 语音输入:输入框麦克风按钮驱动本地 VocoType 离线识别,识别结果自动插入输入框(自动部署/防重复/持续输入)。

221小时前视觉、语音与多模态MIT
0

dsh-voice-input

0nt-one/dsh-voice-input

输入框麦克风语音输入:浏览器 Web Speech API 实时转写(Chrome/Edge),多语言切换与可选自动发送,零依赖零密钥。

23天前视觉、语音与多模态MIT
X

dsh-draw-router

xiaozhe7772222/dsh-draw-router

DeepSeek Harness 统一生图路由:自动识别任意 OpenAI 兼容端点的绘图模型(商汤、阶跃、Agnes、千问、Flux、SD、Imagen 等),提供 Agent 工具与 REST API。

25小时前视觉、语音与多模态MIT
X

dsh-vision

xiaoshihou514/dsh-vision

极简的原生视觉能力增强,支持免费的智谱模型或本地千问视觉模型。

2前天视觉、语音与多模态MIT
W

visual-review

wang-bool/visual-review

在 DSH Web 聊天界面内联渲染粘贴/上传的图片,并让纯文本模型“看见”图片:visual_review 工具优先调用任意 OpenAI 兼容多模态 API,未配置时回退本机 Qwen3-VL。

217小时前视觉、语音与多模态MIT
N

dsh-llm-deepseek-vision

nagasakisoyo-ui/dsh-llm-deepseek-vision

视觉增强的 DeepSeek 适配器:由视觉模型把图片描述成文字,纯文本 DeepSeek 模型再基于描述推理。

24天前视觉、语音与多模态MIT
M

dsh-vision-tools

moon09300731/dsh-vision-tools

DeepSeek Harness 视觉能力全家桶:vision_understand 工具(OpenAI 兼容视觉 API,默认免费智谱 GLM-4V-Flash)+ 粘贴/拖拽/按钮三入口识图。

2昨天视觉、语音与多模态MIT
M

dsh-tesseract-ocr

maxwell-feng/dsh-tesseract-ocr

本地 Tesseract 识别附加图片:只把识别出的文字发送给模型,图片字节不进入上下文;视觉直通可选开启。

2昨天视觉、语音与多模态MIT
L

dsh-image-gen

leemancheung/dsh-image-gen

GPT Image 2 `image_gen`:默认复用 Codex 订阅 OAuth,也可显式使用 API Key;显影卡片、最多 3 张 API 实时局部图、持久附件回放/灯箱/下载、纯文本模型输出和受限的凭据安全请求。

23天前视觉、语音与多模态MIT
H

dsh-open-eyes

hyp6666/dsh-open-eyes

为纯文本 DeepSeek 路由提供视觉桥接:通过可配置的 OpenAI Responses、Chat Completions 或 Anthropic Messages 端点分析附件与本地图片,同时保持支持图片的路由走原生路径。

2前天视觉、语音与多模态MIT
H

dsh-vision-mix

haiziyao/dsh-vision-mix

把文本、识图和生图 API 组合成一个 Mix 模型并按对话内容自动路由:纯文本走聊天模型,用户图片和 Agent 截图走识图模型,后续可继续追问同一张图;还支持图片生成与编辑及会话级调用记录。

23天前视觉、语音与多模态MIT
F

dsh-free-vision

fuzzysoul/dsh-free-vision

免费视觉插件:纯文本模型看图 / OCR / UI / 报错分析,优先免费模型(千问 Qwen3-VL-Flash、豆包、DeepSeek-OCR),设置界面可配置。

28小时前视觉、语音与多模态MIT
P

dsh-voice-call

pandapolo/dsh-voice-call

agent 主动打来的语音电话:`offer_call` 向人类振铃(接听/拒接/稍后再说),接听后由本地 CrispASR + Qwen3-TTS 合成并播放(9 个音色,含 2 个中文方言);拒接则把决定返回给 agent。

1昨天视觉、语音与多模态MIT
F

dsh-chatvoice

fuzzysoul/dsh-chatvoice

Web UI 免费语音闭环:浏览器语音识别输入(实时中间结果上屏)+ 助手回复朗读与自动朗读,零配置、免 API key。

13天前视觉、语音与多模态MIT
B

dsh-stt-input

baisama-cloud/dsh-stt-input

Web UI 语音输入:输入框旁麦克风按钮语音转文字填入输入框;支持浏览器 Web Speech API 本地识别(零配置、无需密钥)与 OpenAI 兼容 Whisper API(OpenAI/Groq),模型与语言可在设置中选择。

1昨天视觉、语音与多模态MIT
X

dsh-image-vision

xsoc1/dsh-image-vision

纯文本 DeepSeek 的聊天识图插件:view_image 工具转发任意 OpenAI 兼容 VLM(本地 Ollama 或云端),对话框粘贴/拖拽的图片自动改写为 view_image 路径标记供模型查看。

13天前视觉、语音与多模态
W

mimo-vision

wulusai2333/mimo-vision

`describe_image` 视觉桥:经 opencode Zen API(凭据 `OPENCODE_GO_API_KEY`,免费线路优先、付费兜底)把图片发给 mimo-v2.5、返回文字描述给纯文本模型,原生格式直发,SVG/TIFF/HEIC 等格式经 ImageMagick 自动转码。

1前天视觉、语音与多模态MIT
W

dsh-tool-vision

wanshichenguang/dsh-tool-vision

通过 DashScope OpenAI 兼容视觉接口提供 image_describe 识图工具;在纯文本模型会话中,将粘贴图片保存为模型可读取的本地路径,并在聊天记录中回显图片。

1前天视觉、语音与多模态MIT