跳过主要内容

视觉、语音与多模态

视觉、语音与多模态类插件让 DeepSeek-Harness(dsh)里纯文本的 DeepSeek 模型也能"看图""听声""开口"。包含把粘贴的截图交给智谱 GLM、Gemini、豆包或本地 Ollama 做 OCR 与图像描述的 vision 工具和供应商路由、基于浏览器 Web Speech API 或 Whisper 兼容接口的麦克风语音输入、使用 Edge TTS 或自定义音色的朗读回复与全双工语音模式,以及图片、视频、音乐生成工具。

共 86 个插件

T

dsh-plugins (dsh-vision)

tzhr-invest/dsh-plugins

Agent 可调用的视觉工具:通过你配置的任意 OpenAI 兼容视觉端点描述本地图片,支持多模型交叉核对,不内置任何密钥。

1昨天视觉、语音与多模态MIT
P

dsh-screenshot

paicat1/dsh-screenshot

DeepSeek Harness (dsh) 的独立截图工具。浏览器快捷键一键截图,并提供面向智能体的截图加读取能力,让智能体能看到并分析任意屏幕区域。

1昨天视觉、语音与多模态MIT
N

dsh-auto-vision

normanfxxkingrockwell/dsh-auto-vision

为纯文本 DeepSeek Harness 主模型搭视觉桥:自动从已配置模型中挑选多模态模型,通过 vision 工具把图片描述以纯文本返回。

113小时前视觉、语音与多模态MIT
M

dsh-koboldcpp-hands

microherox/dsh-koboldcpp-hands

给在线模型装上本地双手:koboldcpp_run 与 koboldcpp_vision 工具把重复的文本与视觉(OCR、图像分析、对比)劳动交给本地 KoboldCpp(llama.cpp)服务器,并按需拉起与管理服务器生命周期。

118小时前视觉、语音与多模态MIT
L

dsh-plugin-grok2api-media-tool

lsjspl/dsh-plugin-grok2api-media-tool

让 dsh 通过 grok2api 的 API 获得生成图片与视频能力。

111小时前视觉、语音与多模态
L

dsh-eyes

leeminjing/dsh-eyes

为纯文本 DeepSeek 模型提供按需视觉:上传图片后,模型通过 view_image 工具调用任意 OpenAI 兼容视觉端点(默认 Qwen/DashScope)。

1前天视觉、语音与多模态MIT
K

dsh-mindseye

kanchengw/dsh-mindseye

为纯文本 DeepSeek Harness 模型提供视觉能力:原生图片粘贴、分层证据记忆与缓存、意图驱动的工具选择。

16小时前视觉、语音与多模态MIT
G

dsh-tool-vision

gloryxpnv/dsh-tool-vision

本地优先的结构化视觉插件:图片交给本地 OpenAI 兼容 VLM,返回 JSON 证据(摘要、逐字 OCR、版面区域、实体/关系、配色、显式不确定项),带反幻觉回退与可选粘贴/上传桥;零云端成本,图片不出本机。

13天前视觉、语音与多模态MIT
E

dsh-plugin-mm-vision

elohia/dsh-plugin-mm-vision

通感编码器(Synesthesia Encoder):调用视觉模型把图片翻译成紧凑的结构化空间文字(画布/元素/百分比坐标),让纯文本 LLM 获得像素级看图能力(`mm_vision` 工具)。

15天前视觉、语音与多模态MIT
C

dsh-deepseek-vision

cheng-cheng9669/dsh-deepseek-vision

复用 DeepSeek 网页端识图模式给纯文本模型补上看图能力:deepseek_vision 工具调用本地 deepseek-vision-cli 浏览器自动化(手动登录助手、自动开启深度思考、用后自动关窗),把图片描述以文字返回给模型。

1前天视觉、语音与多模态MIT
5

dsh-youreyes

54xkeee/dsh-youreyes

纯文本 DeepSeek 的识图工具包:模型可主动调用的 `vision` 工具、deepseek/opencode-go 包装适配器(v4 flash/pro)、反重力额度(默认,flash/pro)/ 任意 OpenAI 兼容 VLM / Gemini / 本地 Ollama 通道、证据记忆与会话压缩恢复、内容哈希缓存、双语客户端面板。

114小时前视觉、语音与多模态MIT
3

dsh-vision (vision-tool)

314857493/dsh-vision

给 DeepSeek Harness 的纯文本模型补上免费识图:`vision` 工具直连智谱 GLM 视觉 API 描述/OCR 图片文件(glm-4v-flash 降级链),无需任何外部 CLI。

1前天视觉、语音与多模态MIT
3

dsh-vision (vision-route)

314857493/dsh-vision

注册 `deepseek-vision` 路由:Web GUI 直接粘贴图片,由免费智谱 GLM 视觉模型转译为文字后,再交给 DeepSeek 适配器作答。

1前天视觉、语音与多模态MIT
1

dsh-vision-fallback

1helloman1/dsh-vision-fallback

将聊天图片交给固定的 OpenAI 兼容视觉模型,把事实性观察交给当前主模型,并在事件回放、上下文压缩和重启时复用会话内观察。

113小时前视觉、语音与多模态MIT
Z

dsh-voice

zhuiyueya/dsh-voice

Voice for DeepSeek Harness(dsh) — speech-to-text input + read-aloud TTS for text-only DeepSeek, zero API key.

15天前视觉、语音与多模态MIT
S

multimodal-bridge

spirit4471/multimodal-bridge

DeepSeek Harness plugin bundle: qwen_vision (Qwen-VL image understanding) and qwen_generate (Qwen-Image text-to-image) tools for text-only models

15天前视觉、语音与多模态MIT
P

dsh-yali-image-generator

pptt121212/dsh-yali-image-generator

DeepSeek-Harness 图像生成插件。申请 Yali AI API Key:https://api.yaliai.com/

15天前视觉、语音与多模态MIT
C

deepsee

chang416/deepsee

DeepSee: DeepSeek Harness vision, multi-model routing, and Gemini visual self-checks before delivery

14天前视觉、语音与多模态MIT
A

dsh-voice-webspeech

anweat/dsh-voice-webspeech

浏览器 Web Speech API 语音输入:零服务端、零密钥、零模型下载(Edge=Azure 语音、Chrome=Google 语音)。

15天前视觉、语音与多模态MIT
J

dsh-voice

jesse-njx/dsh-voice

语音输入、语音输出:把口述音频转写为用户消息(transcribe),让 agent 朗读回复(speak),本地优先,音频存于 ~/.dsh/voice。

15天前视觉、语音与多模态MIT
T

dsh-voice-live

tangzheng202202/dsh-voice-live

基于火山流式 ASR/TTS 的实时双工语音:回复朗读、打断、唤醒词、实时字幕、30 个中文音色与先响应后思考;在 DSH monorepo 内构建。

0前天视觉、语音与多模态MIT
N

dsh-voice-input

newdanew/dsh-voice-input

Web UI 语音输入:输入框一键麦克风按钮,基于 Web Speech API 语音转文字填入草稿,可选识别后自动发送。

04天前视觉、语音与多模态MIT
M

dsh-fish-tts

mari23333/dsh-fish-tts

朗读助手回复(仅支持 Fish Audio API,需自备 Key):逐条朗读、自动朗读开关,设置页可配模型、音色 reference_id、加密 API Key 与代理。

0昨天视觉、语音与多模态MIT
H

dsh-voice

haoku123/dsh-voice

Web UI 全双工语音对话:输入框麦克风(RMS 端点检测)配合浏览器本地 whisper 转写,回复按句流式朗读,开口说话即打断播放与正在运行的回合(真 barge-in),无需 API key。

0前天视觉、语音与多模态MIT