视觉、语音与多模态
视觉、语音与多模态类插件让 DeepSeek-Harness(dsh)里纯文本的 DeepSeek 模型也能"看图""听声""开口"。包含把粘贴的截图交给智谱 GLM、Gemini、豆包或本地 Ollama 做 OCR 与图像描述的 vision 工具和供应商路由、基于浏览器 Web Speech API 或 Whisper 兼容接口的麦克风语音输入、使用 Edge TTS 或自定义音色的朗读回复与全双工语音模式,以及图片、视频、音乐生成工具。
共 86 个插件
dsh-plugins (dsh-vision)
tzhr-invest/dsh-plugins
Agent 可调用的视觉工具:通过你配置的任意 OpenAI 兼容视觉端点描述本地图片,支持多模型交叉核对,不内置任何密钥。
dsh-screenshot
paicat1/dsh-screenshot
DeepSeek Harness (dsh) 的独立截图工具。浏览器快捷键一键截图,并提供面向智能体的截图加读取能力,让智能体能看到并分析任意屏幕区域。
dsh-auto-vision
normanfxxkingrockwell/dsh-auto-vision
为纯文本 DeepSeek Harness 主模型搭视觉桥:自动从已配置模型中挑选多模态模型,通过 vision 工具把图片描述以纯文本返回。
dsh-koboldcpp-hands
microherox/dsh-koboldcpp-hands
给在线模型装上本地双手:koboldcpp_run 与 koboldcpp_vision 工具把重复的文本与视觉(OCR、图像分析、对比)劳动交给本地 KoboldCpp(llama.cpp)服务器,并按需拉起与管理服务器生命周期。
dsh-plugin-grok2api-media-tool
lsjspl/dsh-plugin-grok2api-media-tool
让 dsh 通过 grok2api 的 API 获得生成图片与视频能力。
dsh-eyes
leeminjing/dsh-eyes
为纯文本 DeepSeek 模型提供按需视觉:上传图片后,模型通过 view_image 工具调用任意 OpenAI 兼容视觉端点(默认 Qwen/DashScope)。
dsh-mindseye
kanchengw/dsh-mindseye
为纯文本 DeepSeek Harness 模型提供视觉能力:原生图片粘贴、分层证据记忆与缓存、意图驱动的工具选择。
dsh-tool-vision
gloryxpnv/dsh-tool-vision
本地优先的结构化视觉插件:图片交给本地 OpenAI 兼容 VLM,返回 JSON 证据(摘要、逐字 OCR、版面区域、实体/关系、配色、显式不确定项),带反幻觉回退与可选粘贴/上传桥;零云端成本,图片不出本机。
dsh-plugin-mm-vision
elohia/dsh-plugin-mm-vision
通感编码器(Synesthesia Encoder):调用视觉模型把图片翻译成紧凑的结构化空间文字(画布/元素/百分比坐标),让纯文本 LLM 获得像素级看图能力(`mm_vision` 工具)。
dsh-deepseek-vision
cheng-cheng9669/dsh-deepseek-vision
复用 DeepSeek 网页端识图模式给纯文本模型补上看图能力:deepseek_vision 工具调用本地 deepseek-vision-cli 浏览器自动化(手动登录助手、自动开启深度思考、用后自动关窗),把图片描述以文字返回给模型。
dsh-youreyes
54xkeee/dsh-youreyes
纯文本 DeepSeek 的识图工具包:模型可主动调用的 `vision` 工具、deepseek/opencode-go 包装适配器(v4 flash/pro)、反重力额度(默认,flash/pro)/ 任意 OpenAI 兼容 VLM / Gemini / 本地 Ollama 通道、证据记忆与会话压缩恢复、内容哈希缓存、双语客户端面板。
dsh-vision (vision-tool)
314857493/dsh-vision
给 DeepSeek Harness 的纯文本模型补上免费识图:`vision` 工具直连智谱 GLM 视觉 API 描述/OCR 图片文件(glm-4v-flash 降级链),无需任何外部 CLI。
dsh-vision (vision-route)
314857493/dsh-vision
注册 `deepseek-vision` 路由:Web GUI 直接粘贴图片,由免费智谱 GLM 视觉模型转译为文字后,再交给 DeepSeek 适配器作答。
dsh-vision-fallback
1helloman1/dsh-vision-fallback
将聊天图片交给固定的 OpenAI 兼容视觉模型,把事实性观察交给当前主模型,并在事件回放、上下文压缩和重启时复用会话内观察。
dsh-voice
zhuiyueya/dsh-voice
Voice for DeepSeek Harness(dsh) — speech-to-text input + read-aloud TTS for text-only DeepSeek, zero API key.
multimodal-bridge
spirit4471/multimodal-bridge
DeepSeek Harness plugin bundle: qwen_vision (Qwen-VL image understanding) and qwen_generate (Qwen-Image text-to-image) tools for text-only models
dsh-yali-image-generator
pptt121212/dsh-yali-image-generator
DeepSeek-Harness 图像生成插件。申请 Yali AI API Key:https://api.yaliai.com/
deepsee
chang416/deepsee
DeepSee: DeepSeek Harness vision, multi-model routing, and Gemini visual self-checks before delivery
dsh-voice-webspeech
anweat/dsh-voice-webspeech
浏览器 Web Speech API 语音输入:零服务端、零密钥、零模型下载(Edge=Azure 语音、Chrome=Google 语音)。
dsh-voice
jesse-njx/dsh-voice
语音输入、语音输出:把口述音频转写为用户消息(transcribe),让 agent 朗读回复(speak),本地优先,音频存于 ~/.dsh/voice。
dsh-voice-live
tangzheng202202/dsh-voice-live
基于火山流式 ASR/TTS 的实时双工语音:回复朗读、打断、唤醒词、实时字幕、30 个中文音色与先响应后思考;在 DSH monorepo 内构建。
dsh-voice-input
newdanew/dsh-voice-input
Web UI 语音输入:输入框一键麦克风按钮,基于 Web Speech API 语音转文字填入草稿,可选识别后自动发送。
dsh-fish-tts
mari23333/dsh-fish-tts
朗读助手回复(仅支持 Fish Audio API,需自备 Key):逐条朗读、自动朗读开关,设置页可配模型、音色 reference_id、加密 API Key 与代理。
dsh-voice
haoku123/dsh-voice
Web UI 全双工语音对话:输入框麦克风(RMS 端点检测)配合浏览器本地 whisper 转写,回复按句流式朗读,开口说话即打断播放与正在运行的回合(真 barge-in),无需 API key。