跳过主要内容

插件

浏览、筛选并安装 DeepSeek-Harness 插件。

共 18 个插件

F

dsh-vision-proxy

flyvhidbwo/dsh-vision-proxy

DeepSeek 大脑 + 自动识图:GUI 附加的每张图片自动经官方 deepseek-v4-flash-vision-exp 原生识图转译,再交给纯文本的 DeepSeek 作答(纯文本 V4-Pro 也能看图);支持任意 OpenAI 兼容 VLM 与本地 Ollama 作为备选。

16上个月视觉、语音与多模态MIT
R

dsh-plugin-call-me

radres/dsh-plugin-call-me

通过 CallKit 打电话到你的手机:`call_me` 与 `text_me` 工具,并可在回合结束或等待审批时来电,语音回答转写后送回会话。

7前天集成与远程MIT
S

dsh-voice-assistant

supersyh-sss/dsh-voice-assistant

dsh web 语音助手:说出唤醒词(如「小鲸」)即可免手听写,说话内容自动转成文字填入输入框;支持口述编辑指令(发送、清空、换行、停止朗读),并可用中文朗读 AI 回复。语音识别基于 sherpa-onnx WASM 在浏览器本地运行,离线可用、无需 API Key。

3上个月视觉、语音与多模态MIT
B

dsh-stt-input

baisama-cloud/dsh-stt-input

Web UI 语音输入:输入框旁麦克风按钮语音转文字填入输入框;支持浏览器 Web Speech API 本地识别(零配置、无需密钥)与 OpenAI 兼容 Whisper API(OpenAI/Groq),模型与语言可在设置中选择。

3上个月视觉、语音与多模态MIT
J

dsh-voice

jesse-njx/dsh-voice

语音输入、语音输出:把口述音频转写为用户消息(transcribe),让 agent 朗读回复(speak),本地优先,音频存于 ~/.dsh/voice。

32个月前视觉、语音与多模态MIT
B

dsh-vision-plugin

bug-huntter/dsh-vision-plugin

为纯文本 DSH 模型增加可配置识图能力:开启后图片消息先由任意 OpenAI 兼容视觉模型转写为文字描述,再交给主模型处理;设置页可配置 Base URL、Model ID 与密钥,并可选择密钥的鉴权方式(OpenAI / Anthropic / Gemini / Azure 风格请求头);未填写密钥时会在发起请求前明确提示。

27天前视觉、语音与多模态MIT
K

dsh-vision-recognizer

kaixinbaba/dsh-vision-recognizer

视觉模型路由:把附加图片经可配置模型(15+ OpenAI 兼容与 Anthropic 供应商)转译为文字,对话仍由 DeepSeek 作答。

22个月前视觉、语音与多模态MIT
3

dsh-vision (vision-route)

314857493/dsh-vision

注册 `deepseek-vision` 路由:Web GUI 直接粘贴图片,由免费智谱 GLM 视觉模型转译为文字后,再交给 DeepSeek 适配器作答。

2上个月视觉、语音与多模态MIT
X

dsh-vision-bridge

ximengxiaolan/dsh-vision-bridge

输入框贴图自动识别:由 OpenAI 兼容视觉模型转成文字描述后,再交给纯文本 DeepSeek 模型处理。

22个月前视觉、语音与多模态MIT
J

dsh-mmroute

jmxsxwyzjdwl/dsh-mmroute

纯文本模型的透明多模态路由:每一次模型调用里的每张图片先由你自己配置的多模态理解模型全量转述(逐字 OCR、数据、不确定区、防注入),vision_relook 定点复看,图片类报错自动转述重试。不内置端点、不借登录态。

128天前视觉、语音与多模态MIT
A

dsh-audio-copilot

ai-yucheng/dsh-audio-copilot

为 DSH 提供 ASR 音频转写和 TTS 语音合成,让纯文本 Agent 能听能说;支持 Windows SAPI 与 OpenAI 兼容端点。

12个月前视觉、语音与多模态MIT
3

dsh-vision

314857493/dsh-vision

DeepSeek Harness 视觉插件:声明图像输入的 deepseek-vision 路由,先用免费智谱 GLM 视觉模型转写粘贴图片再交给 DeepSeek 适配器。

12个月前视觉、语音与多模态MIT
C

dsh-voice-mimo

ch1bug/dsh-voice-mimo

Xiaomi MiMo-powered voice for DeepSeek Harness: browser 🎤/🧠/🔊 UI, voice_transcribe/voice_understand/voice_speak tools, configurable voice map (preset/voicedesign/voiceclone). Fork of zhuiyueya/dsh-voice (MIT), Settings pattern from Anionex/dsh-vision-toolkit (MIT).

021天前视觉、语音与多模态MIT
M

dsh-voice-input-en

mohith-das/dsh-voice-input-en

Minimal English-only voice input for the DeepSeek Harness Web UI: a mic button in the composer that transcribes speech into the draft via the browser's native SpeechRecognition API. No dependencies, no subprocess, no network calls beyond whatever the brow

0上个月视觉、语音与多模态MIT
S

dsh-vision-pro-bridge

shainedemo/dsh-vision-pro-bridge

视觉桥:贴图先经 deepseek-v4-flash-vision-exp 转写为文字,再交给纯文本的 deepseek-v4-pro 回答,零第三方依赖。

0上个月视觉、语音与多模态MIT
J

dsh-autovision

junkrat9527/dsh-autovision

纯文本 dsh 模型的识图插件:粘贴图片自动由你配置的多模态模型转成文字——透明孪生路由、模型可自主调用识图工具、无内置密钥与中转。

02个月前视觉、语音与多模态MIT
N

dsh-voice-input

newdanew/dsh-voice-input

Web UI 语音输入:输入框一键麦克风按钮,基于 Web Speech API 语音转文字填入草稿,可选识别后自动发送。

02个月前视觉、语音与多模态MIT
E

dsh-plugin-image-input

elohia/dsh-plugin-image-input

图片转文字输入插件:粘贴/拖拽图片自动转为结构化文字描述发送,给纯文本 LLM 提供图片输入接管(OpenAI 兼容视觉 API)。

02个月前视觉、语音与多模态MIT