跳过主要内容

插件

浏览、筛选并安装 DeepSeek-Harness 插件。

共 29 个插件

O

watch-skill

oxbshw/watch-skill

把视频、音频与屏幕活动转成带时间戳的可检索证据(DeepWatch)。

37815天前视觉、语音与多模态MIT
P

dsh-voice-scribe

pensivefei/dsh-voice-scribe

面向 Web UI 的语音输入插件:点按 Alt(或 Alt+空格)开始/停止听写,支持浏览器内置 Web Speech(零配置)或 OpenAI 兼容云端 ASR,可选经 DSH 已配置模型润色,带设置页。

34昨天视觉、语音与多模态MIT
W

dsh-ears

wiziscool/dsh-ears

面向 DeepSeek Harness (dsh) 的语音输入插件:输入框的麦克风按钮把语音转成草稿文本,支持多种语音识别后端,可选经 dsh 自有 LLM 路由润色,并带原生设置页。

21前天视觉、语音与多模态MIT
Q

dsh-voice-mode (dsh-voice-mode)

qishuilalala/dsh-voice-mode

DeepSeek Harness Web UI 全双工语音对话:按钮或 Ctrl+Shift+V 进入,持续聆听(停顿自动发送)或按住说话,zipformer2 流式识别入可编辑草稿、可选唤醒词;回复按句 Edge TTS 朗读并显示实时字幕,开口即打断播放与回合(真 barge-in);识别模型本地推理、Edge TTS 在线合成,无需 API Key。

156天前视觉、语音与多模态MIT
P

dsh-talk

perrylink/dsh-talk

DeepSeek Harness 的语音输入输出:麦克风语音转文字与文字转语音。

155天前视觉、语音与多模态Apache-2.0
C

dsh-qq-onebot-bridge

cheesehaqi/dsh-qq-onebot-bridge

基于 OneBot v11 反向 WebSocket 的 QQ 双向桥:每群/每私聊用户独立会话、@引用语音转文字、私聊图片/动画表情识图、表情与贴纸工具。

516天前集成与远程MIT
0

dsh-voice-input

0nt-one/dsh-voice-input

输入框麦克风语音输入:浏览器 Web Speech API 实时转写(Chrome/Edge),多语言切换与可选自动发送,零依赖零密钥。

5上个月视觉、语音与多模态MIT
W

dsh-hold-to-talk

wangzhanchao883/dsh-hold-to-talk

输入框上的单手、免键盘输入:鼠标在输入框按住、说话、松手,文字直接进草稿;上滑取消,不留半句。不用去瞄麦克风按钮,也不用记快捷键,手始终不用离开输入区——另一只手正忙的时候,这一点才是关键。识别完全在本机完成(SenseVoice + sherpa-onnx),无需 API key,音频不出本机。

35天前视觉、语音与多模态MIT
N

voco-input-sh

nothree-code/voco-input-sh

Web UI 语音输入:输入框麦克风按钮驱动本地 VocoType 离线识别,识别结果自动插入输入框(自动部署/防重复/持续输入)。

317天前视觉、语音与多模态MIT
B

dsh-stt-input

baisama-cloud/dsh-stt-input

Web UI 语音输入:输入框旁麦克风按钮语音转文字填入输入框;支持浏览器 Web Speech API 本地识别(零配置、无需密钥)与 OpenAI 兼容 Whisper API(OpenAI/Groq),模型与语言可在设置中选择。

3上个月视觉、语音与多模态MIT
J

dsh-voice

jesse-njx/dsh-voice

语音输入、语音输出:把口述音频转写为用户消息(transcribe),让 agent 朗读回复(speak),本地优先,音频存于 ~/.dsh/voice。

32个月前视觉、语音与多模态MIT
P

dsh-voice-call

pandapolo/dsh-voice-call

agent 主动打来的语音电话:`offer_call` 向人类振铃(接听/拒接/稍后再说),接听后由本地 CrispASR + Qwen3-TTS 合成并播放(9 个音色,含 2 个中文方言);拒接则把决定返回给 agent。

2前天视觉、语音与多模态MIT
V

dsh-live-voice

victorwads/dsh-live-voice

本地优先的 DSH 语音对话:本地语音识别与合成、可选外部供应商,支持连续对话与自动朗读

115天前视觉、语音与多模态GPL-3.0
N

dsh-dictate

navneetset/dsh-dictate

通过 OpenRouter 的 STT 接口把实时语音转写进 dsh Web 输入框,边说边插入文字,可与键盘输入混用

125天前视觉、语音与多模态MIT
M

dsh-minimax-asr

moluyao/dsh-minimax-asr

MiniMax 语音识别(asr-1.0)+ 语音合成(speech-2.8-hd)的 DeepSeek Harness 全局插件:转写工具、任务结束后用喇叭念一句的播报、实时免手对话、303 个音色可选

116天前视觉、语音与多模态MIT
J

dsh-live-voice

jstn-1g/dsh-live-voice

DSH Web 的会话绑定单轮语音预览:提供无需凭证的本地合成演示和可选的 Qwen Audio,保持精确会话隔离,并仅在明确操作后将转写写入草稿,不会自动提交。

124天前视觉、语音与多模态MIT
Z

dsh-voice

zhuiyueya/dsh-voice

Voice for DeepSeek Harness(dsh) — speech-to-text input + read-aloud TTS for text-only DeepSeek, zero API key.

12个月前视觉、语音与多模态MIT
W

dsh-voice-danmaku

weizhida/dsh-voice-danmaku

这是dsh的插件,语音发送弹幕。在玩游戏时通过语音输入在b站发弹幕,不切出游戏可以正常操作

014小时前视觉、语音与多模态MIT
Z

dsh-stt-plugin

zemanzhang809/dsh-stt-plugin

A speech-to-text (voice input) plugin for DeepSeek Harness.

012天前视觉、语音与多模态MIT
B

dsh-asr-voice

bittersmilezzz/dsh-asr-voice

开口即成文 · Speak-to-prompt for DeepSeek Harness:云端 ASR 语音识别 + 提示词优化 + 填入草稿/自动发送,跨平台 macOS / Windows。

015天前视觉、语音与多模态MIT
C

dsh-voice-mimo

ch1bug/dsh-voice-mimo

Xiaomi MiMo-powered voice for DeepSeek Harness: browser 🎤/🧠/🔊 UI, voice_transcribe/voice_understand/voice_speak tools, configurable voice map (preset/voicedesign/voiceclone). Fork of zhuiyueya/dsh-voice (MIT), Settings pattern from Anionex/dsh-vision-toolkit (MIT).

016天前视觉、语音与多模态MIT
M

dsh-voice-input-en

mohith-das/dsh-voice-input-en

Minimal English-only voice input for the DeepSeek Harness Web UI: a mic button in the composer that transcribes speech into the draft via the browser's native SpeechRecognition API. No dependencies, no subprocess, no network calls beyond whatever the brow

029天前视觉、语音与多模态MIT
K

dsh-kitt-voice

kittcat-lab/dsh-kitt-voice

Voice for the DeepSeek Harness: speak to the agent, hear it back, and see what it is doing from a floating window that stays on top of whatever you are running.

025天前视觉、语音与多模态MIT
S

dsh-voice-control

sucriss/dsh-voice-control

DSH 网页端语音控制:按住说话将语音转文字输入发送框(可自动发送),用浏览器语音合成朗读助手回复;右键麦克风打开设置面板,支持 Ctrl+M 全局快捷键。

029天前视觉、语音与多模态MIT