跳过主要内容

插件

浏览、筛选并安装 DeepSeek-Harness 插件。

共 30 个插件

F

dsh-prompt-enhancer

fishsb/dsh-prompt-enhancer

一键提示词增强(5 模式·记忆链·模型链)+ 语音识别(云端 Qwen3-ASR / 本地 SenseVoice 离线,说完自动停),附服务异常一键重启。

825天前工具与能力
P

dsh-voice-scribe

pensivefei/dsh-voice-scribe

面向 Web UI 的语音输入插件:点按 Alt(或 Alt+空格)开始/停止听写,支持浏览器内置 Web Speech(零配置)或 OpenAI 兼容云端 ASR,可选经 DSH 已配置模型润色,带设置页。

343天前视觉、语音与多模态MIT
W

dsh-ears

wiziscool/dsh-ears

面向 DeepSeek Harness (dsh) 的语音输入插件:输入框的麦克风按钮把语音转成草稿文本,支持多种语音识别后端,可选经 dsh 自有 LLM 路由润色,并带原生设置页。

2122小时前视觉、语音与多模态MIT
Q

dsh-voice-mode (dsh-voice-mode)

qishuilalala/dsh-voice-mode

DeepSeek Harness Web UI 全双工语音对话:按钮或 Ctrl+Shift+V 进入,持续聆听(停顿自动发送)或按住说话,zipformer2 流式识别入可编辑草稿、可选唤醒词;回复按句 Edge TTS 朗读并显示实时字幕,开口即打断播放与回合(真 barge-in);识别模型本地推理、Edge TTS 在线合成,无需 API Key。

157小时前视觉、语音与多模态MIT
D

dsh-video-lens

dundunhan/dsh-video-lens

为纯文本 DeepSeek Harness Agent 提供视频理解:场景感知抽帧、VLM 与可选 ASR 转录融合为时间线证据。

13上个月视觉、语音与多模态MIT
B

dsh-voice-ai-girlfriend-plugin

beiyege-01/dsh-voice-ai-girlfriend-plugin

Web UI 语音 AI 女友:FunASR 麦克风语音输入、Qwen3-TTS 语音回复、数字人动画窗、QQ 双向聊天(文本/语音/图片推送,经 NapCat)。

1219天前视觉、语音与多模态
C

dsh-bilibili

czx2244/dsh-bilibili

B站视频分析工具:提取元数据、字幕文稿(必剪/本地 ASR 兜底)、评论与弹幕,抓取清晰关键帧并可选本地视觉描述。

92个月前工具与能力MIT
I

dsh-video-understand

ilps2/dsh-video-understand

低成本视频理解工具:video_understand 把 B站链接/BV号/本地视频转成 AVIS 信息层(ASR+场景结构+对象轨迹+YOLO 标签)并输出摘要+问答。问题驱动动态路由分层(L0 ASR / L1 对象轨迹 / L2 关键帧 VLM)、语义层复用(重复提问直接查层)、单次问题预算上限。Python 引擎:核心层需 faster-whisper / opencv / yt-dlp(约 200-300MB);可选语义层另需约 2GB 的 torch / transformers / ultralytics。内置 doctor --fix 一键建 venv 并装齐两者。

8上个月工具与能力
S

dsh-voice

stardustlc666/dsh-voice

语音五工具:edge-tts 免费微软神经语音合成、OpenAI 兼容 ASR 转写、音色清单、批量音色试听与健康自检。

47小时前视觉、语音与多模态MIT
H

dsh-voice

haoku123/dsh-voice

Web UI 全双工语音对话:点按切换或按住说话(发送键或 `Ctrl`)并显示实时字幕,宿主端 SenseVoice(sherpa-onnx)转写,回复按句流式朗读,开口说话即打断播放与正在运行的回合(真 barge-in),无需 API key。

4上个月视觉、语音与多模态MIT
W

dsh-hold-to-talk

wangzhanchao883/dsh-hold-to-talk

输入框上的单手、免键盘输入:鼠标在输入框按住、说话、松手,文字直接进草稿;上滑取消,不留半句。不用去瞄麦克风按钮,也不用记快捷键,手始终不用离开输入区——另一只手正忙的时候,这一点才是关键。识别完全在本机完成(SenseVoice + sherpa-onnx),无需 API key,音频不出本机。

320小时前视觉、语音与多模态MIT
N

voco-input-sh

nothree-code/voco-input-sh

Web UI 语音输入:输入框麦克风按钮驱动本地 VocoType 离线识别,识别结果自动插入输入框(自动部署/防重复/持续输入)。

319天前视觉、语音与多模态MIT
B

dsh-voice-call

biliye/dsh-voice-call

DSH Web GUI 的个人语音通话助手:可拖拽悬浮球通话面板、浏览器端 VAD(停顿自动发送)、FunASR HTTP 或流式语音识别、MiniMax / OpenAI 兼容 TTS 语音回复、可开关的唤醒词模式(沉默自动休眠),以及把任务分发给独立子代理会话并跟踪进度、停止与完成播报。

24天前视觉、语音与多模态MIT
P

muxiva-dsh-voice

piyotahu/muxiva-dsh-voice

由 Muxiva 编排的 DeepSeek Harness 本地优先全双工语音:麦克风、VAD、ASR、句子调度、TTS、播放与打断链路全部在 Mac 本机运行

22个月前视觉、语音与多模态Apache-2.0
P

dsh-voice-call

pandapolo/dsh-voice-call

agent 主动打来的语音电话:`offer_call` 向人类振铃(接听/拒接/稍后再说),接听后由本地 CrispASR + Qwen3-TTS 合成并播放(9 个音色,含 2 个中文方言);拒接则把决定返回给 agent。

23天前视觉、语音与多模态MIT
1

dsh-wsl-media

173787247/dsh-wsl-media

本地媒体/文档管线:ffprobe、抽音轨、缩略图、PDF、ASR、pandoc、OCR、exif(allowRoots 含 IM inbox)。

13天前开发与插件工具MIT
1

dsh-wsl-im

173787247/dsh-wsl-im

把飞书、企微、钉钉、QQ、Slack、Discord、Telegram、Mattermost 桥进 dsh agent(出站长连接/长轮询/Webhook),提供 im_status、可选本机 Whisper ASR、QQ/钉钉/TG/MM 纯文本出站,以及环境变量白名单(DSH_IM_*_ALLOWED_USER_IDS)。allowedUserIds 为空即任何人都能驱动 agent——对外暴露前请先设白名单。

13天前开发与插件工具MIT
M

dsh-minimax-asr

moluyao/dsh-minimax-asr

MiniMax 语音识别(asr-1.0)+ 语音合成(speech-2.8-hd)的 DeepSeek Harness 全局插件:转写工具、任务结束后用喇叭念一句的播报、实时免手对话、303 个音色可选

119天前视觉、语音与多模态MIT
F

dsh-funasr-voice

fenglin-ai/dsh-funasr-voice

DSH Web 本地离线语音输入:麦克风经本地 FunASR(SenseVoiceSmall)识别后填入输入框,支持一键安装,全程离线。

1上个月视觉、语音与多模态MIT
S

dsh-voice-input-cn

schumchanvi/dsh-voice-input-cn

国内可用的输入框语音输入。需要先启动本地 Python bridge(pip install dashscope websockets,运行 bridge/voice-bridge.py)——只装插件不可用。浏览器麦克风采集 16kHz PCM 流式转发给 bridge,由阿里云 DashScope ASR(paraformer-realtime-v2)识别;识别文字在光标处实时填入草稿,静音自动停止,可选识别后自动发送。

115天前视觉、语音与多模态MIT
A

dsh-audio-copilot

ai-yucheng/dsh-audio-copilot

为 DSH 提供 ASR 音频转写和 TTS 语音合成,让纯文本 Agent 能听能说;支持 Windows SAPI 与 OpenAI 兼容端点。

1上个月视觉、语音与多模态MIT
B

dsh-asr-voice

bittersmilezzz/dsh-asr-voice

开口即成文 · Speak-to-prompt for DeepSeek Harness:云端 ASR 语音识别 + 提示词优化 + 填入草稿/自动发送,跨平台 macOS / Windows。

017天前视觉、语音与多模态MIT
R

dsh-voice-input

rio-promax/dsh-voice-input

DSH voice input plugin: browser realtime + VAD dictation + local/cloud ASR + DeepSeek AI polish

020天前视觉、语音与多模态MIT
J

dsh-voice-input-qwen-asr

jsoncode/dsh-voice-input-qwen-asr

Voice input plugin (dual-face): mic button beside the composer send action, live recording bubble streaming PCM to a local Qwen3-ASR python service managed by the host, plus an ASR environment settings page (clone runtime/model repos, create venv, run ser

027天前视觉、语音与多模态