插件
浏览、筛选并安装 DeepSeek-Harness 插件。
共 30 个插件
dsh-prompt-enhancer
fishsb/dsh-prompt-enhancer
一键提示词增强(5 模式·记忆链·模型链)+ 语音识别(云端 Qwen3-ASR / 本地 SenseVoice 离线,说完自动停),附服务异常一键重启。
dsh-voice-scribe
pensivefei/dsh-voice-scribe
面向 Web UI 的语音输入插件:点按 Alt(或 Alt+空格)开始/停止听写,支持浏览器内置 Web Speech(零配置)或 OpenAI 兼容云端 ASR,可选经 DSH 已配置模型润色,带设置页。
dsh-ears
wiziscool/dsh-ears
面向 DeepSeek Harness (dsh) 的语音输入插件:输入框的麦克风按钮把语音转成草稿文本,支持多种语音识别后端,可选经 dsh 自有 LLM 路由润色,并带原生设置页。
dsh-voice-mode (dsh-voice-mode)
qishuilalala/dsh-voice-mode
DeepSeek Harness Web UI 全双工语音对话:按钮或 Ctrl+Shift+V 进入,持续聆听(停顿自动发送)或按住说话,zipformer2 流式识别入可编辑草稿、可选唤醒词;回复按句 Edge TTS 朗读并显示实时字幕,开口即打断播放与回合(真 barge-in);识别模型本地推理、Edge TTS 在线合成,无需 API Key。
dsh-video-lens
dundunhan/dsh-video-lens
为纯文本 DeepSeek Harness Agent 提供视频理解:场景感知抽帧、VLM 与可选 ASR 转录融合为时间线证据。
dsh-voice-ai-girlfriend-plugin
beiyege-01/dsh-voice-ai-girlfriend-plugin
Web UI 语音 AI 女友:FunASR 麦克风语音输入、Qwen3-TTS 语音回复、数字人动画窗、QQ 双向聊天(文本/语音/图片推送,经 NapCat)。
dsh-bilibili
czx2244/dsh-bilibili
B站视频分析工具:提取元数据、字幕文稿(必剪/本地 ASR 兜底)、评论与弹幕,抓取清晰关键帧并可选本地视觉描述。
dsh-video-understand
ilps2/dsh-video-understand
低成本视频理解工具:video_understand 把 B站链接/BV号/本地视频转成 AVIS 信息层(ASR+场景结构+对象轨迹+YOLO 标签)并输出摘要+问答。问题驱动动态路由分层(L0 ASR / L1 对象轨迹 / L2 关键帧 VLM)、语义层复用(重复提问直接查层)、单次问题预算上限。Python 引擎:核心层需 faster-whisper / opencv / yt-dlp(约 200-300MB);可选语义层另需约 2GB 的 torch / transformers / ultralytics。内置 doctor --fix 一键建 venv 并装齐两者。
dsh-voice
stardustlc666/dsh-voice
语音五工具:edge-tts 免费微软神经语音合成、OpenAI 兼容 ASR 转写、音色清单、批量音色试听与健康自检。
dsh-voice
haoku123/dsh-voice
Web UI 全双工语音对话:点按切换或按住说话(发送键或 `Ctrl`)并显示实时字幕,宿主端 SenseVoice(sherpa-onnx)转写,回复按句流式朗读,开口说话即打断播放与正在运行的回合(真 barge-in),无需 API key。
dsh-hold-to-talk
wangzhanchao883/dsh-hold-to-talk
输入框上的单手、免键盘输入:鼠标在输入框按住、说话、松手,文字直接进草稿;上滑取消,不留半句。不用去瞄麦克风按钮,也不用记快捷键,手始终不用离开输入区——另一只手正忙的时候,这一点才是关键。识别完全在本机完成(SenseVoice + sherpa-onnx),无需 API key,音频不出本机。
voco-input-sh
nothree-code/voco-input-sh
Web UI 语音输入:输入框麦克风按钮驱动本地 VocoType 离线识别,识别结果自动插入输入框(自动部署/防重复/持续输入)。
dsh-voice-call
biliye/dsh-voice-call
DSH Web GUI 的个人语音通话助手:可拖拽悬浮球通话面板、浏览器端 VAD(停顿自动发送)、FunASR HTTP 或流式语音识别、MiniMax / OpenAI 兼容 TTS 语音回复、可开关的唤醒词模式(沉默自动休眠),以及把任务分发给独立子代理会话并跟踪进度、停止与完成播报。
muxiva-dsh-voice
piyotahu/muxiva-dsh-voice
由 Muxiva 编排的 DeepSeek Harness 本地优先全双工语音:麦克风、VAD、ASR、句子调度、TTS、播放与打断链路全部在 Mac 本机运行
dsh-voice-call
pandapolo/dsh-voice-call
agent 主动打来的语音电话:`offer_call` 向人类振铃(接听/拒接/稍后再说),接听后由本地 CrispASR + Qwen3-TTS 合成并播放(9 个音色,含 2 个中文方言);拒接则把决定返回给 agent。
dsh-wsl-media
173787247/dsh-wsl-media
本地媒体/文档管线:ffprobe、抽音轨、缩略图、PDF、ASR、pandoc、OCR、exif(allowRoots 含 IM inbox)。
dsh-wsl-im
173787247/dsh-wsl-im
把飞书、企微、钉钉、QQ、Slack、Discord、Telegram、Mattermost 桥进 dsh agent(出站长连接/长轮询/Webhook),提供 im_status、可选本机 Whisper ASR、QQ/钉钉/TG/MM 纯文本出站,以及环境变量白名单(DSH_IM_*_ALLOWED_USER_IDS)。allowedUserIds 为空即任何人都能驱动 agent——对外暴露前请先设白名单。
dsh-minimax-asr
moluyao/dsh-minimax-asr
MiniMax 语音识别(asr-1.0)+ 语音合成(speech-2.8-hd)的 DeepSeek Harness 全局插件:转写工具、任务结束后用喇叭念一句的播报、实时免手对话、303 个音色可选
dsh-funasr-voice
fenglin-ai/dsh-funasr-voice
DSH Web 本地离线语音输入:麦克风经本地 FunASR(SenseVoiceSmall)识别后填入输入框,支持一键安装,全程离线。
dsh-voice-input-cn
schumchanvi/dsh-voice-input-cn
国内可用的输入框语音输入。需要先启动本地 Python bridge(pip install dashscope websockets,运行 bridge/voice-bridge.py)——只装插件不可用。浏览器麦克风采集 16kHz PCM 流式转发给 bridge,由阿里云 DashScope ASR(paraformer-realtime-v2)识别;识别文字在光标处实时填入草稿,静音自动停止,可选识别后自动发送。
dsh-audio-copilot
ai-yucheng/dsh-audio-copilot
为 DSH 提供 ASR 音频转写和 TTS 语音合成,让纯文本 Agent 能听能说;支持 Windows SAPI 与 OpenAI 兼容端点。
dsh-asr-voice
bittersmilezzz/dsh-asr-voice
开口即成文 · Speak-to-prompt for DeepSeek Harness:云端 ASR 语音识别 + 提示词优化 + 填入草稿/自动发送,跨平台 macOS / Windows。
dsh-voice-input
rio-promax/dsh-voice-input
DSH voice input plugin: browser realtime + VAD dictation + local/cloud ASR + DeepSeek AI polish
dsh-voice-input-qwen-asr
jsoncode/dsh-voice-input-qwen-asr
Voice input plugin (dual-face): mic button beside the composer send action, live recording bubble streaming PCM to a local Qwen3-ASR python service managed by the host, plus an ASR environment settings page (clone runtime/model repos, create venv, run ser