Plugins
Durchsuche, filtere und installiere DeepSeek-Harness-Plugins.
30 Plugins gefunden
dsh-prompt-enhancer
fishsb/dsh-prompt-enhancer
Ein-Klick-Prompt-Verbesserung (5 Modi, Memory-Chain, Multi-Modell-Fallback) plus Spracherkennung (Cloud Qwen3-ASR / Offline SenseVoice, automatischer Stopp bei Stille) für den Composer, mit Ein-Klick-Neustart des DSH-Dienstes.
dsh-voice-scribe
pensivefei/dsh-voice-scribe
Spracheingabe für die Web-UI: Alt (oder Alt+Space) drücken, um das Diktat zu starten/stoppen, Browser Web Speech (Zero-Config) oder OpenAI-kompatible Cloud-ASR, optionale Politur durch das DSH-konfigurierte LLM, Einstellungs-UI.
dsh-ears
wiziscool/dsh-ears
Spracheingabe-Plugin für DeepSeek Harness (dsh): Eine Mikrofon-Schaltfläche im Composer wandelt Sprache in einen Entwurfstranskript um, mit wählbaren Spracherkennungs-Backends, optionaler Nachbearbeitung über die eigenen LLM-Routen von dsh und einer nativen Einstellungsseite.
dsh-voice-mode (dsh-voice-mode)
qishuilalala/dsh-voice-mode
Vollduplex-Sprachmodus für die DeepSeek Harness Web-UI: Toggle (2-Sekunden-Pause Auto-Send) oder Hold-to-Talk-Diktat in einen editierbaren Entwurf mit zipformer2-Streaming-ASR, optionalem Wake Word; Edge-TTS-Vorlesen Satz für Satz mit Live-Untertiteln, und Sprechen unterbricht Wiedergabe und laufenden Turn (echtes Barge-in). On-Device-ASR, kein API-Schlüssel.
dsh-video-lens
dundunhan/dsh-video-lens
Gibt reinen Text-DeepSeek-Harness-Agenten Videoverständnis: szenenbewusste Frame-Abtastung + VLM + optionale ASR-Transkription, zu Zeitleistenbeweisen fusioniert. / Video-Verständnis-Plugin für reine Textmodelle (szenenbewusste Frame-Extraktion + VLM + optionale Spracherkennung).
dsh-voice-ai-girlfriend-plugin
beiyege-01/dsh-voice-ai-girlfriend-plugin
Sprach-IA-Freundin für die Web-UI: FunASR-Mikrofoneingabe, Qwen3-TTS gesprochene Antworten, Animationsfenster für den Begleiter und Zwei-Wege-QQ-Chat (Text/Sprache/Bild-Push) via NapCat.
dsh-bilibili
czx2244/dsh-bilibili
Bilibili-Video-Analyse: Metadaten, Transkript (ASR-Fallback über Bijian/sherpa-onnx/whisper.cpp), Kommentare, Danmaku und scharfe Keyframes mit optionalen lokalen Vision-Beschreibungen.
dsh-video-understand
ilps2/dsh-video-understand
Kostengünstiges Video-Verständnis-Tool: Ein video_understand-Tool wandelt einen Bilibili-Link / BV / ein lokales Video in eine AVIS-Informationsschicht (ASR + Szenenstruktur + Objekt-Tracking + YOLO-Labels) um und liefert Zusammenfassung + Q&A. Fragegesteuertes dynamisches Routing über Ebenen hinweg (L0 ASR / L1 Objekt-Tracking / L2 Keyframe-VLM), Wiederverwendung der semantischen Schicht für Wiederholungsfragen, Budgetobergrenze pro Frage. Python-Engine: Die Kernschicht benötigt faster-whisper / opencv / yt-dlp (~200-300MB); die optionale semantische Schicht fügt ~2GB torch / transformers / ultralytics hinzu. Ein mitgeliefertes doctor --fix richtet das venv ein und installiert beide.
dsh-voice
stardustlc666/dsh-voice
Sprachwerkzeuge: kostenlose neuronale Sprachsynthese mit edge-tts, OpenAI-kompatible ASR-Transkription, Stimmliste, Massenvorschau der Stimmen und Integritäts-Selbstprüfung.
dsh-voice
haoku123/dsh-voice
Full-Duplex-Sprachmodus für die Web-UI: Tippen zum Umschalten oder Halten zum Sprechen zum Diktieren (Senden-Taste oder `Ctrl`) mit Live-Untertiteln, hostseitige SenseVoice-ASR über sherpa-onnx, satzweise gesprochene Antworten und Sprechen unterbricht die Wiedergabe und den laufenden Zug (echtes Hineinreden). Kein API-Schlüssel erforderlich.
dsh-hold-to-talk
wangzhanchao883/dsh-hold-to-talk
Einhändige Eingabe ohne Tastatur für das Eingabefeld: Maustaste im Eingabefeld gedrückt halten, sprechen, loslassen – der Text landet im Entwurf, und Hochschieben bricht ab, ohne einen halben Satz zu hinterlassen. Kein Mikrofonknopf zum Anvisieren und kein Kurzbefehl zum Merken; die Hand muss den Eingabebereich nie verlassen, was gerade dann zählt, wenn die andere Hand beschäftigt ist. Die Erkennung läuft vollständig offline (SenseVoice über sherpa-onnx, kein API-Schlüssel, Audio verlässt nie den Rechner).
voco-input-sh
nothree-code/voco-input-sh
Spracheingabe für die Web UI: eine Mikrofonschaltfläche, die die lokale Offline-Spracherkennung von VocoType steuert und erkannten Text automatisch in den Editor einfügt (Auto-Deploy, Deduplizierung, kontinuierliche Diktation).
dsh-voice-call
biliye/dsh-voice-call
Sprachanruf-Assistent für die DSH-Web-GUI: eine ziehbare schwebende Anrufkugel, Browser-seitiges VAD, das jede Äußerung nach einer Pause sendet, FunASR-HTTP- oder Streaming-Spracherkennung, TTS-Antworten von MiniMax oder OpenAI-kompatibel, ein optionaler Wake-Word-Modus mit Auto-Schlaf und Aufgabenverteilung an separate Subagenten-Sitzungen mit Fortschritt, Stopp und gesprochenen Abschlussberichten.
muxiva-dsh-voice
piyotahu/muxiva-dsh-voice
Local-first-Vollduplex-Sprache für DeepSeek Harness, orchestriert von Muxiva
dsh-voice-call
pandapolo/dsh-voice-call
Vom Agenten initiierte Sprachanrufe: `offer_call` lässt beim Menschen klingeln (接听/拒接/稍后再说); angenommene Anrufe werden lokal mit CrispASR + Qwen3-TTS (9 Sprecher, 2 chinesische Dialekte) synthetisiert und abgespielt, abgelehnte Anrufe geben die Entscheidung an den Agenten zurück.
dsh-wsl-media
173787247/dsh-wsl-media
Local media/doc pipeline: ffprobe, extract, thumbnail, PDF, ASR, pandoc, OCR, exif (allowRoots include IM inbox).
dsh-wsl-im
173787247/dsh-wsl-im
Bridges Feishu, WeCom, DingTalk, QQ, Slack, Discord, Telegram and Mattermost into dsh agents (outbound WS/Stream/Gateway/long-poll/webhook), with im_status, optional local Whisper ASR, plain-text outbound for QQ/DingTalk/Telegram/Mattermost, and env CSV allowlists (DSH_IM_*_ALLOWED_USER_IDS). Empty allowedUserIds means EVERYONE can drive your agent — set a whitelist before exposing a bot.
dsh-minimax-asr
moluyao/dsh-minimax-asr
MiniMax 语音识别(asr-1.0)+ 语音合成(speech-2.8-hd)的 DeepSeek Harness 全局插件:转写工具、任务结束后用喇叭念一句的播报、实时免手对话、303 个音色可选
dsh-funasr-voice
fenglin-ai/dsh-funasr-voice
Offline voice input for the DSH Web UI: mic to local FunASR (SenseVoiceSmall), one-click install, no cloud.
dsh-voice-input-cn
schumchanvi/dsh-voice-input-cn
China-bereite Spracheingabe für den Composer. Erfordert eine lokale Python-Brücke (pip install dashscope websockets, bridge/voice-bridge.py ausführen) — das Plugin allein funktioniert nicht. Das Browser-Mikrofon streamt 16-kHz-PCM an die Brücke, die Alibaba Cloud DashScope ASR (paraformer-realtime-v2) ausführt; Zwischentext füllt den Entwurf am Cursor, Stille Auto-Stopp, optionaler Auto-Send.
dsh-audio-copilot
ai-yucheng/dsh-audio-copilot
Audio Copilot for DeepSeek Harness: transcribe audio (ASR) and synthesize speech (TTS) — gives text-only agents ears and a voice. Windows-local SAPI TTS out of the box; OpenAI-compatible ASR/TTS endpoints configurable. Includes an in-composer voice-input
dsh-asr-voice
bittersmilezzz/dsh-asr-voice
开口即成文 · Speak-to-prompt for DeepSeek Harness:云端 ASR 语音识别 + 提示词优化 + 填入草稿/自动发送,跨平台 macOS / Windows。
dsh-voice-input
rio-promax/dsh-voice-input
DSH voice input plugin: browser realtime + VAD dictation + local/cloud ASR + DeepSeek AI polish
dsh-voice-input-qwen-asr
jsoncode/dsh-voice-input-qwen-asr
Voice input plugin (dual-face): mic button beside the composer send action, live recording bubble streaming PCM to a local Qwen3-ASR python service managed by the host, plus an ASR environment settings page (clone runtime/model repos, create venv, run ser