Zum Hauptinhalt springen

Plugins

Durchsuche, filtere und installiere DeepSeek-Harness-Plugins.

30 Plugins gefunden

F

dsh-prompt-enhancer

fishsb/dsh-prompt-enhancer

Ein-Klick-Prompt-Verbesserung (5 Modi, Memory-Chain, Multi-Modell-Fallback) plus Spracherkennung (Cloud Qwen3-ASR / Offline SenseVoice, automatischer Stopp bei Stille) für den Composer, mit Ein-Klick-Neustart des DSH-Dienstes.

82vor 5 TagenTools & Funktionen
P

dsh-voice-scribe

pensivefei/dsh-voice-scribe

Spracheingabe für die Web-UI: Alt (oder Alt+Space) drücken, um das Diktat zu starten/stoppen, Browser Web Speech (Zero-Config) oder OpenAI-kompatible Cloud-ASR, optionale Politur durch das DSH-konfigurierte LLM, Einstellungs-UI.

34vor 3 TagenVision, Sprache & MultimodalMIT
W

dsh-ears

wiziscool/dsh-ears

Spracheingabe-Plugin für DeepSeek Harness (dsh): Eine Mikrofon-Schaltfläche im Composer wandelt Sprache in einen Entwurfstranskript um, mit wählbaren Spracherkennungs-Backends, optionaler Nachbearbeitung über die eigenen LLM-Routen von dsh und einer nativen Einstellungsseite.

21vor 21 StundenVision, Sprache & MultimodalMIT
Q

dsh-voice-mode (dsh-voice-mode)

qishuilalala/dsh-voice-mode

Vollduplex-Sprachmodus für die DeepSeek Harness Web-UI: Toggle (2-Sekunden-Pause Auto-Send) oder Hold-to-Talk-Diktat in einen editierbaren Entwurf mit zipformer2-Streaming-ASR, optionalem Wake Word; Edge-TTS-Vorlesen Satz für Satz mit Live-Untertiteln, und Sprechen unterbricht Wiedergabe und laufenden Turn (echtes Barge-in). On-Device-ASR, kein API-Schlüssel.

15vor 6 StundenVision, Sprache & MultimodalMIT
D

dsh-video-lens

dundunhan/dsh-video-lens

Gibt reinen Text-DeepSeek-Harness-Agenten Videoverständnis: szenenbewusste Frame-Abtastung + VLM + optionale ASR-Transkription, zu Zeitleistenbeweisen fusioniert. / Video-Verständnis-Plugin für reine Textmodelle (szenenbewusste Frame-Extraktion + VLM + optionale Spracherkennung).

13letzten MonatVision, Sprache & MultimodalMIT
B

dsh-voice-ai-girlfriend-plugin

beiyege-01/dsh-voice-ai-girlfriend-plugin

Sprach-IA-Freundin für die Web-UI: FunASR-Mikrofoneingabe, Qwen3-TTS gesprochene Antworten, Animationsfenster für den Begleiter und Zwei-Wege-QQ-Chat (Text/Sprache/Bild-Push) via NapCat.

12vor 19 TagenVision, Sprache & Multimodal
C

dsh-bilibili

czx2244/dsh-bilibili

Bilibili-Video-Analyse: Metadaten, Transkript (ASR-Fallback über Bijian/sherpa-onnx/whisper.cpp), Kommentare, Danmaku und scharfe Keyframes mit optionalen lokalen Vision-Beschreibungen.

9vor 2 MonatenTools & FunktionenMIT
I

dsh-video-understand

ilps2/dsh-video-understand

Kostengünstiges Video-Verständnis-Tool: Ein video_understand-Tool wandelt einen Bilibili-Link / BV / ein lokales Video in eine AVIS-Informationsschicht (ASR + Szenenstruktur + Objekt-Tracking + YOLO-Labels) um und liefert Zusammenfassung + Q&A. Fragegesteuertes dynamisches Routing über Ebenen hinweg (L0 ASR / L1 Objekt-Tracking / L2 Keyframe-VLM), Wiederverwendung der semantischen Schicht für Wiederholungsfragen, Budgetobergrenze pro Frage. Python-Engine: Die Kernschicht benötigt faster-whisper / opencv / yt-dlp (~200-300MB); die optionale semantische Schicht fügt ~2GB torch / transformers / ultralytics hinzu. Ein mitgeliefertes doctor --fix richtet das venv ein und installiert beide.

8letzten MonatTools & Funktionen
S

dsh-voice

stardustlc666/dsh-voice

Sprachwerkzeuge: kostenlose neuronale Sprachsynthese mit edge-tts, OpenAI-kompatible ASR-Transkription, Stimmliste, Massenvorschau der Stimmen und Integritäts-Selbstprüfung.

4vor 6 StundenVision, Sprache & MultimodalMIT
H

dsh-voice

haoku123/dsh-voice

Full-Duplex-Sprachmodus für die Web-UI: Tippen zum Umschalten oder Halten zum Sprechen zum Diktieren (Senden-Taste oder `Ctrl`) mit Live-Untertiteln, hostseitige SenseVoice-ASR über sherpa-onnx, satzweise gesprochene Antworten und Sprechen unterbricht die Wiedergabe und den laufenden Zug (echtes Hineinreden). Kein API-Schlüssel erforderlich.

4letzten MonatVision, Sprache & MultimodalMIT
W

dsh-hold-to-talk

wangzhanchao883/dsh-hold-to-talk

Einhändige Eingabe ohne Tastatur für das Eingabefeld: Maustaste im Eingabefeld gedrückt halten, sprechen, loslassen – der Text landet im Entwurf, und Hochschieben bricht ab, ohne einen halben Satz zu hinterlassen. Kein Mikrofonknopf zum Anvisieren und kein Kurzbefehl zum Merken; die Hand muss den Eingabebereich nie verlassen, was gerade dann zählt, wenn die andere Hand beschäftigt ist. Die Erkennung läuft vollständig offline (SenseVoice über sherpa-onnx, kein API-Schlüssel, Audio verlässt nie den Rechner).

3vor 19 StundenVision, Sprache & MultimodalMIT
N

voco-input-sh

nothree-code/voco-input-sh

Spracheingabe für die Web UI: eine Mikrofonschaltfläche, die die lokale Offline-Spracherkennung von VocoType steuert und erkannten Text automatisch in den Editor einfügt (Auto-Deploy, Deduplizierung, kontinuierliche Diktation).

3vor 19 TagenVision, Sprache & MultimodalMIT
B

dsh-voice-call

biliye/dsh-voice-call

Sprachanruf-Assistent für die DSH-Web-GUI: eine ziehbare schwebende Anrufkugel, Browser-seitiges VAD, das jede Äußerung nach einer Pause sendet, FunASR-HTTP- oder Streaming-Spracherkennung, TTS-Antworten von MiniMax oder OpenAI-kompatibel, ein optionaler Wake-Word-Modus mit Auto-Schlaf und Aufgabenverteilung an separate Subagenten-Sitzungen mit Fortschritt, Stopp und gesprochenen Abschlussberichten.

2vor 4 TagenVision, Sprache & MultimodalMIT
P

muxiva-dsh-voice

piyotahu/muxiva-dsh-voice

Local-first-Vollduplex-Sprache für DeepSeek Harness, orchestriert von Muxiva

2vor 2 MonatenVision, Sprache & MultimodalApache-2.0
P

dsh-voice-call

pandapolo/dsh-voice-call

Vom Agenten initiierte Sprachanrufe: `offer_call` lässt beim Menschen klingeln (接听/拒接/稍后再说); angenommene Anrufe werden lokal mit CrispASR + Qwen3-TTS (9 Sprecher, 2 chinesische Dialekte) synthetisiert und abgespielt, abgelehnte Anrufe geben die Entscheidung an den Agenten zurück.

2vor 3 TagenVision, Sprache & MultimodalMIT
1

dsh-wsl-media

173787247/dsh-wsl-media

Local media/doc pipeline: ffprobe, extract, thumbnail, PDF, ASR, pandoc, OCR, exif (allowRoots include IM inbox).

1vor 3 TagenEntwicklung & Plugin-ToolsMIT
1

dsh-wsl-im

173787247/dsh-wsl-im

Bridges Feishu, WeCom, DingTalk, QQ, Slack, Discord, Telegram and Mattermost into dsh agents (outbound WS/Stream/Gateway/long-poll/webhook), with im_status, optional local Whisper ASR, plain-text outbound for QQ/DingTalk/Telegram/Mattermost, and env CSV allowlists (DSH_IM_*_ALLOWED_USER_IDS). Empty allowedUserIds means EVERYONE can drive your agent — set a whitelist before exposing a bot.

1vor 3 TagenEntwicklung & Plugin-ToolsMIT
M

dsh-minimax-asr

moluyao/dsh-minimax-asr

MiniMax 语音识别(asr-1.0)+ 语音合成(speech-2.8-hd)的 DeepSeek Harness 全局插件:转写工具、任务结束后用喇叭念一句的播报、实时免手对话、303 个音色可选

1vor 19 TagenVision, Sprache & MultimodalMIT
F

dsh-funasr-voice

fenglin-ai/dsh-funasr-voice

Offline voice input for the DSH Web UI: mic to local FunASR (SenseVoiceSmall), one-click install, no cloud.

1letzten MonatVision, Sprache & MultimodalMIT
S

dsh-voice-input-cn

schumchanvi/dsh-voice-input-cn

China-bereite Spracheingabe für den Composer. Erfordert eine lokale Python-Brücke (pip install dashscope websockets, bridge/voice-bridge.py ausführen) — das Plugin allein funktioniert nicht. Das Browser-Mikrofon streamt 16-kHz-PCM an die Brücke, die Alibaba Cloud DashScope ASR (paraformer-realtime-v2) ausführt; Zwischentext füllt den Entwurf am Cursor, Stille Auto-Stopp, optionaler Auto-Send.

1vor 15 TagenVision, Sprache & MultimodalMIT
A

dsh-audio-copilot

ai-yucheng/dsh-audio-copilot

Audio Copilot for DeepSeek Harness: transcribe audio (ASR) and synthesize speech (TTS) — gives text-only agents ears and a voice. Windows-local SAPI TTS out of the box; OpenAI-compatible ASR/TTS endpoints configurable. Includes an in-composer voice-input

1letzten MonatVision, Sprache & MultimodalMIT
B

dsh-asr-voice

bittersmilezzz/dsh-asr-voice

开口即成文 · Speak-to-prompt for DeepSeek Harness:云端 ASR 语音识别 + 提示词优化 + 填入草稿/自动发送,跨平台 macOS / Windows。

0vor 17 TagenVision, Sprache & MultimodalMIT
R

dsh-voice-input

rio-promax/dsh-voice-input

DSH voice input plugin: browser realtime + VAD dictation + local/cloud ASR + DeepSeek AI polish

0vor 20 TagenVision, Sprache & MultimodalMIT
J

dsh-voice-input-qwen-asr

jsoncode/dsh-voice-input-qwen-asr

Voice input plugin (dual-face): mic button beside the composer send action, live recording bubble streaming PCM to a local Qwen3-ASR python service managed by the host, plus an ASR environment settings page (clone runtime/model repos, create venv, run ser

0vor 27 TagenVision, Sprache & Multimodal