Vai al contenuto principale

Plugin

Sfoglia, filtra e installa i plugin di DeepSeek-Harness.

30 plugin trovati

F

dsh-prompt-enhancer

fishsb/dsh-prompt-enhancer

Miglioramento dei prompt con un clic (5 modalità, catena di memoria, fallback multi-modello) più riconoscimento vocale (Qwen3-ASR cloud / SenseVoice offline, arresto automatico al silenzio) per il composer, con riavvio del servizio DSH con un clic.

825 giorni faStrumenti e capacità
P

dsh-voice-scribe

pensivefei/dsh-voice-scribe

Input vocale per l'interfaccia web: premi Alt (o Alt+Space) per avviare/arrestare la dettatura, Web Speech del browser (zero-config) o ASR cloud compatibile con OpenAI, rifinitura opzionale tramite LLM configurato in DSH, interfaccia impostazioni.

343 giorni faVisione, voce e multimodaleMIT
W

dsh-ears

wiziscool/dsh-ears

Plugin di input vocale per DeepSeek Harness (dsh): un pulsante microfono nel compositore converte il parlato in una bozza trascritta, con scelta di backend di riconoscimento vocale, rifinitura opzionale tramite i percorsi LLM propri di dsh e una pagina delle impostazioni nativa.

2121 ore faVisione, voce e multimodaleMIT
Q

dsh-voice-mode (dsh-voice-mode)

qishuilalala/dsh-voice-mode

Modalità vocale full-duplex per la Web UI di DeepSeek Harness: toggle (invio automatico dopo pausa di 2s) o dettatura hold-to-talk in una bozza editabile con ASR streaming zipformer2, wake word opzionale; lettura ad alta voce Edge TTS frase per frase con sottotitoli live, e il parlato interrompe la riproduzione e il turno in corso (vero barge-in). ASR on-device, nessuna chiave API.

156 ore faVisione, voce e multimodaleMIT
D

dsh-video-lens

dundunhan/dsh-video-lens

Fornisce agli agenti DeepSeek Harness solo testo la comprensione video: campionamento fotogrammi consapevole della scena + VLM + trascrizione ASR opzionale fusi in prove sulla linea temporale. / Plugin di comprensione video per modelli solo testo (campionamento fotogrammi consapevole della scena + VLM + trascrizione vocale opzionale).

13mese scorsoVisione, voce e multimodaleMIT
B

dsh-voice-ai-girlfriend-plugin

beiyege-01/dsh-voice-ai-girlfriend-plugin

Fidanzata IA vocale per la UI Web: input microfono con FunASR, risposte vocali Qwen3-TTS, finestra animata del compagno e chat QQ bidirezionale (push di testo/voce/immagine) tramite NapCat.

1219 giorni faVisione, voce e multimodale
C

dsh-bilibili

czx2244/dsh-bilibili

Analisi dei video Bilibili: metadati, trascrizione (fallback ASR tramite Bijian/sherpa-onnx/whisper.cpp), commenti, danmaku e fotogrammi chiave nitidi con descrizioni visive locali opzionali.

92 mesi faStrumenti e capacitàMIT
I

dsh-video-understand

ilps2/dsh-video-understand

Strumento a basso costo per la comprensione dei video: un tool video_understand trasforma un link Bilibili / BV / un video locale in un layer informativo AVIS (ASR + struttura delle scene + tracking degli oggetti + etichette YOLO) e restituisce summary + Q&A. Routing dinamico tra layer guidato dalle domande (L0 ASR / L1 tracking oggetti / L2 VLM su keyframe), riuso del layer semantico per domande ripetute, tetto di budget per singola domanda. Motore Python: il layer base richiede faster-whisper / opencv / yt-dlp (~200-300MB); il layer semantico opzionale aggiunge ~2GB di torch / transformers / ultralytics. Un doctor --fix incluso configura il venv e installa entrambi.

8mese scorsoStrumenti e capacità
S

dsh-voice

stardustlc666/dsh-voice

Strumenti vocali: sintesi vocale neurale gratuita con edge-tts, trascrizione ASR compatibile con OpenAI, elenco delle voci, anteprima batch delle voci e autodiagnosi dello stato.

46 ore faVisione, voce e multimodaleMIT
H

dsh-voice

haoku123/dsh-voice

Modalità vocale full-duplex per l'interfaccia web: dettatura con tocco per attivare/disattivare o pressione prolungata (tasto di invio o `Ctrl`) con sottotitoli in diretta, ASR SenseVoice lato host tramite sherpa-onnx, risposte parlate frase per frase, e parlare interrompe la riproduzione e il turno in corso (vera interruzione). Nessuna chiave API.

4mese scorsoVisione, voce e multimodaleMIT
W

dsh-hold-to-talk

wangzhanchao883/dsh-hold-to-talk

Input a una mano e senza tastiera per il composer: tieni premuto il mouse sulla casella di input, parla, rilascia — il testo finisce nella bozza, e scorrendo verso l'alto annulli senza lasciare una frase a metà. Nessun pulsante microfono da centrare e nessuna scorciatoia da ricordare; la mano non deve mai lasciare l'area di input, che è il punto quando l'altra mano è occupata. Il riconoscimento gira completamente offline (SenseVoice via sherpa-onnx, nessuna chiave API, l'audio non lascia mai la macchina).

319 ore faVisione, voce e multimodaleMIT
N

voco-input-sh

nothree-code/voco-input-sh

Input vocale per la Web UI: un pulsante microfono che usa il riconoscimento vocale offline locale di VocoType e inserisce automaticamente il testo riconosciuto nel compositore (auto-deploy, dedupe, dettatura continua).

319 giorni faVisione, voce e multimodaleMIT
B

dsh-voice-call

biliye/dsh-voice-call

Assistente di chiamata vocale per la GUI web di DSH: una pallina di chiamata fluttuante e trascinabile, VAD lato browser che invia ogni frase dopo una pausa, riconoscimento vocale FunASR HTTP o in streaming, risposte TTS di MiniMax o compatibili OpenAI, una modalità opzionale con wake word e auto-sospensione, e invio di attività a sessioni subagente separate con progresso, stop e resoconti vocali di completamento.

24 giorni faVisione, voce e multimodaleMIT
P

muxiva-dsh-voice

piyotahu/muxiva-dsh-voice

Voce full-duplex local-first per DeepSeek Harness, orchestrata da Muxiva

22 mesi faVisione, voce e multimodaleApache-2.0
P

dsh-voice-call

pandapolo/dsh-voice-call

Chiamate vocali avviate dall’agente: `offer_call` fa squillare l’umano (接听/拒接/稍后再说); le chiamate accettate vengono sintetizzate e riprodotte in locale con CrispASR + Qwen3-TTS (9 voci, 2 dialetti cinesi), mentre quelle rifiutate restituiscono la decisione all’agente.

23 giorni faVisione, voce e multimodaleMIT
1

dsh-wsl-media

173787247/dsh-wsl-media

Local media/doc pipeline: ffprobe, extract, thumbnail, PDF, ASR, pandoc, OCR, exif (allowRoots include IM inbox).

13 giorni faSviluppo e strumenti per pluginMIT
1

dsh-wsl-im

173787247/dsh-wsl-im

Bridges Feishu, WeCom, DingTalk, QQ, Slack, Discord, Telegram and Mattermost into dsh agents (outbound WS/Stream/Gateway/long-poll/webhook), with im_status, optional local Whisper ASR, plain-text outbound for QQ/DingTalk/Telegram/Mattermost, and env CSV allowlists (DSH_IM_*_ALLOWED_USER_IDS). Empty allowedUserIds means EVERYONE can drive your agent — set a whitelist before exposing a bot.

13 giorni faSviluppo e strumenti per pluginMIT
M

dsh-minimax-asr

moluyao/dsh-minimax-asr

MiniMax 语音识别(asr-1.0)+ 语音合成(speech-2.8-hd)的 DeepSeek Harness 全局插件:转写工具、任务结束后用喇叭念一句的播报、实时免手对话、303 个音色可选

119 giorni faVisione, voce e multimodaleMIT
F

dsh-funasr-voice

fenglin-ai/dsh-funasr-voice

Offline voice input for the DSH Web UI: mic to local FunASR (SenseVoiceSmall), one-click install, no cloud.

1mese scorsoVisione, voce e multimodaleMIT
S

dsh-voice-input-cn

schumchanvi/dsh-voice-input-cn

Input vocale pronto per la Cina per il composer. Richiede un bridge Python locale (pip install dashscope websockets, esegui bridge/voice-bridge.py) — il plugin da solo non funziona. Il microfono del browser trasmette PCM a 16 kHz al bridge, che esegue Alibaba Cloud DashScope ASR (paraformer-realtime-v2); il testo intermedio riempie la bozza al cursore, arresto automatico al silenzio, invio automatico opzionale.

115 giorni faVisione, voce e multimodaleMIT
A

dsh-audio-copilot

ai-yucheng/dsh-audio-copilot

Audio Copilot for DeepSeek Harness: transcribe audio (ASR) and synthesize speech (TTS) — gives text-only agents ears and a voice. Windows-local SAPI TTS out of the box; OpenAI-compatible ASR/TTS endpoints configurable. Includes an in-composer voice-input

1mese scorsoVisione, voce e multimodaleMIT
B

dsh-asr-voice

bittersmilezzz/dsh-asr-voice

开口即成文 · Speak-to-prompt for DeepSeek Harness:云端 ASR 语音识别 + 提示词优化 + 填入草稿/自动发送,跨平台 macOS / Windows。

017 giorni faVisione, voce e multimodaleMIT
R

dsh-voice-input

rio-promax/dsh-voice-input

DSH voice input plugin: browser realtime + VAD dictation + local/cloud ASR + DeepSeek AI polish

020 giorni faVisione, voce e multimodaleMIT
J

dsh-voice-input-qwen-asr

jsoncode/dsh-voice-input-qwen-asr

Voice input plugin (dual-face): mic button beside the composer send action, live recording bubble streaming PCM to a local Qwen3-ASR python service managed by the host, plus an ASR environment settings page (clone runtime/model repos, create venv, run ser

027 giorni faVisione, voce e multimodale