Pular para o conteúdo principal

Plugins

Navegue, filtre e instale plugins do DeepSeek-Harness.

30 plugins encontrados

F

dsh-prompt-enhancer

fishsb/dsh-prompt-enhancer

Aprimoramento de prompt com um clique (5 modos, cadeia de memória, fallback multimodelo) mais reconhecimento de voz (Qwen3-ASR na nuvem / SenseVoice offline, parada automática no silêncio) para o compositor, com reinicialização do serviço DSH com um clique.

82há 5 diasFerramentas e funções
P

dsh-voice-scribe

pensivefei/dsh-voice-scribe

Entrada de voz para a interface web: toque em Alt (ou Alt+Space) para iniciar/parar o ditado, Web Speech do navegador (sem configuração) ou ASR em nuvem compatível com OpenAI, polimento opcional por meio do LLM configurado no DSH, interface de configurações.

34há 3 diasVisão, voz e multimodalMIT
W

dsh-ears

wiziscool/dsh-ears

Plugin de entrada de voz para DeepSeek Harness (dsh): um botão de microfone no compositor converte fala em rascunho transcrito, com escolha de backends de reconhecimento de voz, refinamento opcional pelas próprias rotas LLM do dsh e uma página de configurações nativa.

21há 23 horasVisão, voz e multimodalMIT
Q

dsh-voice-mode (dsh-voice-mode)

qishuilalala/dsh-voice-mode

Modo de voz full-duplex para a Web UI do DeepSeek Harness: alternar (envio automático com pausa de 2s) ou ditação por pressionar e segurar em um rascunho editável com ASR streaming zipformer2, wake word opcional; leitura em voz alta sentença por sentença via Edge TTS com legendas ao vivo, e a fala interrompe a reprodução e o turno em execução (barge-in verdadeiro). ASR no dispositivo, sem chave de API.

15há 8 horasVisão, voz e multimodalMIT
D

dsh-video-lens

dundunhan/dsh-video-lens

Dá aos agentes DeepSeek Harness apenas de texto compreensão de vídeo: amostragem de quadros consciente da cena + VLM + transcrição ASR opcional fundidos em evidência da linha do tempo. / Plugin de compreensão de vídeo para modelos apenas de texto (amostragem de quadros consciente da cena + VLM + transcrição de voz opcional).

13mês passadoVisão, voz e multimodalMIT
B

dsh-voice-ai-girlfriend-plugin

beiyege-01/dsh-voice-ai-girlfriend-plugin

Namorada IA por voz para a Web UI: entrada de microfone com FunASR, respostas faladas com Qwen3-TTS, janela de animação do companheiro e chat QQ bidirecional (texto/voz/imagem push) via NapCat.

12há 19 diasVisão, voz e multimodal
C

dsh-bilibili

czx2244/dsh-bilibili

Análise de vídeos do Bilibili: metadados, transcrição (fallback de ASR via Bijian/sherpa-onnx/whisper.cpp), comentários, danmaku e keyframes nítidos com descrições de visão local opcionais.

9há 2 mesesFerramentas e funçõesMIT
I

dsh-video-understand

ilps2/dsh-video-understand

Ferramenta de compreensão de vídeo de baixo custo: uma ferramenta video_understand transforma um link do Bilibili / BV / vídeo local em uma camada de informação AVIS (ASR + estrutura de cena + rastreamento de objetos + rótulos YOLO) e retorna resumo + Q&A. Roteamento dinâmico entre camadas orientado por perguntas (L0 ASR / L1 rastreamento de objetos / L2 VLM de keyframe), reutilização da camada semântica para perguntas repetidas, teto de orçamento por pergunta. Motor Python: a camada principal precisa de faster-whisper / opencv / yt-dlp (~200-300MB); a camada semântica opcional adiciona ~2GB de torch / transformers / ultralytics. Um doctor --fix incluído configura o venv e instala ambos.

8mês passadoFerramentas e funções
S

dsh-voice

stardustlc666/dsh-voice

Ferramentas de voz: síntese de voz neural gratuita com edge-tts, transcrição ASR compatível com OpenAI, lista de vozes, pré-visualização de vozes em lote e autodiagnóstico de estado.

4há 8 horasVisão, voz e multimodalMIT
H

dsh-voice

haoku123/dsh-voice

Modo de voz full-duplex para a interface web: ditado por toque para alternar ou manter pressionado (tecla de envio ou `Ctrl`) com legendas ao vivo, ASR SenseVoice do lado do host via sherpa-onnx, respostas faladas frase por frase, e falar interrompe a reprodução e o turno em execução (verdadeira interrupção). Sem chave de API.

4mês passadoVisão, voz e multimodalMIT
W

dsh-hold-to-talk

wangzhanchao883/dsh-hold-to-talk

Entrada com uma só mão e sem teclado para o compositor: prima e mantenha o rato na caixa de entrada, fale, largue — o texto fica no rascunho, e deslizar para cima cancela sem deixar uma meia frase para trás. Não há botão de microfone para acertar nem atalho para memorizar; a mão nunca precisa de sair da área de entrada, o que é essencial quando a outra mão está ocupada. O reconhecimento corre totalmente offline (SenseVoice via sherpa-onnx, sem chave de API, o áudio nunca sai da máquina).

3há 21 horasVisão, voz e multimodalMIT
N

voco-input-sh

nothree-code/voco-input-sh

Entrada por voz para a Web UI: um botão de microfone que aciona o reconhecimento de fala offline local VocoType e insere automaticamente o texto reconhecido no compositor (implantação automática, deduplicação, ditado contínuo).

3há 19 diasVisão, voz e multimodalMIT
B

dsh-voice-call

biliye/dsh-voice-call

Assistente de chamada de voz para a GUI web do DSH: uma bola de chamada flutuante e arrastável, VAD no navegador que envia cada fala após uma pausa, reconhecimento de fala FunASR HTTP ou em streaming, respostas TTS da MiniMax ou compatíveis com OpenAI, um modo opcional de palavra de ativação com suspensão automática e despacho de tarefas para sessões de subagente separadas com progresso, parada e relatórios falados de conclusão.

2há 5 diasVisão, voz e multimodalMIT
P

muxiva-dsh-voice

piyotahu/muxiva-dsh-voice

Voz full-duplex local-first para DeepSeek Harness, orquestrada por Muxiva

2há 2 mesesVisão, voz e multimodalApache-2.0
P

dsh-voice-call

pandapolo/dsh-voice-call

Chamadas de voz iniciadas pelo agente: `offer_call` faz o humano tocar (接听/拒接/稍后再说); as chamadas aceitas são sintetizadas e reproduzidas localmente com CrispASR + Qwen3-TTS (9 vozes, 2 dialetos chineses), e as rejeitadas devolvem a decisão ao agente.

2há 3 diasVisão, voz e multimodalMIT
1

dsh-wsl-media

173787247/dsh-wsl-media

Local media/doc pipeline: ffprobe, extract, thumbnail, PDF, ASR, pandoc, OCR, exif (allowRoots include IM inbox).

1há 3 diasDesenvolvimento e ferramentas de pluginsMIT
1

dsh-wsl-im

173787247/dsh-wsl-im

Bridges Feishu, WeCom, DingTalk, QQ, Slack, Discord, Telegram and Mattermost into dsh agents (outbound WS/Stream/Gateway/long-poll/webhook), with im_status, optional local Whisper ASR, plain-text outbound for QQ/DingTalk/Telegram/Mattermost, and env CSV allowlists (DSH_IM_*_ALLOWED_USER_IDS). Empty allowedUserIds means EVERYONE can drive your agent — set a whitelist before exposing a bot.

1há 3 diasDesenvolvimento e ferramentas de pluginsMIT
M

dsh-minimax-asr

moluyao/dsh-minimax-asr

MiniMax 语音识别(asr-1.0)+ 语音合成(speech-2.8-hd)的 DeepSeek Harness 全局插件:转写工具、任务结束后用喇叭念一句的播报、实时免手对话、303 个音色可选

1há 19 diasVisão, voz e multimodalMIT
F

dsh-funasr-voice

fenglin-ai/dsh-funasr-voice

Offline voice input for the DSH Web UI: mic to local FunASR (SenseVoiceSmall), one-click install, no cloud.

1mês passadoVisão, voz e multimodalMIT
S

dsh-voice-input-cn

schumchanvi/dsh-voice-input-cn

Entrada de voz pronta para a China para o compositor. Requer uma ponte local em Python (pip install dashscope websockets, executar bridge/voice-bridge.py) — o plugin sozinho não funciona. O microfone do navegador transmite PCM de 16 kHz à ponte, que executa o Alibaba Cloud DashScope ASR (paraformer-realtime-v2); o texto intermediário preenche o rascunho no cursor, parada automática por silêncio, envio automático opcional.

1há 15 diasVisão, voz e multimodalMIT
A

dsh-audio-copilot

ai-yucheng/dsh-audio-copilot

Audio Copilot for DeepSeek Harness: transcribe audio (ASR) and synthesize speech (TTS) — gives text-only agents ears and a voice. Windows-local SAPI TTS out of the box; OpenAI-compatible ASR/TTS endpoints configurable. Includes an in-composer voice-input

1mês passadoVisão, voz e multimodalMIT
B

dsh-asr-voice

bittersmilezzz/dsh-asr-voice

开口即成文 · Speak-to-prompt for DeepSeek Harness:云端 ASR 语音识别 + 提示词优化 + 填入草稿/自动发送,跨平台 macOS / Windows。

0há 17 diasVisão, voz e multimodalMIT
R

dsh-voice-input

rio-promax/dsh-voice-input

DSH voice input plugin: browser realtime + VAD dictation + local/cloud ASR + DeepSeek AI polish

0há 20 diasVisão, voz e multimodalMIT
J

dsh-voice-input-qwen-asr

jsoncode/dsh-voice-input-qwen-asr

Voice input plugin (dual-face): mic button beside the composer send action, live recording bubble streaming PCM to a local Qwen3-ASR python service managed by the host, plus an ASR environment settings page (clone runtime/model repos, create venv, run ser

0há 27 diasVisão, voz e multimodal