Pular para o conteúdo principal

Plugins

Navegue, filtre e instale plugins do DeepSeek-Harness.

56 plugins encontrados

P

dsh-omi-voice

polinnizhong/dsh-omi-voice

Leitura em voz alta no chat para o DeepSeek Harness: toque para ler, pausar e retomar as respostas da IA com vozes naturais do Doubao TTS (BYOK); lê apenas a resposta final, com código, tabelas e diagramas filtrados; motor local, o plugin não guarda nenhuma chave de API.

74mês passadoVisão, voz e multimodalMIT
1

dsh-plugin-tts

1624318455/dsh-plugin-tts

Lê em voz alta as respostas do assistente via Edge TTS gratuito ou seus próprios modelos de voz RVC: botões de leitura em voz alta + leitura automática, reprodução progressiva em blocos adaptativos (leituras longas sem interrupções), instalação de pacotes de voz com um clique a partir de um registro e um runtime RVC portátil.

21há 6 diasVisão, voz e multimodalMIT
P

dsh-talk

perrylink/dsh-talk

I/O por voz para DeepSeek Harness — speech-to-text e text-to-speech pelo microfone e pela saída de áudio.

16há 8 diasVisão, voz e multimodalApache-2.0
H

dsh-novel-forge

huangziyuan-general/dsh-novel-forge

Guardrails de escrita de romances: 20 ferramentas novel_* impõem consistência do livro-razão de fatos, portas de fase e capítulo, auditoria automática com métricas determinísticas e revisões apenas de proposta; um workbench do painel direito cobre leitura, reprodução TTS, polimento, revisão, verificações de continuidade e redação em lote, e um mecanismo de desvio executa etapas internas fora da conversa principal.

15há 6 diasFluxos e automaçãoMIT
Q

dsh-voice-mode (dsh-voice-mode)

qishuilalala/dsh-voice-mode

Modo de voz full-duplex para a Web UI do DeepSeek Harness: alternar (envio automático com pausa de 2s) ou ditação por pressionar e segurar em um rascunho editável com ASR streaming zipformer2, wake word opcional; leitura em voz alta sentença por sentença via Edge TTS com legendas ao vivo, e a fala interrompe a reprodução e o turno em execução (barge-in verdadeiro). ASR no dispositivo, sem chave de API.

15há 6 horasVisão, voz e multimodalMIT
B

dsh-voice-ai-girlfriend-plugin

beiyege-01/dsh-voice-ai-girlfriend-plugin

Namorada IA por voz para a Web UI: entrada de microfone com FunASR, respostas faladas com Qwen3-TTS, janela de animação do companheiro e chat QQ bidirecional (texto/voz/imagem push) via NapCat.

12há 19 diasVisão, voz e multimodal
P

dsh-plugin-xiaomi-mimo-tts

ppy-web/dsh-plugin-xiaomi-mimo-tts

Adiciona o texto-para-fala Xiaomi MiMo ao DSH Web, com leitura em voz alta das mensagens do assistente, streaming PCM, design de voz predefinido e personalizado, fallback de fala do navegador, controles de reprodução e sons de UI opcionais.

11anteontemVisão, voz e multimodalMIT
W

dsh-mmx-bridge

welsione/dsh-mmx-bridge

Ponte multimodal MiniMax: uma única ferramenta `mmx_bridge` cobre compreensão/geração de imagens, vídeo, TTS, música, capas, busca na web e cota; substituição opcional de `web_search`/`read_image`; players e pré-visualizações de imagem embutidos diretamente na GUI web (npm: `dsh-mmx-bridge`).

10há 15 diasFerramentas e funçõesMIT
Z

dsh-voice-input-plugin

zhangbo-cn/dsh-voice-input-plugin

Microfone do compositor para a interface web: toque para monitorar a transcrição ao vivo e segure para falar, com leitura da resposta por Edge TTS do host transmitida enquanto o modelo gera, pausa de eco durante a leitura e toque para parar.

6mês passadoVisão, voz e multimodalMIT
1

dsh-perlica-ding

117bs/dsh-perlica-ding

Notificações sonoras em camadas com tema Perlica (Arknights: Endfield): tons de plan-ready, task-done, needs-your-input e error; silencioso para chat simples, reprodução em nível de sistema (funciona em segundo plano), multiplataforma (Windows/macOS/Linux), sons TTS customizados.

6há 21 diasIntegrações e acesso remotoMIT
A

dsh-guide-dog

atropinoltt/dsh-guide-dog

Plugin multimodal alimentado por MiniMax: modo de chamada de voz em tempo real (conversa em streaming, interface de dock flutuante), modo de voz e entrada de voz pelo microfone, além de ferramentas de geração de imagem/vídeo/música/fala e de inspeção visual.

5há 2 mesesVisão, voz e multimodalMIT
Y

dsh-tts-bridge

yuuyuko-uu/dsh-tts-bridge

Lê as conversas do DSH em voz alta usando a leitura em voz alta integrada da página web do DeepSeek, controlada por uma pequena extensão de navegador.

4há 3 diasVisão, voz e multimodal
S

dsh-voice

stardustlc666/dsh-voice

Ferramentas de voz: síntese de voz neural gratuita com edge-tts, transcrição ASR compatível com OpenAI, lista de vozes, pré-visualização de vozes em lote e autodiagnóstico de estado.

4há 6 horasVisão, voz e multimodalMIT
H

dsh-voice

haoku123/dsh-voice

Modo de voz full-duplex para a interface web: ditado por toque para alternar ou manter pressionado (tecla de envio ou `Ctrl`) com legendas ao vivo, ASR SenseVoice do lado do host via sherpa-onnx, respostas faladas frase por frase, e falar interrompe a reprodução e o turno em execução (verdadeira interrupção). Sem chave de API.

4mês passadoVisão, voz e multimodalMIT
F

dsh-chatvoice

fuzzysoul/dsh-chatvoice

Loop de voz gratuito para a interface web: entrada de microfone via SpeechRecognition do navegador com resultados parciais em tempo real, além de botões de alto-falante para leitura em voz alta e leitura automática das respostas do assistente, sem configuração e sem chave de API.

4há 2 mesesVisão, voz e multimodalMIT
L

dsh-plugin-notify-sound

ldchaowin/dsh-plugin-notify-sound

Toques de conclusão por workspace, além de sons de atenção para eventos de aprovação, pergunta, revisão de plano, objetivo bloqueado e falha de tarefa, com sintetizador embutido, voz (TTS) e áudio personalizado

4há 2 mesesIntegrações e acesso remotoMIT
H

dsh-omni-workstation

huashenglian/dsh-omni-workstation

Estação de trabalho omni-modal para o DSH: analyze_image sobre uma cadeia ordenada de vários cartões VLM com comutação de recurso, um conjunto de seis ferramentas de visão (zoom, amostragem de cor, diff de píxeis, OCR, deteção de elementos, apresentação inline) que partilham o mesmo resolvedor de imagens, generate_image sobre protocolos OpenAI/DashScope/ComfyUI, generate_video assíncrono com vários cartões e um construtor /build-video-tool, e TTS speak/clone_voice sobre sete fornecedores, tudo controlado por uma única página de definições com gravação automática.

3há 14 diasVisão, voz e multimodalMIT
N

dsh-plugin-speech

nakamuraia/dsh-plugin-speech

Lê em voz alta as respostas do assistente no DeepSeek Harness: provedores de texto para fala com reprodução em streaming.

3há 18 diasVisão, voz e multimodalMIT
S

dsh-audiogen

shimingming520/dsh-audiogen

Geração de áudio por IA para a GUI web do DeepSeek Harness — TTS multiforncedor, música, efeitos sonoros e design de voz com painel lateral, comparação de modelos, biblioteca de recursos e ferramentas Agent.

3há 24 diasVisão, voz e multimodalApache-2.0
L

dsh-voco

lgquan/dsh-voco

Conversas de voz contínuas para DSH com escuta mãos-livres, push-to-talk, reconhecimento de fala, respostas TTS e delegação de Agent em segundo plano.

3mês passadoVisão, voz e multimodalMIT
T

dsh-gsv

taoruiliu19/dsh-gsv

TTS local em tempo real para DeepSeek Harness: predefinições de voz, leitura automática, assistente de configuração do motor, botão de leitura em voz alta e um painel de configurações para o motor GSV-TTS-Lite.

3mês passadoVisão, voz e multimodalMIT
H

dsh-plugin-notify

huguangyu666/dsh-plugin-notify

Caixa de saída de notificações: o agente notifica proativamente via toast / voz TTS em chinês / efeitos sonoros (explosão, vitória, alarme); uma janela de confirmação de 60s liga de volta por voz, com reforço de volume e painel de configurações.

3há 18 diasIntegrações e acesso remotoMIT
J

dsh-voice

jesse-njx/dsh-voice

Notas de voz na entrada, respostas faladas na saída: dite áudio que se torna mensagens de usuário (transcrever), faça o agente ler as respostas em voz alta (falar), local-first em ~/.dsh/voice

3há 2 mesesVisão, voz e multimodalMIT
B

dsh-voice-call

biliye/dsh-voice-call

Assistente de chamada de voz para a GUI web do DSH: uma bola de chamada flutuante e arrastável, VAD no navegador que envia cada fala após uma pausa, reconhecimento de fala FunASR HTTP ou em streaming, respostas TTS da MiniMax ou compatíveis com OpenAI, um modo opcional de palavra de ativação com suspensão automática e despacho de tarefas para sessões de subagente separadas com progresso, parada e relatórios falados de conclusão.

2há 4 diasVisão, voz e multimodalMIT