Pular para o conteúdo principal

Plugins

Navegue, filtre e instale plugins do DeepSeek-Harness.

25 plugins encontrados

P

dsh-omi-voice

polinnizhong/dsh-omi-voice

Leitura em voz alta no chat para o DeepSeek Harness: toque para ler, pausar e retomar as respostas da IA com vozes naturais do Doubao TTS (BYOK); lê apenas a resposta final, com código, tabelas e diagramas filtrados; motor local, o plugin não guarda nenhuma chave de API.

74mês passadoVisão, voz e multimodalMIT
1

dsh-plugin-tts

1624318455/dsh-plugin-tts

Lê em voz alta as respostas do assistente via Edge TTS gratuito ou seus próprios modelos de voz RVC: botões de leitura em voz alta + leitura automática, reprodução progressiva em blocos adaptativos (leituras longas sem interrupções), instalação de pacotes de voz com um clique a partir de um registro e um runtime RVC portátil.

21há 6 diasVisão, voz e multimodalMIT
P

dsh-talk

perrylink/dsh-talk

I/O por voz para DeepSeek Harness — speech-to-text e text-to-speech pelo microfone e pela saída de áudio.

16há 8 diasVisão, voz e multimodalApache-2.0
Q

dsh-voice-mode (dsh-voice-mode)

qishuilalala/dsh-voice-mode

Modo de voz full-duplex para a Web UI do DeepSeek Harness: alternar (envio automático com pausa de 2s) ou ditação por pressionar e segurar em um rascunho editável com ASR streaming zipformer2, wake word opcional; leitura em voz alta sentença por sentença via Edge TTS com legendas ao vivo, e a fala interrompe a reprodução e o turno em execução (barge-in verdadeiro). ASR no dispositivo, sem chave de API.

15há 8 horasVisão, voz e multimodalMIT
P

dsh-plugin-xiaomi-mimo-tts

ppy-web/dsh-plugin-xiaomi-mimo-tts

Adiciona o texto-para-fala Xiaomi MiMo ao DSH Web, com leitura em voz alta das mensagens do assistente, streaming PCM, design de voz predefinido e personalizado, fallback de fala do navegador, controles de reprodução e sons de UI opcionais.

11há 3 diasVisão, voz e multimodalMIT
Y

dsh-tts-bridge

yuuyuko-uu/dsh-tts-bridge

Lê as conversas do DSH em voz alta usando a leitura em voz alta integrada da página web do DeepSeek, controlada por uma pequena extensão de navegador.

4há 3 diasVisão, voz e multimodal
H

dsh-omni-workstation

huashenglian/dsh-omni-workstation

Estação de trabalho omni-modal para o DSH: analyze_image sobre uma cadeia ordenada de vários cartões VLM com comutação de recurso, um conjunto de seis ferramentas de visão (zoom, amostragem de cor, diff de píxeis, OCR, deteção de elementos, apresentação inline) que partilham o mesmo resolvedor de imagens, generate_image sobre protocolos OpenAI/DashScope/ComfyUI, generate_video assíncrono com vários cartões e um construtor /build-video-tool, e TTS speak/clone_voice sobre sete fornecedores, tudo controlado por uma única página de definições com gravação automática.

3há 14 diasVisão, voz e multimodalMIT
N

dsh-plugin-speech

nakamuraia/dsh-plugin-speech

Lê em voz alta as respostas do assistente no DeepSeek Harness: provedores de texto para fala com reprodução em streaming.

3há 18 diasVisão, voz e multimodalMIT
L

dsh-voco

lgquan/dsh-voco

Conversas de voz contínuas para DSH com escuta mãos-livres, push-to-talk, reconhecimento de fala, respostas TTS e delegação de Agent em segundo plano.

3mês passadoVisão, voz e multimodalMIT
T

dsh-gsv

taoruiliu19/dsh-gsv

TTS local em tempo real para DeepSeek Harness: predefinições de voz, leitura automática, assistente de configuração do motor, botão de leitura em voz alta e um painel de configurações para o motor GSV-TTS-Lite.

3mês passadoVisão, voz e multimodalMIT
L

Deepseek-Continuity

linxuhao/deepseek-continuity

Geração local de imagem, voz, música e SFX, além de transcrição, com identidade fixada: personagens, animais, objetos e vozes de atores são definidos uma vez e reutilizados em cada chamada posterior; a saída degenerada (imagem quase plana, áudio silencioso) é rejeitada em vez de retornada como sucesso, e uma linha gerada pode ser lida de volta como texto, para que um clone que engoliu seu final se torne visível. Os motores descarregam quando ociosos, e a geração de imagens e a transcrição podem cada uma apontar para uma API no formato OpenAI em vez do backend local Vulkan.

3há 12 diasVisão, voz e multimodalMIT
J

dsh-voice

jesse-njx/dsh-voice

Notas de voz na entrada, respostas faladas na saída: dite áudio que se torna mensagens de usuário (transcrever), faça o agente ler as respostas em voz alta (falar), local-first em ~/.dsh/voice

3há 2 mesesVisão, voz e multimodalMIT
B

dsh-voice-call

biliye/dsh-voice-call

Assistente de chamada de voz para a GUI web do DSH: uma bola de chamada flutuante e arrastável, VAD no navegador que envia cada fala após uma pausa, reconhecimento de fala FunASR HTTP ou em streaming, respostas TTS da MiniMax ou compatíveis com OpenAI, um modo opcional de palavra de ativação com suspensão automática e despacho de tarefas para sessões de subagente separadas com progresso, parada e relatórios falados de conclusão.

2há 5 diasVisão, voz e multimodalMIT
P

dsh-voice-call

pandapolo/dsh-voice-call

Chamadas de voz iniciadas pelo agente: `offer_call` faz o humano tocar (接听/拒接/稍后再说); as chamadas aceitas são sintetizadas e reproduzidas localmente com CrispASR + Qwen3-TTS (9 vozes, 2 dialetos chineses), e as rejeitadas devolvem a decisão ao agente.

2há 3 diasVisão, voz e multimodalMIT
M

dsh-fish-tts

mari23333/dsh-fish-tts

Lê em voz alta as respostas do assistente apenas via a API Fish Audio (traga sua própria chave): leitura por mensagem, alternância de leitura automática e uma página de configurações para modelo, reference_id da voz, chave de API criptografada e proxy.

2anteontemVisão, voz e multimodalMIT
W

dsh-multi-tts

wyr-233/dsh-multi-tts

Per-reply read-aloud with a multi-provider settings page — MiniMax or any OpenAI-compatible /audio/speech endpoint, with voice, emotion, speed and model selection plus an auto-read toggle.

1há 21 diasVisão, voz e multimodal
V

dsh-live-voice

victorwads/dsh-live-voice

Local-first voice conversations for DSH, with local speech recognition and synthesis and optional external providers.

1há 18 diasVisão, voz e multimodalGPL-3.0
M

dsh-minimax-asr

moluyao/dsh-minimax-asr

MiniMax 语音识别(asr-1.0)+ 语音合成(speech-2.8-hd)的 DeepSeek Harness 全局插件:转写工具、任务结束后用喇叭念一句的播报、实时免手对话、303 个音色可选

1há 19 diasVisão, voz e multimodalMIT
Z

dsh-voice

zhuiyueya/dsh-voice

Voz para o DeepSeek Harness (dsh) — entrada por fala para texto + leitura em voz alta via TTS para o DeepSeek somente de texto, sem necessidade de chave de API

1há 2 mesesVisão, voz e multimodalMIT
F

dsh-say

fangqian616/dsh-say

Speaks your agent's reports in a voice you choose, compressing long reports before speaking. Character voices need no training - a 3-10 second reference clip clones one, and community-trained models work too - and no 6.4 GB GPT-SoVITS install: the plugin installs its own runtime and voice. An existing GPT-SoVITS can be used instead, and it is the same voice model.

0há 11 diasVisão, voz e multimodal
L

dsh-voice-alert

loyalchiiina/dsh-voice-alert

Speaks or plays a sound at the end of every turn and plays a failure cue when a tool call or a turn errors. Ships 20 built-in effects (10 alert chimes + 10 nature sounds) and defaults to effect mode, so it needs no API key and no audio files; an optional Volcengine voice-clone route generates the three announcement clips in one click. Plays through winmm/waveOut as-is, never changing the system volume or mute state. Windows only.

0há 4 diasVisão, voz e multimodalMIT
C

dsh-voice-mimo

ch1bug/dsh-voice-mimo

Xiaomi MiMo-powered voice for DeepSeek Harness: browser 🎤/🧠/🔊 UI, voice_transcribe/voice_understand/voice_speak tools, configurable voice map (preset/voicedesign/voiceclone). Fork of zhuiyueya/dsh-voice (MIT), Settings pattern from Anionex/dsh-vision-toolkit (MIT).

0há 19 diasVisão, voz e multimodalMIT
K

dsh-kitt-voice

kittcat-lab/dsh-kitt-voice

Voice for the DeepSeek Harness: speak to the agent, hear it back, and see what it is doing from a floating window that stays on top of whatever you are running.

0há 28 diasVisão, voz e multimodalMIT
G

dsh-plugins

genesis-agents/dsh-plugins

A source library for DeepSeek Harness: 72 feeds on an hourly timer, a reader with transcripts and translation, and a publisher that turns what it collects into a podcast, a digest, or a report

0mês passadoFluxos e automaçãoMIT