Pular para o conteúdo principal

Plugins

Navegue, filtre e instale plugins do DeepSeek-Harness.

18 plugins encontrados

F

dsh-vision-proxy

flyvhidbwo/dsh-vision-proxy

Cérebro DeepSeek + transcrição automática de imagens: anexe imagens na GUI e cada uma é transcrita pelo deepseek-v4-flash-vision-exp oficial por padrão (um cérebro V4-Pro puramente textual pode ver imagens), com qualquer VLM compatível com OpenAI ou Ollama local como alternativas.

16mês passadoVisão, voz e multimodalMIT
R

dsh-plugin-call-me

radres/dsh-plugin-call-me

Faz seu telefone tocar via CallKit: ferramentas `call_me` e `text_me`, além de ligações opcionais de fim de turno e de aprovação, cuja resposta falada é transcrita de volta para a sessão.

7anteontemIntegrações e acesso remotoMIT
S

dsh-voice-assistant

supersyh-sss/dsh-voice-assistant

Assistente de voz para o dsh web: diga a frase de ativação (por exemplo, «小鲸») para ativar o ditado mãos-livres — o que diz é transcrito e escrito automaticamente na caixa de conversa. Suporta comandos de edição falados (enviar, limpar, nova linha, parar de ler) e lê em voz alta as respostas do assistente em chinês. O reconhecimento de fala corre localmente no navegador via sherpa-onnx WASM, pelo que funciona offline sem chave de API.

3mês passadoVisão, voz e multimodalMIT
B

dsh-stt-input

baisama-cloud/dsh-stt-input

Entrada de voz speech-to-text para a Web UI: um botão de microfone no compositor transcreve a fala para o rascunho via Web Speech API do navegador (sem configuração) ou uma API Whisper compatível com OpenAI (OpenAI / Groq), com modelo e idioma selecionáveis em Configurações.

3mês passadoVisão, voz e multimodalMIT
J

dsh-voice

jesse-njx/dsh-voice

Notas de voz na entrada, respostas faladas na saída: dite áudio que se torna mensagens de usuário (transcrever), faça o agente ler as respostas em voz alta (falar), local-first em ~/.dsh/voice

3há 2 mesesVisão, voz e multimodalMIT
B

dsh-vision-plugin

bug-huntter/dsh-vision-plugin

Reconhecimento de imagens configurável para modelos DSH somente de texto: as mensagens de imagem são primeiro transcritas por um modelo de visão compatível com OpenAI (URL base, ID do modelo e chave API definidos numa secção de Definições) e depois passadas ao modelo principal como texto, enquanto o suporte a entrada de imagem é anunciado. O esquema de autenticação por chave API é selecionável (cabeçalhos de pedido estilo OpenAI, Anthropic, Gemini ou Azure) e a falta de uma chave é comunicada antes de qualquer pedido ser enviado.

2há 7 diasVisão, voz e multimodalMIT
K

dsh-vision-recognizer

kaixinbaba/dsh-vision-recognizer

Rota de provedor de visão que transcreve imagens anexadas em texto por meio de um modelo configurável (mais de 15 fornecedores compatíveis com OpenAI e Anthropic) enquanto o DeepSeek continua respondendo.

2há 2 mesesVisão, voz e multimodalMIT
3

dsh-vision (vision-route)

314857493/dsh-vision

Registra uma rota de provedor `deepseek-vision`: a interface Web aceita imagens coladas e as transcreve para texto pela API de visão Zhipu GLM gratuita antes de delegar ao adaptador DeepSeek.

2mês passadoVisão, voz e multimodalMIT
X

dsh-vision-bridge

ximengxiaolan/dsh-vision-bridge

Imagens anexadas no compositor são transcritas para texto por um modelo de visão compatível com OpenAI antes de chegar aos modelos DeepSeek somente de texto

2há 2 mesesVisão, voz e multimodalMIT
J

dsh-mmroute

jmxsxwyzjdwl/dsh-mmroute

Roteamento multimodal transparente para modelos somente de texto: cada imagem em cada chamada de modelo é totalmente transcrita (OCR literal, dados, zonas de incerteza, reforçado contra injeção) pelo seu próprio compreensor multimodal, com nova observação focada via vision_relook e nova tentativa automática em falhas relacionadas a imagens. Sem endpoints incluídos, sem logins emprestados.

1há 28 diasVisão, voz e multimodalMIT
A

dsh-audio-copilot

ai-yucheng/dsh-audio-copilot

Audio Copilot para o DeepSeek Harness: transcreve áudio (ASR) e sintetiza fala (TTS) — dá aos agentes somente texto ouvidos e voz. TTS SAPI local do Windows pronto para uso; endpoints ASR/TTS compatíveis com OpenAI configuráveis. Inclui entrada de voz no compositor.

1há 2 mesesVisão, voz e multimodalMIT
3

dsh-vision

314857493/dsh-vision

Plugin do DeepSeek Harness: uma rota `deepseek-vision` que declara entrada de imagem e transcreve imagens coladas por meio dos modelos de visão gratuitos Zhipu GLM antes de delegar ao adaptador DeepSeek.

1há 2 mesesVisão, voz e multimodalMIT
C

dsh-voice-mimo

ch1bug/dsh-voice-mimo

Xiaomi MiMo-powered voice for DeepSeek Harness: browser 🎤/🧠/🔊 UI, voice_transcribe/voice_understand/voice_speak tools, configurable voice map (preset/voicedesign/voiceclone). Fork of zhuiyueya/dsh-voice (MIT), Settings pattern from Anionex/dsh-vision-toolkit (MIT).

0há 21 diasVisão, voz e multimodalMIT
M

dsh-voice-input-en

mohith-das/dsh-voice-input-en

Minimal English-only voice input for the DeepSeek Harness Web UI: a mic button in the composer that transcribes speech into the draft via the browser's native SpeechRecognition API. No dependencies, no subprocess, no network calls beyond whatever the brow

0mês passadoVisão, voz e multimodalMIT
S

dsh-vision-pro-bridge

shainedemo/dsh-vision-pro-bridge

Vision bridge for text-only DeepSeek models: transcribes attached images with deepseek-v4-flash-vision-exp before they reach deepseek-v4-pro, with no third-party dependencies.

0mês passadoVisão, voz e multimodalMIT
J

dsh-autovision

junkrat9527/dsh-autovision

Vision for text-only dsh models: paste an image and a configured multimodal model transcribes it to text automatically — transparent twin routing, an agent-callable read-image tool, no built-in keys or relay.

0há 2 mesesVisão, voz e multimodalMIT
N

dsh-voice-input

newdanew/dsh-voice-input

Voice input for the web UI: a mic button in the composer that transcribes speech into the draft via the Web Speech API, with an optional auto-send toggle.

0há 2 mesesVisão, voz e multimodalMIT
E

dsh-plugin-image-input

elohia/dsh-plugin-image-input

Image-to-text input for the Web UI: paste or drag an image and it is transcribed into structured text and sent, giving text-only LLMs image-input takeover (OpenAI-compatible vision API).

0há 2 mesesVisão, voz e multimodalMIT