Plugins
Navegue, filtre e instale plugins do DeepSeek-Harness.
18 plugins encontrados
dsh-vision-proxy
flyvhidbwo/dsh-vision-proxy
Cérebro DeepSeek + transcrição automática de imagens: anexe imagens na GUI e cada uma é transcrita pelo deepseek-v4-flash-vision-exp oficial por padrão (um cérebro V4-Pro puramente textual pode ver imagens), com qualquer VLM compatível com OpenAI ou Ollama local como alternativas.
dsh-plugin-call-me
radres/dsh-plugin-call-me
Faz seu telefone tocar via CallKit: ferramentas `call_me` e `text_me`, além de ligações opcionais de fim de turno e de aprovação, cuja resposta falada é transcrita de volta para a sessão.
dsh-voice-assistant
supersyh-sss/dsh-voice-assistant
Assistente de voz para o dsh web: diga a frase de ativação (por exemplo, «小鲸») para ativar o ditado mãos-livres — o que diz é transcrito e escrito automaticamente na caixa de conversa. Suporta comandos de edição falados (enviar, limpar, nova linha, parar de ler) e lê em voz alta as respostas do assistente em chinês. O reconhecimento de fala corre localmente no navegador via sherpa-onnx WASM, pelo que funciona offline sem chave de API.
dsh-stt-input
baisama-cloud/dsh-stt-input
Entrada de voz speech-to-text para a Web UI: um botão de microfone no compositor transcreve a fala para o rascunho via Web Speech API do navegador (sem configuração) ou uma API Whisper compatível com OpenAI (OpenAI / Groq), com modelo e idioma selecionáveis em Configurações.
dsh-voice
jesse-njx/dsh-voice
Notas de voz na entrada, respostas faladas na saída: dite áudio que se torna mensagens de usuário (transcrever), faça o agente ler as respostas em voz alta (falar), local-first em ~/.dsh/voice
dsh-vision-plugin
bug-huntter/dsh-vision-plugin
Reconhecimento de imagens configurável para modelos DSH somente de texto: as mensagens de imagem são primeiro transcritas por um modelo de visão compatível com OpenAI (URL base, ID do modelo e chave API definidos numa secção de Definições) e depois passadas ao modelo principal como texto, enquanto o suporte a entrada de imagem é anunciado. O esquema de autenticação por chave API é selecionável (cabeçalhos de pedido estilo OpenAI, Anthropic, Gemini ou Azure) e a falta de uma chave é comunicada antes de qualquer pedido ser enviado.
dsh-vision-recognizer
kaixinbaba/dsh-vision-recognizer
Rota de provedor de visão que transcreve imagens anexadas em texto por meio de um modelo configurável (mais de 15 fornecedores compatíveis com OpenAI e Anthropic) enquanto o DeepSeek continua respondendo.
dsh-vision (vision-route)
314857493/dsh-vision
Registra uma rota de provedor `deepseek-vision`: a interface Web aceita imagens coladas e as transcreve para texto pela API de visão Zhipu GLM gratuita antes de delegar ao adaptador DeepSeek.
dsh-vision-bridge
ximengxiaolan/dsh-vision-bridge
Imagens anexadas no compositor são transcritas para texto por um modelo de visão compatível com OpenAI antes de chegar aos modelos DeepSeek somente de texto
dsh-mmroute
jmxsxwyzjdwl/dsh-mmroute
Roteamento multimodal transparente para modelos somente de texto: cada imagem em cada chamada de modelo é totalmente transcrita (OCR literal, dados, zonas de incerteza, reforçado contra injeção) pelo seu próprio compreensor multimodal, com nova observação focada via vision_relook e nova tentativa automática em falhas relacionadas a imagens. Sem endpoints incluídos, sem logins emprestados.
dsh-audio-copilot
ai-yucheng/dsh-audio-copilot
Audio Copilot para o DeepSeek Harness: transcreve áudio (ASR) e sintetiza fala (TTS) — dá aos agentes somente texto ouvidos e voz. TTS SAPI local do Windows pronto para uso; endpoints ASR/TTS compatíveis com OpenAI configuráveis. Inclui entrada de voz no compositor.
dsh-vision
314857493/dsh-vision
Plugin do DeepSeek Harness: uma rota `deepseek-vision` que declara entrada de imagem e transcreve imagens coladas por meio dos modelos de visão gratuitos Zhipu GLM antes de delegar ao adaptador DeepSeek.
dsh-voice-mimo
ch1bug/dsh-voice-mimo
Xiaomi MiMo-powered voice for DeepSeek Harness: browser 🎤/🧠/🔊 UI, voice_transcribe/voice_understand/voice_speak tools, configurable voice map (preset/voicedesign/voiceclone). Fork of zhuiyueya/dsh-voice (MIT), Settings pattern from Anionex/dsh-vision-toolkit (MIT).
dsh-voice-input-en
mohith-das/dsh-voice-input-en
Minimal English-only voice input for the DeepSeek Harness Web UI: a mic button in the composer that transcribes speech into the draft via the browser's native SpeechRecognition API. No dependencies, no subprocess, no network calls beyond whatever the brow
dsh-vision-pro-bridge
shainedemo/dsh-vision-pro-bridge
Vision bridge for text-only DeepSeek models: transcribes attached images with deepseek-v4-flash-vision-exp before they reach deepseek-v4-pro, with no third-party dependencies.
dsh-autovision
junkrat9527/dsh-autovision
Vision for text-only dsh models: paste an image and a configured multimodal model transcribes it to text automatically — transparent twin routing, an agent-callable read-image tool, no built-in keys or relay.
dsh-voice-input
newdanew/dsh-voice-input
Voice input for the web UI: a mic button in the composer that transcribes speech into the draft via the Web Speech API, with an optional auto-send toggle.
dsh-plugin-image-input
elohia/dsh-plugin-image-input
Image-to-text input for the Web UI: paste or drag an image and it is transcribed into structured text and sent, giving text-only LLMs image-input takeover (OpenAI-compatible vision API).