- Início
- Categorias
- Visão, voz e multimodal
Visão, voz e multimodal
Os plugins de Visão, voz e multimodal dão olhos, ouvidos e voz aos modelos DeepSeek somente texto no DeepSeek-Harness (dsh). Encontre ferramentas de visão e rotas de provedor que fazem OCR e descrevem capturas coladas via Zhipu GLM, Gemini, Doubao ou Ollama local, entrada de voz por microfone via Web Speech API do navegador ou APIs compatíveis com Whisper, leitura em voz alta com Edge TTS ou vozes personalizadas, modos de voz full-duplex, e geradores de imagens, vídeo e música.
312 plugins encontrados
dsh-tts
goodandready/dsh-tts
Fala as respostas do agente na interface web do DeepSeek Harness por meio de uma cadeia de fallback de provedores (OpenAI, ElevenLabs, Google, Azure, Groq, Deepgram, OpenRouter, Edge, Piper, eSpeak), para que um provedor com falha ou com limite de taxa passe para o próximo em vez de ficar em silêncio.
DSH-dseyes
okkay712/dsh-dseyes
Anexos de imagem nativos para DeepSeek somente texto na Web GUI: imagens coladas ou arrastadas aparecem como miniaturas na sessão e, antes do envio, o host as lê com a API de visão gratuita Zhipu GLM-4V-Flash (cadeia de fallback glm-4v-flash) e substitui pela descrição, permitindo que o DeepSeek responda sobre a imagem enquanto o original permanece no histórico.
dsh-wm
waynejin0918/dsh-wm
Kit de ferramentas de pesquisa de modelos do mundo: inspeciona frames, nomeia rotas 3D/pixel/latentes, pontua pred vs GT e competências RSI / wm.yaml.
dsh-tool-visual-primitives
inkshadewoods/dsh-tool-visual-primitives
Analisa imagens de conversa por meio de prompts específicos por modo (caption, UI, documento, grounding, topologia etc.) e injeta evidências estruturadas com primitivas de coordenadas (caixas, pontos, referências) como texto, com cache em nível de sessão para reutilização em replay e compaction.
dsh-smart-input
v-quest123456/dsh-smart-input
Plugin de entrada inteligente para DeepSeek Harness — entrada de voz + otimização de prompts
dsh-vision-bridge
goodandready/dsh-vision-bridge
Encaminha imagens para um modelo de visão à sua escolha — reescrita automática, ferramentas explícitas ou híbrido — para que um modelo de chat apenas de texto não falhe em um turno que contenha uma imagem.
muxiva-dsh-voice
piyotahu/muxiva-dsh-voice
Voz full-duplex local-first para DeepSeek Harness, orquestrada por Muxiva
dsh-voice-call
pandapolo/dsh-voice-call
Chamadas de voz iniciadas pelo agente: `offer_call` faz o humano tocar (接听/拒接/稍后再说); as chamadas aceitas são sintetizadas e reproduzidas localmente com CrispASR + Qwen3-TTS (9 vozes, 2 dialetos chineses), e as rejeitadas devolvem a decisão ao agente.
dsh-fish-tts
mari23333/dsh-fish-tts
Lê em voz alta as respostas do assistente apenas via a API Fish Audio (traga sua própria chave): leitura por mensagem, alternância de leitura automática e uma página de configurações para modelo, reference_id da voz, chave de API criptografada e proxy.
dsh-vision
xiaoshihou514/dsh-vision
Extensão nativa de capacidade de visão, usando Zhipu (grátis) ou Qwen-VL (local).
dsh-vision-recognizer
kaixinbaba/dsh-vision-recognizer
Rota de provedor de visão que transcreve imagens anexadas em texto por meio de um modelo configurável (mais de 15 fornecedores compatíveis com OpenAI e Anthropic) enquanto o DeepSeek continua respondendo.
dsh-open-eyes
hyp6666/dsh-open-eyes
Ponte de visão para rotas do DeepSeek apenas texto que analisa imagens anexadas e locais por endpoints configuráveis do OpenAI Responses, Chat Completions ou Anthropic Messages, enquanto mantém nativas as rotas com suporte a imagem.
dsh-youreyes
54xkeee/dsh-youreyes
Kit de visão para DeepSeek apenas texto: ferramenta `vision` invocável pelo modelo, adaptadores wrapper para deepseek/opencode-go (v4 flash/pro), cota do Antigravity IDE (default, flash/pro) / qualquer VLM compatível com OpenAI / Gemini / canais locais do Ollama, memória de evidências com reidratação por compactação, cache de hash de conteúdo e um painel de cliente bilíngue.
dsh-vision (vision-tool)
314857493/dsh-vision
Ferramenta `vision` invocável pelo modelo para o DeepSeek Harness: descreve e faz OCR de arquivos de imagem chamando diretamente a API de visão Zhipu GLM gratuita (cadeia de fallback glm-4v-flash), sem precisar de CLI externo.
dsh-vision (vision-route)
314857493/dsh-vision
Registra uma rota de provedor `deepseek-vision`: a interface Web aceita imagens coladas e as transcreve para texto pela API de visão Zhipu GLM gratuita antes de delegar ao adaptador DeepSeek.
dsh-vision-bridge
ximengxiaolan/dsh-vision-bridge
Imagens anexadas no compositor são transcritas para texto por um modelo de visão compatível com OpenAI antes de chegar aos modelos DeepSeek somente de texto
dsh-live2d-voice
john-walks-slow/dsh-live2d-voice
Live2D session view with realtime voice: continuous voice input, streaming TTS, subtitle translation, multi-model catalog, standalone entry / Live2D 实时语音会话视图:连续语音输入、流式 TTS、字幕翻译、多模型目录、独立入口
dsh-multi-tts
wyr-233/dsh-multi-tts
Per-reply read-aloud with a multi-provider settings page — MiniMax or any OpenAI-compatible /audio/speech endpoint, with voice, emotion, speed and model selection plus an auto-read toggle.
dsh-live-voice
victorwads/dsh-live-voice
Local-first voice conversations for DSH, with local speech recognition and synthesis and optional external providers.
dsh-vision-autoswitch
cultofluna/dsh-vision-autoswitch
DeepSeek Harness plugin: auto-route image-bearing requests to deepseek-v4-flash-vision-exp, then fall back to the original model.
dsh-dictate
navneetset/dsh-dictate
Live speech-to-text dictation into the dsh web composer via OpenRouter STT
dsh-minimax-asr
moluyao/dsh-minimax-asr
MiniMax 语音识别(asr-1.0)+ 语音合成(speech-2.8-hd)的 DeepSeek Harness 全局插件:转写工具、任务结束后用喇叭念一句的播报、实时免手对话、303 个音色可选
dsh-imgdraw
ninjasln-labs/dsh-imgdraw
Text-to-image for DeepSeek Harness: a `draw_image` model tool, an input-bar 生图 button with a prompt popup (async generation, 4-grid results, download / keep / delete), an /imgdraw image route, and persisted history. Backends: DashScope wan2.7-image (free
dsh-voice-talk
duoduoqian708/dsh-voice-talk
Voice conversation mode for the DSH Web GUI: tap the mic to start a full-screen call, talk hands-free, and hear each reply read aloud as it streams. Bilingual (Chinese/English) UI, light and dark themes, adjustable speech rate, and switchable voices.