- Início
- Categorias
- Visão, voz e multimodal
Visão, voz e multimodal
Os plugins de Visão, voz e multimodal dão olhos, ouvidos e voz aos modelos DeepSeek somente texto no DeepSeek-Harness (dsh). Encontre ferramentas de visão e rotas de provedor que fazem OCR e descrevem capturas coladas via Zhipu GLM, Gemini, Doubao ou Ollama local, entrada de voz por microfone via Web Speech API do navegador ou APIs compatíveis com Whisper, leitura em voz alta com Edge TTS ou vozes personalizadas, modos de voz full-duplex, e geradores de imagens, vídeo e música.
312 plugins encontrados
dsh-vision-sidecar
121103qwq/dsh-vision-sidecar
Sidecar de visão gratuito e hospedado para o DeepSeek Harness, com evidências duráveis por sessão
dsh-image-subagent
yuqingsh/dsh-image-subagent
dsh-vision-bridge
gxx182/dsh-vision-bridge
Conecta imagens da sessão a provedores de visão configuráveis e retorna análise somente texto para rotas de modelos elegíveis do DeepSeek Harness.
dsh-omni-workstation
huashenglian/dsh-omni-workstation
Estação de trabalho omni-modal para o DSH: analyze_image sobre uma cadeia ordenada de vários cartões VLM com comutação de recurso, um conjunto de seis ferramentas de visão (zoom, amostragem de cor, diff de píxeis, OCR, deteção de elementos, apresentação inline) que partilham o mesmo resolvedor de imagens, generate_image sobre protocolos OpenAI/DashScope/ComfyUI, generate_video assíncrono com vários cartões e um construtor /build-video-tool, e TTS speak/clone_voice sobre sete fornecedores, tudo controlado por uma única página de definições com gravação automática.
dsh-hold-to-talk
wangzhanchao883/dsh-hold-to-talk
Entrada com uma só mão e sem teclado para o compositor: prima e mantenha o rato na caixa de entrada, fale, largue — o texto fica no rascunho, e deslizar para cima cancela sem deixar uma meia frase para trás. Não há botão de microfone para acertar nem atalho para memorizar; a mão nunca precisa de sair da área de entrada, o que é essencial quando a outra mão está ocupada. O reconhecimento corre totalmente offline (SenseVoice via sherpa-onnx, sem chave de API, o áudio nunca sai da máquina).
dsh-plugin-speech
nakamuraia/dsh-plugin-speech
Lê em voz alta as respostas do assistente no DeepSeek Harness: provedores de texto para fala com reprodução em streaming.
dsh-voice-assistant
supersyh-sss/dsh-voice-assistant
Assistente de voz para o dsh web: diga a frase de ativação (por exemplo, «小鲸») para ativar o ditado mãos-livres — o que diz é transcrito e escrito automaticamente na caixa de conversa. Suporta comandos de edição falados (enviar, limpar, nova linha, parar de ler) e lê em voz alta as respostas do assistente em chinês. O reconhecimento de fala corre localmente no navegador via sherpa-onnx WASM, pelo que funciona offline sem chave de API.
dsh-audiogen
shimingming520/dsh-audiogen
Geração de áudio por IA para a GUI web do DeepSeek Harness — TTS multiforncedor, música, efeitos sonoros e design de voz com painel lateral, comparação de modelos, biblioteca de recursos e ferramentas Agent.
dsh-voco
lgquan/dsh-voco
Conversas de voz contínuas para DSH com escuta mãos-livres, push-to-talk, reconhecimento de fala, respostas TTS e delegação de Agent em segundo plano.
dsh-gsv
taoruiliu19/dsh-gsv
TTS local em tempo real para DeepSeek Harness: predefinições de voz, leitura automática, assistente de configuração do motor, botão de leitura em voz alta e um painel de configurações para o motor GSV-TTS-Lite.
dsh-ximalaya
jerryqx/dsh-ximalaya
Ouça podcasts e audiolivros do Ximalaya dentro da interface web do DSH: pesquise álbuns, navegue por faixas paginadas e reproduza através de uma barra de reprodução atual (anterior/reproduzir/seguinte, avanço, volume, velocidade). Após o início de sessão por QR, a página «Meus» lista as faixas que gostou (clique para reproduzir), os álbuns subscritos com indicações do episódio mais recente, e os locutores seguidos com os seus álbuns públicos; o host retransmite os fluxos de áudio com suporte de Range e regista uma ferramenta `ximalaya_play` para que o agente possa pesquisar e reproduzir a pedido.
phone-eye
boheastill/phone-eye
Permita que o seu agente de IA veja e opere um telemóvel Android real: phone_look (fusão de visão + árvore de UI), tap/swipe/type, captura de ecrã — sobre adb, para qualquer cliente MCP.
dsh-image-vision
xiaoyuink/dsh-image-vision
Compreensão de imagens para qualquer modelo do DSH: ferramentas de visão, OCR, grounding e recorte com presets de domínio para histopatologia, biologia celular, anatomia, imagens clínicas e figuras científicas.
Deepseek-Continuity
linxuhao/deepseek-continuity
Geração local de imagem, voz, música e SFX, além de transcrição, com identidade fixada: personagens, animais, objetos e vozes de atores são definidos uma vez e reutilizados em cada chamada posterior; a saída degenerada (imagem quase plana, áudio silencioso) é rejeitada em vez de retornada como sucesso, e uma linha gerada pode ser lida de volta como texto, para que um clone que engoliu seu final se torne visível. Os motores descarregam quando ociosos, e a geração de imagens e a transcrição podem cada uma apontar para uma API no formato OpenAI em vez do backend local Vulkan.
dsh-ui-spec
yumimanji/dsh-ui-spec
Plugin do DeepSeek Harness que transforma capturas de tela de UI em especificações web de nível de implementação usando OCR, geometria determinística, grafos de cena, assets e comparação de renderização.
deepseekeyes
dttxorg/deepseekeyes
Runtime de visão auditável e Computer Use multiplataforma para DeepSeek Harness com evidência que preserva a fonte.
voco-input-sh
nothree-code/voco-input-sh
Entrada por voz para a Web UI: um botão de microfone que aciona o reconhecimento de fala offline local VocoType e insere automaticamente o texto reconhecido no compositor (implantação automática, deduplicação, ditado contínuo).
dsh-stt-input
baisama-cloud/dsh-stt-input
Entrada de voz speech-to-text para a Web UI: um botão de microfone no compositor transcreve a fala para o rascunho via Web Speech API do navegador (sem configuração) ou uma API Whisper compatível com OpenAI (OpenAI / Groq), com modelo e idioma selecionáveis em Configurações.
visual-review
wang-bool/visual-review
Renderiza imagens coladas ou enviadas diretamente no chat do DSH Web e dá visão a modelos apenas de texto: a ferramenta visual_review, invocável pelo modelo, chama primeiro qualquer API multimodal compatível com OpenAI e, se falhar, recorre a um worker local do Qwen3-VL.
dsh-plugins (dsh-vision)
tzhr-invest/dsh-plugins
Ferramenta de visão invocável pelo agente que descreve imagens locais por meio de qualquer endpoint de visão compatível com OpenAI que você configurar, com verificação cruzada opcional de vários modelos e sem chaves embutidas.
dsh-plugin-multimodal
shinjiyu/dsh-plugin-multimodal
Anuncia a colagem de imagens em rotas do DeepSeek somente de texto, descreve anexos com um sidecar de visão e deixa os modelos de visão nativos intactos.
dsh-vision-tools
moon09300731/dsh-vision-tools
Pacote completo de capacidades de visão para DeepSeek Harness: uma ferramenta vision_understand (APIs de visão compatíveis com OpenAI, Zhipu GLM-4V-Flash gratuito por padrão) além de pontos de entrada de colar/arrastar e soltar/botão para reconhecimento de imagens.
dsh-plugin-grok2api-media-tool
lsjspl/dsh-plugin-grok2api-media-tool
Dá ao dsh a capacidade de gerar imagens e vídeos por meio da API grok2api.
dsh-image-gen
leemancheung/dsh-image-gen
`image_gen` do GPT Image 2 com OAuth da assinatura Codex por padrão ou modo explícito de chave de API: cartão em desenvolvimento, até três parciais de API ao vivo, replay persistente de anexos / lightbox / download, saída de modelo apenas texto e solicitações limitadas e seguras com credenciais.