Pular para o conteúdo principal

Visão, voz e multimodal

Os plugins de Visão, voz e multimodal dão olhos, ouvidos e voz aos modelos DeepSeek somente texto no DeepSeek-Harness (dsh). Encontre ferramentas de visão e rotas de provedor que fazem OCR e descrevem capturas coladas via Zhipu GLM, Gemini, Doubao ou Ollama local, entrada de voz por microfone via Web Speech API do navegador ou APIs compatíveis com Whisper, leitura em voz alta com Edge TTS ou vozes personalizadas, modos de voz full-duplex, e geradores de imagens, vídeo e música.

312 plugins encontrados

1

dsh-vision-sidecar

121103qwq/dsh-vision-sidecar

Sidecar de visão gratuito e hospedado para o DeepSeek Harness, com evidências duráveis por sessão

4há 2 mesesVisão, voz e multimodalMIT
Y

dsh-image-subagent

yuqingsh/dsh-image-subagent

4há 2 mesesVisão, voz e multimodalMIT
G

dsh-vision-bridge

gxx182/dsh-vision-bridge

Conecta imagens da sessão a provedores de visão configuráveis e retorna análise somente texto para rotas de modelos elegíveis do DeepSeek Harness.

4há 2 mesesVisão, voz e multimodalMIT
H

dsh-omni-workstation

huashenglian/dsh-omni-workstation

Estação de trabalho omni-modal para o DSH: analyze_image sobre uma cadeia ordenada de vários cartões VLM com comutação de recurso, um conjunto de seis ferramentas de visão (zoom, amostragem de cor, diff de píxeis, OCR, deteção de elementos, apresentação inline) que partilham o mesmo resolvedor de imagens, generate_image sobre protocolos OpenAI/DashScope/ComfyUI, generate_video assíncrono com vários cartões e um construtor /build-video-tool, e TTS speak/clone_voice sobre sete fornecedores, tudo controlado por uma única página de definições com gravação automática.

3há 14 diasVisão, voz e multimodalMIT
W

dsh-hold-to-talk

wangzhanchao883/dsh-hold-to-talk

Entrada com uma só mão e sem teclado para o compositor: prima e mantenha o rato na caixa de entrada, fale, largue — o texto fica no rascunho, e deslizar para cima cancela sem deixar uma meia frase para trás. Não há botão de microfone para acertar nem atalho para memorizar; a mão nunca precisa de sair da área de entrada, o que é essencial quando a outra mão está ocupada. O reconhecimento corre totalmente offline (SenseVoice via sherpa-onnx, sem chave de API, o áudio nunca sai da máquina).

3ontemVisão, voz e multimodalMIT
N

dsh-plugin-speech

nakamuraia/dsh-plugin-speech

Lê em voz alta as respostas do assistente no DeepSeek Harness: provedores de texto para fala com reprodução em streaming.

3há 18 diasVisão, voz e multimodalMIT
S

dsh-voice-assistant

supersyh-sss/dsh-voice-assistant

Assistente de voz para o dsh web: diga a frase de ativação (por exemplo, «小鲸») para ativar o ditado mãos-livres — o que diz é transcrito e escrito automaticamente na caixa de conversa. Suporta comandos de edição falados (enviar, limpar, nova linha, parar de ler) e lê em voz alta as respostas do assistente em chinês. O reconhecimento de fala corre localmente no navegador via sherpa-onnx WASM, pelo que funciona offline sem chave de API.

3mês passadoVisão, voz e multimodalMIT
S

dsh-audiogen

shimingming520/dsh-audiogen

Geração de áudio por IA para a GUI web do DeepSeek Harness — TTS multiforncedor, música, efeitos sonoros e design de voz com painel lateral, comparação de modelos, biblioteca de recursos e ferramentas Agent.

3há 24 diasVisão, voz e multimodalApache-2.0
L

dsh-voco

lgquan/dsh-voco

Conversas de voz contínuas para DSH com escuta mãos-livres, push-to-talk, reconhecimento de fala, respostas TTS e delegação de Agent em segundo plano.

3mês passadoVisão, voz e multimodalMIT
T

dsh-gsv

taoruiliu19/dsh-gsv

TTS local em tempo real para DeepSeek Harness: predefinições de voz, leitura automática, assistente de configuração do motor, botão de leitura em voz alta e um painel de configurações para o motor GSV-TTS-Lite.

3mês passadoVisão, voz e multimodalMIT
J

dsh-ximalaya

jerryqx/dsh-ximalaya

Ouça podcasts e audiolivros do Ximalaya dentro da interface web do DSH: pesquise álbuns, navegue por faixas paginadas e reproduza através de uma barra de reprodução atual (anterior/reproduzir/seguinte, avanço, volume, velocidade). Após o início de sessão por QR, a página «Meus» lista as faixas que gostou (clique para reproduzir), os álbuns subscritos com indicações do episódio mais recente, e os locutores seguidos com os seus álbuns públicos; o host retransmite os fluxos de áudio com suporte de Range e regista uma ferramenta `ximalaya_play` para que o agente possa pesquisar e reproduzir a pedido.

3mês passadoVisão, voz e multimodalMIT
B

phone-eye

boheastill/phone-eye

Permita que o seu agente de IA veja e opere um telemóvel Android real: phone_look (fusão de visão + árvore de UI), tap/swipe/type, captura de ecrã — sobre adb, para qualquer cliente MCP.

3mês passadoVisão, voz e multimodalMIT
X

dsh-image-vision

xiaoyuink/dsh-image-vision

Compreensão de imagens para qualquer modelo do DSH: ferramentas de visão, OCR, grounding e recorte com presets de domínio para histopatologia, biologia celular, anatomia, imagens clínicas e figuras científicas.

3há 29 diasVisão, voz e multimodal
L

Deepseek-Continuity

linxuhao/deepseek-continuity

Geração local de imagem, voz, música e SFX, além de transcrição, com identidade fixada: personagens, animais, objetos e vozes de atores são definidos uma vez e reutilizados em cada chamada posterior; a saída degenerada (imagem quase plana, áudio silencioso) é rejeitada em vez de retornada como sucesso, e uma linha gerada pode ser lida de volta como texto, para que um clone que engoliu seu final se torne visível. Os motores descarregam quando ociosos, e a geração de imagens e a transcrição podem cada uma apontar para uma API no formato OpenAI em vez do backend local Vulkan.

3há 12 diasVisão, voz e multimodalMIT
Y

dsh-ui-spec

yumimanji/dsh-ui-spec

Plugin do DeepSeek Harness que transforma capturas de tela de UI em especificações web de nível de implementação usando OCR, geometria determinística, grafos de cena, assets e comparação de renderização.

3há 2 mesesVisão, voz e multimodalMIT
D

deepseekeyes

dttxorg/deepseekeyes

Runtime de visão auditável e Computer Use multiplataforma para DeepSeek Harness com evidência que preserva a fonte.

3há 2 mesesVisão, voz e multimodalMIT
N

voco-input-sh

nothree-code/voco-input-sh

Entrada por voz para a Web UI: um botão de microfone que aciona o reconhecimento de fala offline local VocoType e insere automaticamente o texto reconhecido no compositor (implantação automática, deduplicação, ditado contínuo).

3há 20 diasVisão, voz e multimodalMIT
B

dsh-stt-input

baisama-cloud/dsh-stt-input

Entrada de voz speech-to-text para a Web UI: um botão de microfone no compositor transcreve a fala para o rascunho via Web Speech API do navegador (sem configuração) ou uma API Whisper compatível com OpenAI (OpenAI / Groq), com modelo e idioma selecionáveis em Configurações.

3mês passadoVisão, voz e multimodalMIT
W

visual-review

wang-bool/visual-review

Renderiza imagens coladas ou enviadas diretamente no chat do DSH Web e dá visão a modelos apenas de texto: a ferramenta visual_review, invocável pelo modelo, chama primeiro qualquer API multimodal compatível com OpenAI e, se falhar, recorre a um worker local do Qwen3-VL.

3há 2 mesesVisão, voz e multimodalMIT
T

dsh-plugins (dsh-vision)

tzhr-invest/dsh-plugins

Ferramenta de visão invocável pelo agente que descreve imagens locais por meio de qualquer endpoint de visão compatível com OpenAI que você configurar, com verificação cruzada opcional de vários modelos e sem chaves embutidas.

3há 5 diasVisão, voz e multimodalMIT
S

dsh-plugin-multimodal

shinjiyu/dsh-plugin-multimodal

Anuncia a colagem de imagens em rotas do DeepSeek somente de texto, descreve anexos com um sidecar de visão e deixa os modelos de visão nativos intactos.

3há 2 mesesVisão, voz e multimodalMIT
M

dsh-vision-tools

moon09300731/dsh-vision-tools

Pacote completo de capacidades de visão para DeepSeek Harness: uma ferramenta vision_understand (APIs de visão compatíveis com OpenAI, Zhipu GLM-4V-Flash gratuito por padrão) além de pontos de entrada de colar/arrastar e soltar/botão para reconhecimento de imagens.

3há 2 mesesVisão, voz e multimodalMIT
L

dsh-plugin-grok2api-media-tool

lsjspl/dsh-plugin-grok2api-media-tool

Dá ao dsh a capacidade de gerar imagens e vídeos por meio da API grok2api.

3mês passadoVisão, voz e multimodal
L

dsh-image-gen

leemancheung/dsh-image-gen

`image_gen` do GPT Image 2 com OAuth da assinatura Codex por padrão ou modo explícito de chave de API: cartão em desenvolvimento, até três parciais de API ao vivo, replay persistente de anexos / lightbox / download, saída de modelo apenas texto e solicitações limitadas e seguras com credenciais.

3há 6 diasVisão, voz e multimodalMIT