Pular para o conteúdo principal

Visão, voz e multimodal

Os plugins de Visão, voz e multimodal dão olhos, ouvidos e voz aos modelos DeepSeek somente texto no DeepSeek-Harness (dsh). Encontre ferramentas de visão e rotas de provedor que fazem OCR e descrevem capturas coladas via Zhipu GLM, Gemini, Doubao ou Ollama local, entrada de voz por microfone via Web Speech API do navegador ou APIs compatíveis com Whisper, leitura em voz alta com Edge TTS ou vozes personalizadas, modos de voz full-duplex, e geradores de imagens, vídeo e música.

312 plugins encontrados

H

dsh-vision-mix

haiziyao/dsh-vision-mix

Combine APIs de texto, visão e geração de imagens em um modelo Mix único com roteamento automático: solicitações só de texto vão para o modelo de chat, imagens do usuário e capturas do agente vão para o modelo de visão, acompanhamentos continuam usando a mesma imagem de sessão, e agentes podem gerar ou editar imagens com histórico de chamadas no escopo da sessão.

3há 25 diasVisão, voz e multimodalMIT
O

dsh-ernie-image

omdsh-dev/dsh-ernie-image

3há 2 mesesVisão, voz e multimodalBSD-3-Clause
Z

openflowframes

zerohackz/openflowframes

3há 2 mesesVisão, voz e multimodalGPL-3.0
O

dsh-paddle-ocr

omdsh-dev/dsh-paddle-ocr

3há 2 mesesVisão, voz e multimodalBSD-3-Clause
H

dsh-plugin-aigc-canvas

huanlinoto/dsh-plugin-aigc-canvas

Ponte HTTP AIGC agnóstica de provider + tela infinita + pós-processamento com ffmpeg, com 13 ferramentas incluindo conexão de nós na tela / reroll / edição de mídia.

3há 2 mesesVisão, voz e multimodal
J

dsh-voice

jesse-njx/dsh-voice

Notas de voz na entrada, respostas faladas na saída: dite áudio que se torna mensagens de usuário (transcrever), faça o agente ler as respostas em voz alta (falar), local-first em ~/.dsh/voice

3há 2 mesesVisão, voz e multimodalMIT
E

dsh-llm-vision-bridge

einskyle/dsh-llm-vision-bridge

Ponte de visão nativa do provedor LLM: imagens coladas no chat são descritas por um modelo de visão (Qwen3-VL via pi-ai/llama.cpp), e a descrição em texto é enviada ao DeepSeek somente de texto para a resposta — admissão de imagem, roteamento e compactação passam pelos mecanismos nativos do harness, com cache de descrições LRU e nova tentativa em erro 503

3há 2 mesesVisão, voz e multimodalMIT
Q

dsh-mic-input

qt-chen/dsh-mic-input

Entrada de voz por microfone para o compositor: transcrição ao vivo via Web Speech API do navegador, deduplicação/continuação automática, pontuação inteligente, e configurações de idioma e envio automático

3há 2 mesesVisão, voz e multimodalMIT
H

dsh-open-eyes

hyper-dsh-plugins/dsh-open-eyes

Ponte de visão para rotas DeepSeek apenas de texto que analisa imagens anexadas e locais por endpoints configuráveis OpenAI Responses, Chat Completions ou Anthropic Messages, deixando as rotas com capacidade de imagem nativas.

2há 27 diasVisão, voz e multimodalMIT
C

dsh-gpt-image

cai-mh/dsh-gpt-image

Gera imagens por meio de uma sessão web do ChatGPT autenticada e as baixa para um diretório local.

2há 24 diasVisão, voz e multimodalMIT
M

dsh-ui-mockup

mackwan84/dsh-ui-mockup

Consumer da ferramenta ui_mockup: gera wireframes e esboços de alta fidelidade de UI na fase de discussão, salva o design em disco, pede confirmação e bloqueia a especificação de design; inclui cartões de cliente, roteamento de imagens e i18n.

2há 22 diasVisão, voz e multimodalMIT
B

dsh-voice-call

biliye/dsh-voice-call

Assistente de chamada de voz para a GUI web do DSH: uma bola de chamada flutuante e arrastável, VAD no navegador que envia cada fala após uma pausa, reconhecimento de fala FunASR HTTP ou em streaming, respostas TTS da MiniMax ou compatíveis com OpenAI, um modo opcional de palavra de ativação com suspensão automática e despacho de tarefas para sessões de subagente separadas com progresso, parada e relatórios falados de conclusão.

2há 5 diasVisão, voz e multimodalMIT
Y

dsh-tool-lipsync

yu-wenchao/dsh-tool-lipsync

Plugin de geração de vídeo com sincronização labial gratuito para DSH com mais de 3000 vozes e mais de 500 idiomas.

2há 28 diasVisão, voz e multimodalMIT
B

dsh-vision-plugin

bug-huntter/dsh-vision-plugin

Reconhecimento de imagens configurável para modelos DSH somente de texto: as mensagens de imagem são primeiro transcritas por um modelo de visão compatível com OpenAI (URL base, ID do modelo e chave API definidos numa secção de Definições) e depois passadas ao modelo principal como texto, enquanto o suporte a entrada de imagem é anunciado. O esquema de autenticação por chave API é selecionável (cabeçalhos de pedido estilo OpenAI, Anthropic, Gemini ou Azure) e a falta de uma chave é comunicada antes de qualquer pedido ser enviado.

2há 5 diasVisão, voz e multimodalMIT
B

dseyesopen

balue8246-maker/dseyesopen

Ponte de visão para DeepSeek somente de texto: envie imagens (sozinhas ou misturadas com texto) e um modelo de visão pequeno e rápido as descreve nos bastidores; o chat mantém a imagem, o DeepSeek vê apenas texto. Plugin puro: a desinstalação restaura tudo.

2mês passadoVisão, voz e multimodal
L

dsh-visibridge

lhbsaa/dsh-visibridge

Evidência visual estruturada (OCR/layout/semântica) além de uma ferramenta de captura por câmera USB para um loop de depuração "atirar-olhar-ajustar"; backends: Ollama, DeepSeek, Xiaomi.

2mês passadoVisão, voz e multimodalMIT
F

dsh-short-video-studio

fengyungithub/dsh-short-video-studio

Estação de trabalho de criação de vídeo com IA ao estilo MiniMax-Design, baseada no deepseek harness.

2mês passadoVisão, voz e multimodalApache-2.0
Z

dsh-watch-video

zeshuochen/dsh-watch-video

Transcrição de vídeo com prioridade a legendas e exportação SRT, controlos de tarefas canceláveis, e recurso a faster-whisper large-v3 quando não existem legendas.

2mês passadoVisão, voz e multimodal
W

dsh-voice-agent (voice-app)

wayneyu430/dsh-voice-agent

Um agente de frontend de voz conversacional para o dsh: fale naturalmente pelo ByteDance Duplex, delegue requisições a tarefas em segundo plano e ouça seus resultados assíncronos relatados por voz.

2mês passadoVisão, voz e multimodal
M

dsh-voice-chat

maoyuching/dsh-voice-chat

Chat de voz estilo Doubao para DSH: segurar o microfone do compositor converte a fala em texto e envia automaticamente, e as respostas da IA são lidas em voz alta. Condensação opcional por LLM (respostas longas resumidas em falas curtas, seguindo o modelo da conversa atual), limpeza de texto amigável ao TTS, vozes Edge TTS selecionáveis, parada automática por silêncio ajustável e configurações embutidas no diálogo de configurações do DSH.

2há 8 diasVisão, voz e multimodalMIT
Y

phone-lens (phone-lens)

yxqfg/phone-lens

Transforma a câmara de um telefone num visor ao vivo e entrada de fotos para a sua sessão dsh, via LAN ou USB.

2há 3 diasVisão, voz e multimodalMIT
M

dsh-capture

max-null/dsh-capture

Captura de tela de motor duplo para DSH: dentro do shell de desktop SSiD, um atalho global ou a bandeja abre uma sobreposição de seleção por caixa em tela cheia (todos os monitores, quadros pixel-perfeitos por tela) com anotação de caixa vermelha no próprio local e uma barra de ferramentas estilo WeChat; no DSH simples (navegador), o botão de câmera do compositor captura a tela via getDisplayMedia e reutiliza na página a mesma sobreposição de seleção por caixa + anotação em fase única. A imagem recortada chega ao compositor da conversa atual através do fluxo oficial de anexos.

2há 4 diasVisão, voz e multimodalMIT
Y

phone-lens (lens-mate)

yxqfg/phone-lens

Transforma a câmera de um celular em visor ao vivo e entrada de fotos para a sua sessão dsh, por LAN ou USB.

2mês passadoVisão, voz e multimodalMIT
E

dsh-labnana

exoticknight/dsh-labnana

Geração de imagens Labnana para o DeepSeek Harness: texto para imagem / imagem para imagem / edição precisa com estimativa de créditos, saldo de assinatura e interface de configurações web.

2há 9 diasVisão, voz e multimodalApache-2.0