- Início
- Categorias
- Visão, voz e multimodal
Visão, voz e multimodal
Os plugins de Visão, voz e multimodal dão olhos, ouvidos e voz aos modelos DeepSeek somente texto no DeepSeek-Harness (dsh). Encontre ferramentas de visão e rotas de provedor que fazem OCR e descrevem capturas coladas via Zhipu GLM, Gemini, Doubao ou Ollama local, entrada de voz por microfone via Web Speech API do navegador ou APIs compatíveis com Whisper, leitura em voz alta com Edge TTS ou vozes personalizadas, modos de voz full-duplex, e geradores de imagens, vídeo e música.
312 plugins encontrados
dsh-vision-mix
haiziyao/dsh-vision-mix
Combine APIs de texto, visão e geração de imagens em um modelo Mix único com roteamento automático: solicitações só de texto vão para o modelo de chat, imagens do usuário e capturas do agente vão para o modelo de visão, acompanhamentos continuam usando a mesma imagem de sessão, e agentes podem gerar ou editar imagens com histórico de chamadas no escopo da sessão.
dsh-ernie-image
omdsh-dev/dsh-ernie-image
openflowframes
zerohackz/openflowframes
dsh-paddle-ocr
omdsh-dev/dsh-paddle-ocr
dsh-plugin-aigc-canvas
huanlinoto/dsh-plugin-aigc-canvas
Ponte HTTP AIGC agnóstica de provider + tela infinita + pós-processamento com ffmpeg, com 13 ferramentas incluindo conexão de nós na tela / reroll / edição de mídia.
dsh-voice
jesse-njx/dsh-voice
Notas de voz na entrada, respostas faladas na saída: dite áudio que se torna mensagens de usuário (transcrever), faça o agente ler as respostas em voz alta (falar), local-first em ~/.dsh/voice
dsh-llm-vision-bridge
einskyle/dsh-llm-vision-bridge
Ponte de visão nativa do provedor LLM: imagens coladas no chat são descritas por um modelo de visão (Qwen3-VL via pi-ai/llama.cpp), e a descrição em texto é enviada ao DeepSeek somente de texto para a resposta — admissão de imagem, roteamento e compactação passam pelos mecanismos nativos do harness, com cache de descrições LRU e nova tentativa em erro 503
dsh-mic-input
qt-chen/dsh-mic-input
Entrada de voz por microfone para o compositor: transcrição ao vivo via Web Speech API do navegador, deduplicação/continuação automática, pontuação inteligente, e configurações de idioma e envio automático
dsh-open-eyes
hyper-dsh-plugins/dsh-open-eyes
Ponte de visão para rotas DeepSeek apenas de texto que analisa imagens anexadas e locais por endpoints configuráveis OpenAI Responses, Chat Completions ou Anthropic Messages, deixando as rotas com capacidade de imagem nativas.
dsh-gpt-image
cai-mh/dsh-gpt-image
Gera imagens por meio de uma sessão web do ChatGPT autenticada e as baixa para um diretório local.
dsh-ui-mockup
mackwan84/dsh-ui-mockup
Consumer da ferramenta ui_mockup: gera wireframes e esboços de alta fidelidade de UI na fase de discussão, salva o design em disco, pede confirmação e bloqueia a especificação de design; inclui cartões de cliente, roteamento de imagens e i18n.
dsh-voice-call
biliye/dsh-voice-call
Assistente de chamada de voz para a GUI web do DSH: uma bola de chamada flutuante e arrastável, VAD no navegador que envia cada fala após uma pausa, reconhecimento de fala FunASR HTTP ou em streaming, respostas TTS da MiniMax ou compatíveis com OpenAI, um modo opcional de palavra de ativação com suspensão automática e despacho de tarefas para sessões de subagente separadas com progresso, parada e relatórios falados de conclusão.
dsh-tool-lipsync
yu-wenchao/dsh-tool-lipsync
Plugin de geração de vídeo com sincronização labial gratuito para DSH com mais de 3000 vozes e mais de 500 idiomas.
dsh-vision-plugin
bug-huntter/dsh-vision-plugin
Reconhecimento de imagens configurável para modelos DSH somente de texto: as mensagens de imagem são primeiro transcritas por um modelo de visão compatível com OpenAI (URL base, ID do modelo e chave API definidos numa secção de Definições) e depois passadas ao modelo principal como texto, enquanto o suporte a entrada de imagem é anunciado. O esquema de autenticação por chave API é selecionável (cabeçalhos de pedido estilo OpenAI, Anthropic, Gemini ou Azure) e a falta de uma chave é comunicada antes de qualquer pedido ser enviado.
dseyesopen
balue8246-maker/dseyesopen
Ponte de visão para DeepSeek somente de texto: envie imagens (sozinhas ou misturadas com texto) e um modelo de visão pequeno e rápido as descreve nos bastidores; o chat mantém a imagem, o DeepSeek vê apenas texto. Plugin puro: a desinstalação restaura tudo.
dsh-visibridge
lhbsaa/dsh-visibridge
Evidência visual estruturada (OCR/layout/semântica) além de uma ferramenta de captura por câmera USB para um loop de depuração "atirar-olhar-ajustar"; backends: Ollama, DeepSeek, Xiaomi.
dsh-short-video-studio
fengyungithub/dsh-short-video-studio
Estação de trabalho de criação de vídeo com IA ao estilo MiniMax-Design, baseada no deepseek harness.
dsh-watch-video
zeshuochen/dsh-watch-video
Transcrição de vídeo com prioridade a legendas e exportação SRT, controlos de tarefas canceláveis, e recurso a faster-whisper large-v3 quando não existem legendas.
dsh-voice-agent (voice-app)
wayneyu430/dsh-voice-agent
Um agente de frontend de voz conversacional para o dsh: fale naturalmente pelo ByteDance Duplex, delegue requisições a tarefas em segundo plano e ouça seus resultados assíncronos relatados por voz.
dsh-voice-chat
maoyuching/dsh-voice-chat
Chat de voz estilo Doubao para DSH: segurar o microfone do compositor converte a fala em texto e envia automaticamente, e as respostas da IA são lidas em voz alta. Condensação opcional por LLM (respostas longas resumidas em falas curtas, seguindo o modelo da conversa atual), limpeza de texto amigável ao TTS, vozes Edge TTS selecionáveis, parada automática por silêncio ajustável e configurações embutidas no diálogo de configurações do DSH.
phone-lens (phone-lens)
yxqfg/phone-lens
Transforma a câmara de um telefone num visor ao vivo e entrada de fotos para a sua sessão dsh, via LAN ou USB.
dsh-capture
max-null/dsh-capture
Captura de tela de motor duplo para DSH: dentro do shell de desktop SSiD, um atalho global ou a bandeja abre uma sobreposição de seleção por caixa em tela cheia (todos os monitores, quadros pixel-perfeitos por tela) com anotação de caixa vermelha no próprio local e uma barra de ferramentas estilo WeChat; no DSH simples (navegador), o botão de câmera do compositor captura a tela via getDisplayMedia e reutiliza na página a mesma sobreposição de seleção por caixa + anotação em fase única. A imagem recortada chega ao compositor da conversa atual através do fluxo oficial de anexos.
phone-lens (lens-mate)
yxqfg/phone-lens
Transforma a câmera de um celular em visor ao vivo e entrada de fotos para a sua sessão dsh, por LAN ou USB.
dsh-labnana
exoticknight/dsh-labnana
Geração de imagens Labnana para o DeepSeek Harness: texto para imagem / imagem para imagem / edição precisa com estimativa de créditos, saldo de assinatura e interface de configurações web.