- Início
- Categorias
- Visão, voz e multimodal
Visão, voz e multimodal
Os plugins de Visão, voz e multimodal dão olhos, ouvidos e voz aos modelos DeepSeek somente texto no DeepSeek-Harness (dsh). Encontre ferramentas de visão e rotas de provedor que fazem OCR e descrevem capturas coladas via Zhipu GLM, Gemini, Doubao ou Ollama local, entrada de voz por microfone via Web Speech API do navegador ou APIs compatíveis com Whisper, leitura em voz alta com Edge TTS ou vozes personalizadas, modos de voz full-duplex, e geradores de imagens, vídeo e música.
312 plugins encontrados
dsh-web-ui (dsh-tool-describe-image)
zhu1090093659/dsh-web-ui
Uma ferramenta de visão `describe_image` para modelos apenas de texto: imagens (caminho local, URL, anexo) vão para um endpoint de visão configurável compatível com OpenAI e apenas o texto retornado entra na sessão.
ipollowork
devin-axis/ipollowork
iPolloWork HyperFrames Video Studio e 27 modelos de vídeo editáveis como uma visualização de conversa nativa do DeepSeek Harness.
modlens
liustack/modlens
Ponte de visão para modelos somente-texto: cole uma imagem e receba evidências estruturadas em JSON (OCR, layout, semântica).
dsh-vision-router
ysr666/dsh-vision-router
Visão gratuita para agentes somente-texto: cadeia de visão integrada sem chave, além de ferramentas de pixel (perguntas e respostas, grounding, recorte, diff de pixels, cores, OCR, rastreamento SVG, recorte de objetos, capturas de tela); cole uma imagem para usar.
dsh-vision-toolkit
anionex/dsh-vision-toolkit
Visão para modelos apenas de texto: cole uma imagem e o modelo muda para a variante Vision Toolkit para perguntas e respostas sobre imagens, comparação de múltiplas imagens, OCR de capturas longas, reprodução de UI a partir de capturas, localização de elementos e diferença de pixels. Sem chave de API por padrão — as imagens são processadas pelo serviço gratuito hospedado pelo autor, 100 por máquina por dia; configurável para seu próprio provedor.
tongflow
tong-io/tongflow
Plugin de estúdio TongFlow para DeepSeek Harness (dsh): modelo de projeto no estilo de equipe de filmagem, fluxos de trabalho TongFlow criados pelo agente, geração de mídia determinística, tela incorporada.
dsh-image-gen
shanliuling/dsh-image-gen
Geração de imagens conversacional nativa para DeepSeek Harness: peça ao agente para criar uma imagem e ele cuida da geração e mantém o resultado diretamente na conversa.
watch-skill
oxbshw/watch-skill
Os recursos do DeepWatch, instaláveis em um perfil existente do DeepSeek Harness
dsh-imagegen
dickpy/dsh-imagegen
Geração de imagens por IA para a GUI web do DSH: texto para imagem e imagem para imagem por meio de um endpoint configurável compatível com OpenAI (gpt-image-2 / gpt-image-1 / dall-e-3), com um cartão de configuração api_url/api_key e um estúdio de geração de painel dividido na barra lateral.
dsh-comfyui
fandc520/dsh-comfyui
Controle um servidor ComfyUI local ou remoto a partir do DeepSeek Harness: as ferramentas comfyui_run / comfyui_object_info / comfyui_workflow geram e editam imagens e vídeos, com uma biblioteca de workflows (extração de grafo: por componente / fluxo principal / tudo), uma área de carregamento com correspondência automática de resolução, uma fila ao vivo, modelos SDXL e Wan 2.1, uma habilidade complementar e um proxy de mídia de mesma origem.
dsh-omi-voice
polinnizhong/dsh-omi-voice
Leitura em voz alta no chat para o DeepSeek Harness: toque para ler, pausar e retomar as respostas da IA com vozes naturais do Doubao TTS (BYOK); lê apenas a resposta final, com código, tabelas e diagramas filtrados; motor local, o plugin não guarda nenhuma chave de API.
deepseek-harness-video-director
chiphoton/deepseek-harness-video-director
🎬Diretor com IA: plugin de geração de vídeo MiniMax-H3 dirigido pelo DeepSeek-Harness. 🤖Mais que prompts. 🪄Interface em canvas.
dsh-design-qa
sunxin-ai/dsh-design-qa
QA de fidelidade de design para modelos somente texto: uma ferramenta `deepseek_vision` empresta um olho de qualquer rota de visão compatível com OpenAI, para que o modelo possa julgar se uma implementação corresponde ao seu mock — fornecida com o benchmark por trás desse julgamento (quatro fixtures, 23 defeitos injetados, transcrições brutas) e a disciplina de questionamento da qual ele depende.
picturereader
jing-hy/picturereader
"Leitura" de imagens para modelos somente de texto: reduz a escala + reduz a profundidade de cor + converte impressões digitais de estrutura/cor em grades de texto devolvidas à conversa, permitindo que o modelo faça zoom, amostragem e OCR de forma autônoma como um modelo multimodal; totalmente local, sem dependência de modelo externo, inclui uma skill de metodologia de leitura de imagem e PaddleOCR opcional.
dsh-voice-scribe
pensivefei/dsh-voice-scribe
Entrada de voz para a interface web: toque em Alt (ou Alt+Space) para iniciar/parar o ditado, Web Speech do navegador (sem configuração) ou ASR em nuvem compatível com OpenAI, polimento opcional por meio do LLM configurado no DSH, interface de configurações.
dsh-vision
oil-oil/dsh-vision
Compreensão de imagens quase nativa para o DeepSeek Harness
dsh-web-ui (dsh-tool-describe-image)
damonkoy/dsh-web-ui
Dá a um modelo somente texto compreensão de imagem via um modelo vision-language, exposto como ferramenta `describe_image`.
dsh-ears
wiziscool/dsh-ears
Plugin de entrada de voz para DeepSeek Harness (dsh): um botão de microfone no compositor converte fala em rascunho transcrito, com escolha de backends de reconhecimento de voz, refinamento opcional pelas próprias rotas LLM do dsh e uma página de configurações nativa.
dsh-plugin-tts
1624318455/dsh-plugin-tts
Lê em voz alta as respostas do assistente via Edge TTS gratuito ou seus próprios modelos de voz RVC: botões de leitura em voz alta + leitura automática, reprodução progressiva em blocos adaptativos (leituras longas sem interrupções), instalação de pacotes de voz com um clique a partir de um registro e um runtime RVC portátil.
dsh-media-skills
mjorgin/dsh-media-skills
Ponte de visão gratuita e geração de imagens para modelos somente texto: leitura de imagens coladas, failover entre os mecanismos GLM-4V-Flash e Gemini, evidência estruturada estilo ModLens, e uma rota de modelo de visão gratuita pré-configurada.
dsh-aigc-canvas
dsh-external/dsh-aigc-canvas
Plugin de canvas AIGC (cordis).
dsh-talk
perrylink/dsh-talk
I/O por voz para DeepSeek Harness — speech-to-text e text-to-speech pelo microfone e pela saída de áudio.
dsh-visual-plugin
jyh20030112/dsh-visual-plugin
Dá visão a modelos somente de texto: encaminha as imagens do usuário para um modelo de visão compatível com OpenAI e exibe as descrições em um painel direito da interface web.
dsh-voice-mode (dsh-voice-mode)
qishuilalala/dsh-voice-mode
Modo de voz full-duplex para a Web UI do DeepSeek Harness: alternar (envio automático com pausa de 2s) ou ditação por pressionar e segurar em um rascunho editável com ASR streaming zipformer2, wake word opcional; leitura em voz alta sentença por sentença via Edge TTS com legendas ao vivo, e a fala interrompe a reprodução e o turno em execução (barge-in verdadeiro). ASR no dispositivo, sem chave de API.