Pular para o conteúdo principal

Visão, voz e multimodal

Os plugins de Visão, voz e multimodal dão olhos, ouvidos e voz aos modelos DeepSeek somente texto no DeepSeek-Harness (dsh). Encontre ferramentas de visão e rotas de provedor que fazem OCR e descrevem capturas coladas via Zhipu GLM, Gemini, Doubao ou Ollama local, entrada de voz por microfone via Web Speech API do navegador ou APIs compatíveis com Whisper, leitura em voz alta com Edge TTS ou vozes personalizadas, modos de voz full-duplex, e geradores de imagens, vídeo e música.

312 plugins encontrados

Z

dsh-web-ui (dsh-tool-describe-image)

zhu1090093659/dsh-web-ui

Uma ferramenta de visão `describe_image` para modelos apenas de texto: imagens (caminho local, URL, anexo) vão para um endpoint de visão configurável compatível com OpenAI e apenas o texto retornado entra na sessão.

8khá 6 diasVisão, voz e multimodalApache-2.0
D

ipollowork

devin-axis/ipollowork

iPolloWork HyperFrames Video Studio e 27 modelos de vídeo editáveis como uma visualização de conversa nativa do DeepSeek Harness.

4.2khá 2 mesesVisão, voz e multimodal
L

modlens

liustack/modlens

Ponte de visão para modelos somente-texto: cole uma imagem e receba evidências estruturadas em JSON (OCR, layout, semântica).

4.1khá 5 diasVisão, voz e multimodalMIT
Y

dsh-vision-router

ysr666/dsh-vision-router

Visão gratuita para agentes somente-texto: cadeia de visão integrada sem chave, além de ferramentas de pixel (perguntas e respostas, grounding, recorte, diff de pixels, cores, OCR, rastreamento SVG, recorte de objetos, capturas de tela); cole uma imagem para usar.

1.1kontemVisão, voz e multimodalMIT
A

dsh-vision-toolkit

anionex/dsh-vision-toolkit

Visão para modelos apenas de texto: cole uma imagem e o modelo muda para a variante Vision Toolkit para perguntas e respostas sobre imagens, comparação de múltiplas imagens, OCR de capturas longas, reprodução de UI a partir de capturas, localização de elementos e diferença de pixels. Sem chave de API por padrão — as imagens são processadas pelo serviço gratuito hospedado pelo autor, 100 por máquina por dia; configurável para seu próprio provedor.

887anteontemVisão, voz e multimodalMIT
T

tongflow

tong-io/tongflow

Plugin de estúdio TongFlow para DeepSeek Harness (dsh): modelo de projeto no estilo de equipe de filmagem, fluxos de trabalho TongFlow criados pelo agente, geração de mídia determinística, tela incorporada.

870mês passadoVisão, voz e multimodalAGPL-3.0
S

dsh-image-gen

shanliuling/dsh-image-gen

Geração de imagens conversacional nativa para DeepSeek Harness: peça ao agente para criar uma imagem e ele cuida da geração e mantém o resultado diretamente na conversa.

564há 3 diasVisão, voz e multimodalApache-2.0
O

watch-skill

oxbshw/watch-skill

Os recursos do DeepWatch, instaláveis em um perfil existente do DeepSeek Harness

378há 18 diasVisão, voz e multimodalMIT
D

dsh-imagegen

dickpy/dsh-imagegen

Geração de imagens por IA para a GUI web do DSH: texto para imagem e imagem para imagem por meio de um endpoint configurável compatível com OpenAI (gpt-image-2 / gpt-image-1 / dall-e-3), com um cartão de configuração api_url/api_key e um estúdio de geração de painel dividido na barra lateral.

99anteontemVisão, voz e multimodalApache-2.0
F

dsh-comfyui

fandc520/dsh-comfyui

Controle um servidor ComfyUI local ou remoto a partir do DeepSeek Harness: as ferramentas comfyui_run / comfyui_object_info / comfyui_workflow geram e editam imagens e vídeos, com uma biblioteca de workflows (extração de grafo: por componente / fluxo principal / tudo), uma área de carregamento com correspondência automática de resolução, uma fila ao vivo, modelos SDXL e Wan 2.1, uma habilidade complementar e um proxy de mídia de mesma origem.

93há 6 diasVisão, voz e multimodalMIT
P

dsh-omi-voice

polinnizhong/dsh-omi-voice

Leitura em voz alta no chat para o DeepSeek Harness: toque para ler, pausar e retomar as respostas da IA com vozes naturais do Doubao TTS (BYOK); lê apenas a resposta final, com código, tabelas e diagramas filtrados; motor local, o plugin não guarda nenhuma chave de API.

74mês passadoVisão, voz e multimodalMIT
C

deepseek-harness-video-director

chiphoton/deepseek-harness-video-director

🎬Diretor com IA: plugin de geração de vídeo MiniMax-H3 dirigido pelo DeepSeek-Harness. 🤖Mais que prompts. 🪄Interface em canvas.

69há 4 diasVisão, voz e multimodalMIT
S

dsh-design-qa

sunxin-ai/dsh-design-qa

QA de fidelidade de design para modelos somente texto: uma ferramenta `deepseek_vision` empresta um olho de qualquer rota de visão compatível com OpenAI, para que o modelo possa julgar se uma implementação corresponde ao seu mock — fornecida com o benchmark por trás desse julgamento (quatro fixtures, 23 defeitos injetados, transcrições brutas) e a disciplina de questionamento da qual ele depende.

44há 26 diasVisão, voz e multimodalMIT
J

picturereader

jing-hy/picturereader

"Leitura" de imagens para modelos somente de texto: reduz a escala + reduz a profundidade de cor + converte impressões digitais de estrutura/cor em grades de texto devolvidas à conversa, permitindo que o modelo faça zoom, amostragem e OCR de forma autônoma como um modelo multimodal; totalmente local, sem dependência de modelo externo, inclui uma skill de metodologia de leitura de imagem e PaddleOCR opcional.

37há 3 diasVisão, voz e multimodalMIT
P

dsh-voice-scribe

pensivefei/dsh-voice-scribe

Entrada de voz para a interface web: toque em Alt (ou Alt+Space) para iniciar/parar o ditado, Web Speech do navegador (sem configuração) ou ASR em nuvem compatível com OpenAI, polimento opcional por meio do LLM configurado no DSH, interface de configurações.

34há 3 diasVisão, voz e multimodalMIT
O

dsh-vision

oil-oil/dsh-vision

Compreensão de imagens quase nativa para o DeepSeek Harness

24há 2 mesesVisão, voz e multimodalMIT
D

dsh-web-ui (dsh-tool-describe-image)

damonkoy/dsh-web-ui

Dá a um modelo somente texto compreensão de imagem via um modelo vision-language, exposto como ferramenta `describe_image`.

22há 2 mesesVisão, voz e multimodalApache-2.0
W

dsh-ears

wiziscool/dsh-ears

Plugin de entrada de voz para DeepSeek Harness (dsh): um botão de microfone no compositor converte fala em rascunho transcrito, com escolha de backends de reconhecimento de voz, refinamento opcional pelas próprias rotas LLM do dsh e uma página de configurações nativa.

21ontemVisão, voz e multimodalMIT
1

dsh-plugin-tts

1624318455/dsh-plugin-tts

Lê em voz alta as respostas do assistente via Edge TTS gratuito ou seus próprios modelos de voz RVC: botões de leitura em voz alta + leitura automática, reprodução progressiva em blocos adaptativos (leituras longas sem interrupções), instalação de pacotes de voz com um clique a partir de um registro e um runtime RVC portátil.

21há 6 diasVisão, voz e multimodalMIT
M

dsh-media-skills

mjorgin/dsh-media-skills

Ponte de visão gratuita e geração de imagens para modelos somente texto: leitura de imagens coladas, failover entre os mecanismos GLM-4V-Flash e Gemini, evidência estruturada estilo ModLens, e uma rota de modelo de visão gratuita pré-configurada.

19há 12 diasVisão, voz e multimodalMIT
D

dsh-aigc-canvas

dsh-external/dsh-aigc-canvas

Plugin de canvas AIGC (cordis).

17há 22 diasVisão, voz e multimodal
P

dsh-talk

perrylink/dsh-talk

I/O por voz para DeepSeek Harness — speech-to-text e text-to-speech pelo microfone e pela saída de áudio.

16há 8 diasVisão, voz e multimodalApache-2.0
J

dsh-visual-plugin

jyh20030112/dsh-visual-plugin

Dá visão a modelos somente de texto: encaminha as imagens do usuário para um modelo de visão compatível com OpenAI e exibe as descrições em um painel direito da interface web.

16há 3 diasVisão, voz e multimodalMIT
Q

dsh-voice-mode (dsh-voice-mode)

qishuilalala/dsh-voice-mode

Modo de voz full-duplex para a Web UI do DeepSeek Harness: alternar (envio automático com pausa de 2s) ou ditação por pressionar e segurar em um rascunho editável com ASR streaming zipformer2, wake word opcional; leitura em voz alta sentença por sentença via Edge TTS com legendas ao vivo, e a fala interrompe a reprodução e o turno em execução (barge-in verdadeiro). ASR no dispositivo, sem chave de API.

15há 10 horasVisão, voz e multimodalMIT