Pular para o conteúdo principal

Visão, voz e multimodal

Os plugins de Visão, voz e multimodal dão olhos, ouvidos e voz aos modelos DeepSeek somente texto no DeepSeek-Harness (dsh). Encontre ferramentas de visão e rotas de provedor que fazem OCR e descrevem capturas coladas via Zhipu GLM, Gemini, Doubao ou Ollama local, entrada de voz por microfone via Web Speech API do navegador ou APIs compatíveis com Whisper, leitura em voz alta com Edge TTS ou vozes personalizadas, modos de voz full-duplex, e geradores de imagens, vídeo e música.

312 plugins encontrados

F

dsh-vision-proxy

flyvhidbwo/dsh-vision-proxy

Cérebro DeepSeek + transcrição automática de imagens: anexe imagens na GUI e cada uma é transcrita pelo deepseek-v4-flash-vision-exp oficial por padrão (um cérebro V4-Pro puramente textual pode ver imagens), com qualquer VLM compatível com OpenAI ou Ollama local como alternativas.

15mês passadoVisão, voz e multimodalMIT
D

dsh-video-lens

dundunhan/dsh-video-lens

Dá aos agentes DeepSeek Harness apenas de texto compreensão de vídeo: amostragem de quadros consciente da cena + VLM + transcrição ASR opcional fundidos em evidência da linha do tempo. / Plugin de compreensão de vídeo para modelos apenas de texto (amostragem de quadros consciente da cena + VLM + transcrição de voz opcional).

13mês passadoVisão, voz e multimodalMIT
P

dsh-vision-opencode

poiuyjie/dsh-vision-opencode

Adiciona um modelo de visão configurável a modelos principais somente de texto: uma ferramenta vision_read_image, um seletor de modelo de visão na barra do compositor e conversão automática de imagem para texto em rotas somente de texto.

13há 23 diasVisão, voz e multimodalMIT
Z

dsh-agnes-studio

zmm863-commits/dsh-agnes-studio

Estúdio de imagem e vídeo com IA como painel flutuante do DSH, para que a criação ocorra junto da conversa em vez de substituí-la: texto-para-imagem, imagem-para-imagem e composição com várias imagens em 1K-4K em oito proporções; texto-para-vídeo e imagem-para-vídeo com controle do primeiro quadro em 4-12 segundos; modo curta-metragem que importa um roteiro (.txt/.md/.json), divide-o em planos de storyboard para pré-visualização e geração em lote; e um workspace de especialista em prompts. Zero dependências de runtime.

12há 3 diasVisão, voz e multimodal
B

dsh-voice-ai-girlfriend-plugin

beiyege-01/dsh-voice-ai-girlfriend-plugin

Namorada IA por voz para a Web UI: entrada de microfone com FunASR, respostas faladas com Qwen3-TTS, janela de animação do companheiro e chat QQ bidirecional (texto/voz/imagem push) via NapCat.

12há 19 diasVisão, voz e multimodal
P

dsh-plugin-xiaomi-mimo-tts

ppy-web/dsh-plugin-xiaomi-mimo-tts

Adiciona o texto-para-fala Xiaomi MiMo ao DSH Web, com leitura em voz alta das mensagens do assistente, streaming PCM, design de voz predefinido e personalizado, fallback de fala do navegador, controles de reprodução e sons de UI opcionais.

11há 3 diasVisão, voz e multimodalMIT
A

dsh-speak

alan2z/dsh-speak

Plugin de anúncios por voz sem dependências, orientado a eventos: sem modelo extra, sem custo de tokens. Fala com a voz natural integrada do sistema, suportando Windows e macOS; anúncios de resposta final, alertas de aprovação e perguntas, anúncios opcionais de eventos (fim de turno, comando concluído, mudança de objetivo, erros de ferramentas, atualizações de tarefas), respostas finais reproduzíveis e uma página de configurações visual bilíngue.

11há 7 diasVisão, voz e multimodalMIT
C

Gemini-Eyes

consolesun/gemini-eyes

Ponte MCP para gemini.google.com: análise visual de imagens e vídeos, geração de imagens com Imagen e vídeos com Veo, e gerenciamento de conversas usando a sessão de navegador já autenticada, sem chave de API.

11mês passadoVisão, voz e multimodal
P

dsh-draw

perrylink/dsh-draw

Geração de texto para imagem com múltiplos motores (OpenAI Images e presets Zhipu CogView) com rastreamento de cota por sessão, failover de motor, configuração segura de credenciais e um cartão de resultado com regenerar.

9há 8 diasVisão, voz e multimodalApache-2.0
S

dsh-deepseek-vision

siegfly/dsh-deepseek-vision

Uma rota de provedor de gateway de visão-linguagem: as imagens coladas são descritas por um modelo VL configurável (Qwen-VL por padrão) antes de serem enviadas ao DeepSeek.

9há 22 diasVisão, voz e multimodalMIT
L

dsh-vision

linenxi-ctrl/dsh-vision

Plugin de visão externa para o DeepSeek Harness: painel de configuração via botão da baleia, reconhecimento de imagens com resposta automática e ferramentas de captura de tela/reconhecimento para o agente.

9há 2 mesesVisão, voz e multimodalMIT
A

dsh-highres-vision

azwosile/dsh-highres-vision

Para o modelo de visão nativo do DeepSeek Harness deepseek-v4-flash-vision-exp, eleva os limites de admissão de imagens para 32 MiB / 8192 px / 600 imagens e adiciona uma ferramenta highres_read que divide imagens grandes em blocos e depois retorna a imagem inteira mais blocos de 800x800 por meio da ferramenta read_image do host.

8há 22 diasVisão, voz e multimodalMIT
G

dsh-voice

goodandready/dsh-voice

Entrada de voz para a Web UI: ditado segmentado por pausas e mensagens de voz, cada qual com sua própria cadeia de fallback de provedores (Deepgram, Groq, HuggingFace, whisper.cpp local ou endpoint compatível com OpenAI).

8ontemVisão, voz e multimodalMIT
3

dsh-voice

3274375092/dsh-voice

Entrada de voz para DeepSeek Harness: fale ao microfone e o texto reconhecido é enviado como uma mensagem de chat normal, via reconhecimento de fala local ou do navegador.

8anteontemVisão, voz e multimodalMIT
F

dsh-free-vision

fuzzysoul/dsh-free-vision

Ponte de visão gratuita para modelos apenas de texto: compreensão de imagens, OCR, análise de interface e depuração via provedores de nível gratuito (Qwen3-VL-Flash, Doubao, DeepSeek-OCR) com uma GUI de configurações.

8mês passadoVisão, voz e multimodalMIT
C

dsh-chat-imagine

corrinehu/dsh-chat-imagine

Gera e exibe imagens automaticamente no chat do DSH via canais de API ou CLIs locais (mmx / codex / agy), e também pode reconhecer imagens usando a CLI correspondente.

8mês passadoVisão, voz e multimodalMIT
S

dsh-tool-vision

scorp1o117/dsh-tool-vision

Envie imagens locais ou URLs HTTP(S) de imagens para um endpoint de visão compatível com OpenAI configurado com a ferramenta inspect_image e retorne a resposta em texto para a conversa.

8há 3 diasVisão, voz e multimodal
W

dsh-appshots

wongyuye/dsh-appshots

Captura de janela ao estilo Codex para o DSH Desktop no macOS e Windows: pressione ambas as teclas Command (macOS) ou ambas as teclas Ctrl (Windows), ou o botão de câmera, para capturar a janela frontal, anexá-la ao chat atual e injetar uma árvore de acessibilidade estilo VoiceOver como contexto oculto.

7há 15 diasVisão, voz e multimodalMIT
5

dsh-vision

54xkeee/dsh-vision

Visão para o DeepSeek somente-texto via Doubao Web por padrão (sem custo, sem chave de API — controla seu Chrome logado por meio de uma ponte CDP do Windows), com cota do Antigravity IDE (flash/pro) ou fallback para o Gemini; escalonamento automático de detalhe, memória de evidências visuais com reidratação após compactação, cache por hash de conteúdo e um painel de cliente bilíngue.

7há 2 mesesVisão, voz e multimodalMIT
Y

dsh-duet

yums/dsh-duet

Interação por voz em chinês full-duplex para DSH Web: dite e edite tarefas, envie solicitações, gerencie sessões, responda perguntas do DSH e ouça anúncios concisos de conclusão de tarefas.

6há 3 diasVisão, voz e multimodalApache-2.0
Y

deepseek-harness-plugins (vision-bridge)

yinxe/deepseek-harness-plugins

Deixe os modelos apenas de texto ver imagens: quando chega uma imagem com um marcador como \[image omitted because this model accepts text only], o modelo chama a ferramenta vision_describe e o plugin encaminha a referência da imagem mais a pergunta para um modelo multimodal, repetindo com um modelo de recurso em caso de falha. Configurado na página de definições e persistido através da API oficial de definições.

6anteontemVisão, voz e multimodalMIT
Z

dsh-voice-input-plugin

zhangbo-cn/dsh-voice-input-plugin

Microfone do compositor para a interface web: toque para monitorar a transcrição ao vivo e segure para falar, com leitura da resposta por Edge TTS do host transmitida enquanto o modelo gera, pausa de eco durante a leitura e toque para parar.

6mês passadoVisão, voz e multimodalMIT
G

dsh-ocr-local

grelvan/dsh-ocr-local

Fallback de OCR local para rotas somente de texto: quando o modelo de sessão declara que não pode aceitar imagens, a imagem anexada é armazenada em cache localmente e seu caminho é injetado para que o modelo possa chamar ocr_image — PP-OCRv5 + ONNX Runtime em CPU, sem chave de API, imagens nunca saem da máquina. Silencioso quando o modelo pode ver imagens.

5há 5 diasVisão, voz e multimodal
N

vision-exp-tile

nicholas023/vision-exp-tile

Reconhecimento de imagens grandes para modelos vision-exp: reconhecimento por mosaicos 800×800 sem perda (smart/pipeline/full), OCR local com pré-processamento e encaminhamento de caligrafia, GPU multivendor opcional (DirectML/CUDA/OpenVINO) com fallback automático para CPU.

5mês passadoVisão, voz e multimodalMIT