Pular para o conteúdo principal

Visão, voz e multimodal

Os plugins de Visão, voz e multimodal dão olhos, ouvidos e voz aos modelos DeepSeek somente texto no DeepSeek-Harness (dsh). Encontre ferramentas de visão e rotas de provedor que fazem OCR e descrevem capturas coladas via Zhipu GLM, Gemini, Doubao ou Ollama local, entrada de voz por microfone via Web Speech API do navegador ou APIs compatíveis com Whisper, leitura em voz alta com Edge TTS ou vozes personalizadas, modos de voz full-duplex, e geradores de imagens, vídeo e música.

312 plugins encontrados

B

dsh-ocr-local

balcoz/dsh-ocr-local

OCR local para DeepSeek Harness: cole ou anexe uma imagem, obtenha seu texto via PP-OCRv5 + ONNX Runtime, totalmente offline. TUI (cc-tui) e Web.

5há 2 mesesVisão, voz e multimodal
S

dsh-vision-bridge

sfyyy/dsh-vision-bridge

Visão sob demanda para sessões DSH somente texto: imagens se tornam marcadores, e uma ferramenta vision_describe envia apenas a imagem e a pergunta para um modelo de visão compatível com OpenAI

5há 2 mesesVisão, voz e multimodalMIT
0

dsh-voice-input

0nt-one/dsh-voice-input

Botão de microfone na linha de ferramentas do composer: speech-to-text Web Speech API (Chrome/Edge), troca de idioma, e auto-send opcional, zero dependências.

5há 2 mesesVisão, voz e multimodalMIT
T

dsh-plugin-appshot

tauruswood/dsh-plugin-appshot

Codex Appshots para DSH: capture a janela ativa em primeiro plano via atalho global e monte-a perfeitamente no composer para consultas do agente.

5há 5 diasVisão, voz e multimodalMIT
P

dsh-screenshot

paicat1/dsh-screenshot

Captura de tela sem dependências para DSH: Lightweight — zero dependências, zero binários; Stage & shoot — tela cheia, layout de janelas e captura hover-snap de janelas ocluídas com um clique; autoatendimento do agente — entrega apenas por caminho; os caminhos são universais, combine com modlens (opcional) para evidências estruturadas em uma chamada.

5há 25 diasVisão, voz e multimodalMIT
A

dsh-guide-dog

atropinoltt/dsh-guide-dog

Plugin multimodal alimentado por MiniMax: modo de chamada de voz em tempo real (conversa em streaming, interface de dock flutuante), modo de voz e entrada de voz pelo microfone, além de ferramentas de geração de imagem/vídeo/música/fala e de inspeção visual.

5há 2 mesesVisão, voz e multimodalMIT
E

canvas-workbench

elangan1997-cmyk/canvas-workbench

Bancada local de geração de imagens, assinatura zero: gere imagens com sua própria API (qualquer interface compatível com OpenAI, assinatura zero), layout de tela + edição/remoção de fundo/remoção de fundo/OCR/conversão para vetor, entrega em PSD/AI editável, ponte bidirecional em nível de camada com Photoshop/Illustrator

4há 3 diasVisão, voz e multimodalMIT
Y

dsh-tts-bridge

yuuyuko-uu/dsh-tts-bridge

Lê as conversas do DSH em voz alta usando a leitura em voz alta integrada da página web do DeepSeek, controlada por uma pequena extensão de navegador.

4há 3 diasVisão, voz e multimodal
C

dsh-cycle-image-gen

chengzzzi44/dsh-cycle-image-gen

Ferramenta de geração de imagens para o DeepSeek Harness em qualquer endpoint de imagens compatível com a OpenAI, com uma galeria embutida na interface web.

4há 22 diasVisão, voz e multimodalMIT
V

tripo3d-plugin-dsh

vast-ai-research/tripo3d-plugin-dsh

Skills 3D do Tripo para o DeepSeek Harness — gere assets 3D prontos para a engine a partir de um prompt de texto ou de uma imagem de referência via tripo-cli, com texturização, rigging, retopologia e conversão de formato em uma única passada.

4há 24 diasVisão, voz e multimodal
L

deepseek-vl-support

limccn/deepseek-vl-support

Concede visão aos modelos DeepSeek (apenas texto) em clientes Claude Code, Codex e Agent Plugins: descreve imagens através de qualquer endpoint de visão compatível com OpenAI.

4mês passadoVisão, voz e multimodalMIT
L

screenshot-feedback-hook-mcp (dsh-plugin)

lkh081231/screenshot-feedback-hook-mcp

Adiciona uma ferramenta de captura de tela mais dois pontos de captura automática opcionais, colocando a tela na conversa como um bloco de imagem; requer um modelo com capacidade de imagem.

4mês passadoVisão, voz e multimodalMIT
A

dsh-pdf-reader

angeloszou/dsh-pdf-reader

Um plugin de leitura de PDF sensível ao conteúdo para modelos de visão: perfila cada página para figuras (vetoriais e raster), tabelas, risco de fórmulas e layout de coluna dupla, depois aplica extração híbrida sensível ao conteúdo, renderizando páginas com figuras/tabelas/fórmulas como recortes de região de alta DPI. Fornece uma pré-visualização de baixa resolução para entender o layout da página e renderiza uma região especificada em alta resolução. Empacotado como múltiplas ferramentas para agentes.

4mês passadoVisão, voz e multimodalMIT
N

dsh-hos-scrcpy

ns-zzj/dsh-hos-scrcpy

Controle um telefone HarmonyOS pela UI web do DSH com IA: espelhamento de tela H.264 ao vivo, toque do mouse e teclas do sistema, streaming de hilog e ferramentas agentic que permitem ao modelo ler a tela, localizar controles da UI e então tocar, manter pressionado, pressionar teclas ou digitar.

4anteontemVisão, voz e multimodalMIT
X

dsh-vision-hub (tool-vision)

xing666173/dsh-vision-hub

Toolbox de visão aprimorada: 14 ferramentas de visão em nível de pixel (describe, ground, detect, crop, pixel-diff, OCR, OCR de long-screenshot, vectorize, colors, cutout, screenshot, present, materialize, html-screenshot) acionadas por um endpoint compatível com OpenAI, com marcadores de bridge [图片: path] limpos, classificação de segurança de conteúdo e retry automático de rate-limit.

4mês passadoVisão, voz e multimodal
D

dsh-image-pathify

dami9527/dsh-image-pathify

Permite que modelos somente de texto lidem com imagens coladas no chat, com uma experiência de visão nativa, visualização de imagens em lote e uma ferramenta analyze_image integrada compatível com OpenAI; modelos com capacidade de visão não são afetados.

4há 8 diasVisão, voz e multimodalMIT
S

dsh-voice

stardustlc666/dsh-voice

Ferramentas de voz: síntese de voz neural gratuita com edge-tts, transcrição ASR compatível com OpenAI, lista de vozes, pré-visualização de vozes em lote e autodiagnóstico de estado.

4há 12 horasVisão, voz e multimodalMIT
H

dsh-voice

haoku123/dsh-voice

Modo de voz full-duplex para a interface web: ditado por toque para alternar ou manter pressionado (tecla de envio ou `Ctrl`) com legendas ao vivo, ASR SenseVoice do lado do host via sherpa-onnx, respostas faladas frase por frase, e falar interrompe a reprodução e o turno em execução (verdadeira interrupção). Sem chave de API.

4mês passadoVisão, voz e multimodalMIT
F

dsh-chatvoice

fuzzysoul/dsh-chatvoice

Loop de voz gratuito para a interface web: entrada de microfone via SpeechRecognition do navegador com resultados parciais em tempo real, além de botões de alto-falante para leitura em voz alta e leitura automática das respostas do assistente, sem configuração e sem chave de API.

4há 2 mesesVisão, voz e multimodalMIT
X

dsh-draw-router

xiaozhe7772222/dsh-draw-router

Router unificado de geração de imagens para DeepSeek Harness (DSH): descobre automaticamente modelos de imagem a partir de qualquer endpoint compatível com OpenAI, fornece as ferramentas draw_image e draw_list_sources, e suporta SenseNova, StepFun, Agnes, Qwen, Flux, SD, Imagen e outros.

4mês passadoVisão, voz e multimodalMIT
N

free-vision-skill

niyongsheng/free-vision-skill

Compreensão de imagens e OCR totalmente locais via Vision Framework do macOS: `ocr_image` (texto, layout de tabela + coordenadas) e `view_image` (cena, rostos, QR) — cole várias imagens na caixa de entrada da web ou passe caminho/URL/base64; as imagens nunca saem do seu Mac.

4mês passadoVisão, voz e multimodalMIT
G

deepseek-vision (dsh-plugin-deepseek-vision)

gou-gee/deepseek-vision

Pacote Vision MCP e DSH para DeepSeek somente texto: ferramentas analyze_image, analyze_clipboard, compare_images e vision_status, uma página de configurações visual, GLM-4.6V-Flash gratuito por padrão, cache de resultados e tolerância a rate limit; keys ficam fora dos logs.

4há 26 diasVisão, voz e multimodalMIT
F

dsh-plugin-deepeye

favio8/dsh-plugin-deepeye

Plugin de visão DeepEye para o DeepSeek Harness (DSH): descrição de imagens, OCR, VQA, layout de UI e análise da área de transferência.

4há 2 mesesVisão, voz e multimodal
H

dsh-her-eyes

huashenglian/dsh-her-eyes

Um plugin dsh que permite à IA invocar automaticamente VLMs (modelos multimodais) para análise visual.

4há 2 mesesVisão, voz e multimodalMIT