- Início
- Categorias
- Visão, voz e multimodal
Visão, voz e multimodal
Os plugins de Visão, voz e multimodal dão olhos, ouvidos e voz aos modelos DeepSeek somente texto no DeepSeek-Harness (dsh). Encontre ferramentas de visão e rotas de provedor que fazem OCR e descrevem capturas coladas via Zhipu GLM, Gemini, Doubao ou Ollama local, entrada de voz por microfone via Web Speech API do navegador ou APIs compatíveis com Whisper, leitura em voz alta com Edge TTS ou vozes personalizadas, modos de voz full-duplex, e geradores de imagens, vídeo e música.
312 plugins encontrados
dsh-ocr-local
balcoz/dsh-ocr-local
OCR local para DeepSeek Harness: cole ou anexe uma imagem, obtenha seu texto via PP-OCRv5 + ONNX Runtime, totalmente offline. TUI (cc-tui) e Web.
dsh-vision-bridge
sfyyy/dsh-vision-bridge
Visão sob demanda para sessões DSH somente texto: imagens se tornam marcadores, e uma ferramenta vision_describe envia apenas a imagem e a pergunta para um modelo de visão compatível com OpenAI
dsh-voice-input
0nt-one/dsh-voice-input
Botão de microfone na linha de ferramentas do composer: speech-to-text Web Speech API (Chrome/Edge), troca de idioma, e auto-send opcional, zero dependências.
dsh-plugin-appshot
tauruswood/dsh-plugin-appshot
Codex Appshots para DSH: capture a janela ativa em primeiro plano via atalho global e monte-a perfeitamente no composer para consultas do agente.
dsh-screenshot
paicat1/dsh-screenshot
Captura de tela sem dependências para DSH: Lightweight — zero dependências, zero binários; Stage & shoot — tela cheia, layout de janelas e captura hover-snap de janelas ocluídas com um clique; autoatendimento do agente — entrega apenas por caminho; os caminhos são universais, combine com modlens (opcional) para evidências estruturadas em uma chamada.
dsh-guide-dog
atropinoltt/dsh-guide-dog
Plugin multimodal alimentado por MiniMax: modo de chamada de voz em tempo real (conversa em streaming, interface de dock flutuante), modo de voz e entrada de voz pelo microfone, além de ferramentas de geração de imagem/vídeo/música/fala e de inspeção visual.
canvas-workbench
elangan1997-cmyk/canvas-workbench
Bancada local de geração de imagens, assinatura zero: gere imagens com sua própria API (qualquer interface compatível com OpenAI, assinatura zero), layout de tela + edição/remoção de fundo/remoção de fundo/OCR/conversão para vetor, entrega em PSD/AI editável, ponte bidirecional em nível de camada com Photoshop/Illustrator
dsh-tts-bridge
yuuyuko-uu/dsh-tts-bridge
Lê as conversas do DSH em voz alta usando a leitura em voz alta integrada da página web do DeepSeek, controlada por uma pequena extensão de navegador.
dsh-cycle-image-gen
chengzzzi44/dsh-cycle-image-gen
Ferramenta de geração de imagens para o DeepSeek Harness em qualquer endpoint de imagens compatível com a OpenAI, com uma galeria embutida na interface web.
tripo3d-plugin-dsh
vast-ai-research/tripo3d-plugin-dsh
Skills 3D do Tripo para o DeepSeek Harness — gere assets 3D prontos para a engine a partir de um prompt de texto ou de uma imagem de referência via tripo-cli, com texturização, rigging, retopologia e conversão de formato em uma única passada.
deepseek-vl-support
limccn/deepseek-vl-support
Concede visão aos modelos DeepSeek (apenas texto) em clientes Claude Code, Codex e Agent Plugins: descreve imagens através de qualquer endpoint de visão compatível com OpenAI.
screenshot-feedback-hook-mcp (dsh-plugin)
lkh081231/screenshot-feedback-hook-mcp
Adiciona uma ferramenta de captura de tela mais dois pontos de captura automática opcionais, colocando a tela na conversa como um bloco de imagem; requer um modelo com capacidade de imagem.
dsh-pdf-reader
angeloszou/dsh-pdf-reader
Um plugin de leitura de PDF sensível ao conteúdo para modelos de visão: perfila cada página para figuras (vetoriais e raster), tabelas, risco de fórmulas e layout de coluna dupla, depois aplica extração híbrida sensível ao conteúdo, renderizando páginas com figuras/tabelas/fórmulas como recortes de região de alta DPI. Fornece uma pré-visualização de baixa resolução para entender o layout da página e renderiza uma região especificada em alta resolução. Empacotado como múltiplas ferramentas para agentes.
dsh-hos-scrcpy
ns-zzj/dsh-hos-scrcpy
Controle um telefone HarmonyOS pela UI web do DSH com IA: espelhamento de tela H.264 ao vivo, toque do mouse e teclas do sistema, streaming de hilog e ferramentas agentic que permitem ao modelo ler a tela, localizar controles da UI e então tocar, manter pressionado, pressionar teclas ou digitar.
dsh-vision-hub (tool-vision)
xing666173/dsh-vision-hub
Toolbox de visão aprimorada: 14 ferramentas de visão em nível de pixel (describe, ground, detect, crop, pixel-diff, OCR, OCR de long-screenshot, vectorize, colors, cutout, screenshot, present, materialize, html-screenshot) acionadas por um endpoint compatível com OpenAI, com marcadores de bridge [图片: path] limpos, classificação de segurança de conteúdo e retry automático de rate-limit.
dsh-image-pathify
dami9527/dsh-image-pathify
Permite que modelos somente de texto lidem com imagens coladas no chat, com uma experiência de visão nativa, visualização de imagens em lote e uma ferramenta analyze_image integrada compatível com OpenAI; modelos com capacidade de visão não são afetados.
dsh-voice
stardustlc666/dsh-voice
Ferramentas de voz: síntese de voz neural gratuita com edge-tts, transcrição ASR compatível com OpenAI, lista de vozes, pré-visualização de vozes em lote e autodiagnóstico de estado.
dsh-voice
haoku123/dsh-voice
Modo de voz full-duplex para a interface web: ditado por toque para alternar ou manter pressionado (tecla de envio ou `Ctrl`) com legendas ao vivo, ASR SenseVoice do lado do host via sherpa-onnx, respostas faladas frase por frase, e falar interrompe a reprodução e o turno em execução (verdadeira interrupção). Sem chave de API.
dsh-chatvoice
fuzzysoul/dsh-chatvoice
Loop de voz gratuito para a interface web: entrada de microfone via SpeechRecognition do navegador com resultados parciais em tempo real, além de botões de alto-falante para leitura em voz alta e leitura automática das respostas do assistente, sem configuração e sem chave de API.
dsh-draw-router
xiaozhe7772222/dsh-draw-router
Router unificado de geração de imagens para DeepSeek Harness (DSH): descobre automaticamente modelos de imagem a partir de qualquer endpoint compatível com OpenAI, fornece as ferramentas draw_image e draw_list_sources, e suporta SenseNova, StepFun, Agnes, Qwen, Flux, SD, Imagen e outros.
free-vision-skill
niyongsheng/free-vision-skill
Compreensão de imagens e OCR totalmente locais via Vision Framework do macOS: `ocr_image` (texto, layout de tabela + coordenadas) e `view_image` (cena, rostos, QR) — cole várias imagens na caixa de entrada da web ou passe caminho/URL/base64; as imagens nunca saem do seu Mac.
deepseek-vision (dsh-plugin-deepseek-vision)
gou-gee/deepseek-vision
Pacote Vision MCP e DSH para DeepSeek somente texto: ferramentas analyze_image, analyze_clipboard, compare_images e vision_status, uma página de configurações visual, GLM-4.6V-Flash gratuito por padrão, cache de resultados e tolerância a rate limit; keys ficam fora dos logs.
dsh-plugin-deepeye
favio8/dsh-plugin-deepeye
Plugin de visão DeepEye para o DeepSeek Harness (DSH): descrição de imagens, OCR, VQA, layout de UI e análise da área de transferência.
dsh-her-eyes
huashenglian/dsh-her-eyes
Um plugin dsh que permite à IA invocar automaticamente VLMs (modelos multimodais) para análise visual.