Saltar al contenido principal

Visión, voz y multimodal

Los plugins de Visión, voz y multimodal dan ojos, oídos y voz a los modelos DeepSeek de solo texto en DeepSeek-Harness (dsh). Encuentra herramientas de visión y rutas de proveedor que hacen OCR y describen capturas pegadas mediante Zhipu GLM, Gemini, Doubao u Ollama local, entrada de voz por micrófono a través de la Web Speech API del navegador o APIs compatibles con Whisper, lectura en voz alta con Edge TTS o voces personalizadas, modos de voz full-duplex, y generadores de imágenes, vídeo y música.

312 plugins encontrados

B

dsh-ocr-local

balcoz/dsh-ocr-local

OCR local para DeepSeek Harness: pegue o adjunte una imagen, obtenga su texto mediante PP-OCRv5 + ONNX Runtime, totalmente sin conexión. TUI (cc-tui) y Web.

5hace 2 mesesVisión, voz y multimodal
S

dsh-vision-bridge

sfyyy/dsh-vision-bridge

Visión bajo demanda para sesiones DSH solo de texto: las imágenes se convierten en marcadores, y una herramienta vision_describe envía solo la imagen y la pregunta a un modelo de visión compatible con OpenAI

5hace 2 mesesVisión, voz y multimodalMIT
0

dsh-voice-input

0nt-one/dsh-voice-input

Botón de micrófono en la fila de herramientas del compositor: voz a texto con la API Web Speech (Chrome/Edge), cambio de idioma y envío automático opcional, cero dependencias.

5hace 2 mesesVisión, voz y multimodalMIT
T

dsh-plugin-appshot

tauruswood/dsh-plugin-appshot

Codex Appshots para DSH: captura la ventana activa en primer plano mediante atajo global y móntala sin problemas en el composer para consultas del agente.

5hace 5 díasVisión, voz y multimodalMIT
P

dsh-screenshot

paicat1/dsh-screenshot

Captura de pantalla sin dependencias para DSH: Lightweight — cero dependencias, cero binarios; Stage & shoot — captura en un clic de pantalla completa, disposición de ventanas y ventanas ocluidas con hover-snap; Agent self-service — entrega solo por ruta; las rutas son universales, combínalo con modlens (opcional) para evidencia estructurada en una sola llamada.

5hace 25 díasVisión, voz y multimodalMIT
A

dsh-guide-dog

atropinoltt/dsh-guide-dog

Plugin multimodal impulsado por MiniMax: modo de llamada de voz en tiempo real (conversación en streaming, interfaz de dock flotante), modo de voz y entrada de voz por micrófono, además de herramientas de generación de imagen/video/música/voz y de inspección visual.

5hace 2 mesesVisión, voz y multimodalMIT
E

canvas-workbench

elangan1997-cmyk/canvas-workbench

Taller local de generación de imágenes, sin suscripciones: usa tu propia API para generar imágenes (cualquier interfaz compatible con OpenAI, suscripción cero), maquetación en lienzo + retoque/borrado/quitar fondo/OCR/vectorización, entrega PSD/AI editable, puente bidireccional a nivel de capa con Photoshop/Illustrator

4hace 3 díasVisión, voz y multimodalMIT
Y

dsh-tts-bridge

yuuyuko-uu/dsh-tts-bridge

Lee las conversaciones de DSH en voz alta utilizando la lectura en voz alta integrada de la página web de DeepSeek, controlada por una pequeña extensión del navegador.

4hace 3 díasVisión, voz y multimodal
C

dsh-cycle-image-gen

chengzzzi44/dsh-cycle-image-gen

Herramienta de generación de imágenes para DeepSeek Harness sobre cualquier endpoint de imágenes compatible con OpenAI, con una galería integrada en la interfaz web.

4hace 22 díasVisión, voz y multimodalMIT
V

tripo3d-plugin-dsh

vast-ai-research/tripo3d-plugin-dsh

Skills de Tripo 3D para DeepSeek Harness: genera recursos 3D listos para el motor a partir de un prompt de texto o una imagen de referencia mediante tripo-cli, con texturizado, rigging, retopología y conversión de formato en una sola pasada.

4hace 24 díasVisión, voz y multimodal
L

deepseek-vl-support

limccn/deepseek-vl-support

Otorga visión a los modelos DeepSeek (solo texto) en los clientes Claude Code, Codex y Agent Plugins: describe imágenes mediante cualquier endpoint de visión compatible con OpenAI.

4el mes pasadoVisión, voz y multimodalMIT
L

screenshot-feedback-hook-mcp (dsh-plugin)

lkh081231/screenshot-feedback-hook-mcp

Añade una herramienta de captura de pantalla más dos puntos de captura automática opcionales, poniendo la pantalla en la conversación como un bloque de imagen; requiere un modelo con capacidad de imagen.

4el mes pasadoVisión, voz y multimodalMIT
A

dsh-pdf-reader

angeloszou/dsh-pdf-reader

Un complemento de lectura de PDF consciente del contenido para modelos de visión: perfila cada página para figuras (vectoriales y rasterizadas), tablas, riesgo de fórmulas y diseño de doble columna, luego aplica extracción híbrida consciente del contenido, renderizando páginas con figuras/tablas/fórmulas como recortes de región de alta DPI. Proporciona una vista previa de baja resolución para entender el diseño de página y renderiza una región especificada en alta resolución. Empaquetado como múltiples herramientas para agentes.

4el mes pasadoVisión, voz y multimodalMIT
N

dsh-hos-scrcpy

ns-zzj/dsh-hos-scrcpy

Controla un teléfono HarmonyOS desde la interfaz web de DSH con IA: duplicación de pantalla H.264 en vivo, toque con ratón y teclas del sistema, transmisión de hilog y herramientas agénticas que permiten al modelo leer la pantalla, localizar controles de UI y luego tocar, mantener pulsado, pulsar teclas o escribir.

4anteayerVisión, voz y multimodalMIT
X

dsh-vision-hub (tool-vision)

xing666173/dsh-vision-hub

Caja de herramientas de visión mejorada: 14 herramientas de visión a nivel de píxel (describe, ground, detect, crop, pixel-diff, OCR, OCR de captura larga, vectorize, colors, cutout, screenshot, present, materialize, html-screenshot) impulsadas por un endpoint compatible con OpenAI, con marcadores de puente limpios [图片: path], clasificación de seguridad de contenido y auto-retry por límite de tasa.

4el mes pasadoVisión, voz y multimodal
D

dsh-image-pathify

dami9527/dsh-image-pathify

Permite que los modelos de solo texto manejen imágenes pegadas en el chat, con una experiencia de visión nativa, visualización de imágenes por lotes y una herramienta analyze_image integrada compatible con OpenAI; los modelos con capacidad de visión no se ven afectados.

4hace 8 díasVisión, voz y multimodalMIT
S

dsh-voice

stardustlc666/dsh-voice

Herramientas de voz: síntesis de voz neuronal gratuita con edge-tts, transcripción ASR compatible con OpenAI, lista de voces, vista previa de voces por lotes y autodiagnóstico de estado.

4hace 12 horasVisión, voz y multimodalMIT
H

dsh-voice

haoku123/dsh-voice

Modo de voz full-dúplex para la interfaz web: dictado con toque para alternar o mantener pulsado (tecla de envío o `Ctrl`) con subtítulos en vivo, ASR SenseVoice del lado del host mediante sherpa-onnx, respuestas habladas oración por oración, y hablar interrumpe la reproducción y el turno en curso (verdadera interrupción). Sin clave de API.

4el mes pasadoVisión, voz y multimodalMIT
F

dsh-chatvoice

fuzzysoul/dsh-chatvoice

Bucle de voz gratuito para la interfaz web: entrada de micrófono con SpeechRecognition del navegador con resultados provisionales en vivo, además de botones de altavoz para leer en voz alta y lectura automática de las respuestas del asistente, sin configuración y sin clave de API.

4hace 2 mesesVisión, voz y multimodalMIT
X

dsh-draw-router

xiaozhe7772222/dsh-draw-router

Enrutador unificado de generación de imágenes para DeepSeek Harness (DSH): descubre automáticamente modelos de imagen desde cualquier endpoint compatible con OpenAI, proporciona herramientas draw_image y draw_list_sources, y es compatible con SenseNova, StepFun, Agnes, Qwen, Flux, SD, Imagen y más.

4el mes pasadoVisión, voz y multimodalMIT
N

free-vision-skill

niyongsheng/free-vision-skill

Comprensión de imágenes y OCR completamente locales mediante el Vision Framework de macOS: `ocr_image` (texto, diseño de tabla + coordenadas) y `view_image` (escena, caras, QR): pega varias imágenes en el cuadro de entrada web o pasa ruta/URL/base64; las imágenes nunca salen de tu Mac.

4el mes pasadoVisión, voz y multimodalMIT
G

deepseek-vision (dsh-plugin-deepseek-vision)

gou-gee/deepseek-vision

Bundle MCP de visión y DSH para DeepSeek solo de texto: herramientas analyze_image, analyze_clipboard, compare_images y vision_status, una página de configuración visual, GLM-4.6V-Flash gratuito por defecto, almacenamiento en caché de resultados y tolerancia al límite de tasa; las claves no aparecen en los registros.

4hace 26 díasVisión, voz y multimodalMIT
F

dsh-plugin-deepeye

favio8/dsh-plugin-deepeye

Plugin de visión DeepEye para DeepSeek Harness (DSH): descripción de imágenes, OCR, VQA, diseño de UI y análisis del portapapeles.

4hace 2 mesesVisión, voz y multimodal
H

dsh-her-eyes

huashenglian/dsh-her-eyes

Un plugin de dsh que permite a la IA invocar automáticamente VLM (modelos multimodales) para el análisis visual.

4hace 2 mesesVisión, voz y multimodalMIT