Saltar al contenido principal

Visión, voz y multimodal

Los plugins de Visión, voz y multimodal dan ojos, oídos y voz a los modelos DeepSeek de solo texto en DeepSeek-Harness (dsh). Encuentra herramientas de visión y rutas de proveedor que hacen OCR y describen capturas pegadas mediante Zhipu GLM, Gemini, Doubao u Ollama local, entrada de voz por micrófono a través de la Web Speech API del navegador o APIs compatibles con Whisper, lectura en voz alta con Edge TTS o voces personalizadas, modos de voz full-duplex, y generadores de imágenes, vídeo y música.

312 plugins encontrados

H

dsh-vision-mix

haiziyao/dsh-vision-mix

Combina APIs de texto, visión y generación de imágenes en un único modelo Mix con enrutamiento automático: las solicitudes de solo texto van al modelo de chat, las imágenes del usuario y las capturas del agente van al modelo de visión, los seguimientos siguen usando la misma imagen de sesión, y los agentes pueden generar o editar imágenes con un historial de llamadas con alcance de sesión.

3hace 25 díasVisión, voz y multimodalMIT
O

dsh-ernie-image

omdsh-dev/dsh-ernie-image

3hace 2 mesesVisión, voz y multimodalBSD-3-Clause
Z

openflowframes

zerohackz/openflowframes

3hace 2 mesesVisión, voz y multimodalGPL-3.0
O

dsh-paddle-ocr

omdsh-dev/dsh-paddle-ocr

3hace 2 mesesVisión, voz y multimodalBSD-3-Clause
H

dsh-plugin-aigc-canvas

huanlinoto/dsh-plugin-aigc-canvas

Puente HTTP de AIGC independiente del proveedor + lienzo infinito + posprocesado con ffmpeg; 13 herramientas, incluyendo conexión de nodos en el lienzo, reroll y edición de medios

3hace 2 mesesVisión, voz y multimodal
J

dsh-voice

jesse-njx/dsh-voice

Notas de voz de entrada, respuestas habladas de salida: dicta audio que se convierte en mensajes de usuario (transcribir), haz que el agente lea las respuestas en voz alta (hablar), con prioridad local bajo ~/.dsh/voice.

3hace 2 mesesVisión, voz y multimodalMIT
E

dsh-llm-vision-bridge

einskyle/dsh-llm-vision-bridge

Puente de visión nativo del proveedor LLM: las imágenes pegadas en el chat son descritas por un modelo de visión (Qwen3-VL vía pi-ai/llama.cpp) y esa descripción de texto se envía a DeepSeek de solo texto para la respuesta; la admisión de imágenes, el enrutamiento y la compactación pasan por mecanismos nativos del harness, con una caché LRU de descripciones y reintento en 503.

3hace 2 mesesVisión, voz y multimodalMIT
Q

dsh-mic-input

qt-chen/dsh-mic-input

Entrada de voz por micrófono para el editor: transcripción en vivo mediante la Web Speech API del navegador, deduplicación/continuación automática, puntuación inteligente, y ajustes de idioma y envío automático.

3hace 2 mesesVisión, voz y multimodalMIT
H

dsh-open-eyes

hyper-dsh-plugins/dsh-open-eyes

Puente de visión para rutas de DeepSeek solo texto que analiza imágenes adjuntas y locales mediante endpoints configurables de OpenAI Responses, Chat Completions o Anthropic Messages, dejando nativas las rutas con capacidad de imagen.

2hace 27 díasVisión, voz y multimodalMIT
C

dsh-gpt-image

cai-mh/dsh-gpt-image

Genera imágenes a través de una sesión web de ChatGPT ya iniciada y descárgalas a un directorio local.

2hace 24 díasVisión, voz y multimodalMIT
M

dsh-ui-mockup

mackwan84/dsh-ui-mockup

Consumer de la herramienta ui_mockup: genera wireframes y bocetos de alta fidelidad de UI en la fase de debate, guarda el diseño en disco, pide confirmación y bloquea la especificación de diseño; incluye tarjetas de cliente, enrutado de imágenes e i18n.

2hace 22 díasVisión, voz y multimodalMIT
B

dsh-voice-call

biliye/dsh-voice-call

Asistente de llamadas de voz para la GUI web de DSH: una bola de llamada flotante y arrastrable, VAD en el navegador que envía cada intervención tras una pausa, reconocimiento de voz FunASR HTTP o en streaming, respuestas TTS de MiniMax o compatibles con OpenAI, un modo opcional de palabra de activación con auto-suspensión y despacho de tareas a sesiones de subagente separadas con progreso, parada e informes hablados de finalización.

2hace 5 díasVisión, voz y multimodalMIT
Y

dsh-tool-lipsync

yu-wenchao/dsh-tool-lipsync

Plugin gratuito de generación de video con lip-sync para DSH con más de 3000 voces y más de 500 idiomas.

2hace 28 díasVisión, voz y multimodalMIT
B

dsh-vision-plugin

bug-huntter/dsh-vision-plugin

Reconocimiento de imágenes configurable para modelos DSH solo de texto: los mensajes de imagen se transcriben primero mediante un modelo de visión compatible con OpenAI (URL base, ID de modelo y clave API configurados en una sección de Ajustes) y luego se pasan al modelo principal como texto, mientras se anuncia la compatibilidad con entrada de imágenes. El esquema de autenticación de la clave API es seleccionable (cabeceras de petición estilo OpenAI, Anthropic, Gemini o Azure) y se notifica la falta de una clave antes de enviar cualquier petición.

2hace 5 díasVisión, voz y multimodalMIT
B

dseyesopen

balue8246-maker/dseyesopen

Puente de visión para DeepSeek solo de texto: envía imágenes (solas o mezcladas con texto) y un modelo de visión pequeño y rápido las describe entre bastidores; el chat conserva la imagen y DeepSeek solo ve texto. Complemento puro: al desinstalarlo se restaura todo.

2el mes pasadoVisión, voz y multimodal
L

dsh-visibridge

lhbsaa/dsh-visibridge

Evidencia visual estructurada (OCR/distribución/semántica) además de una herramienta de captura con cámara USB para un bucle de depuración «disparar-mirar-ajustar»; backends: Ollama, DeepSeek, Xiaomi.

2el mes pasadoVisión, voz y multimodalMIT
F

dsh-short-video-studio

fengyungithub/dsh-short-video-studio

Banco de trabajo de creación de vídeo con IA de tipo MiniMax-Design basado en deepseek harness.

2el mes pasadoVisión, voz y multimodalApache-2.0
Z

dsh-watch-video

zeshuochen/dsh-watch-video

Transcripción de vídeo que prioriza los subtítulos con exportación a SRT, controles de trabajos cancelables y un respaldo faster-whisper large-v3 cuando no hay subtítulos disponibles.

2el mes pasadoVisión, voz y multimodal
W

dsh-voice-agent (voice-app)

wayneyu430/dsh-voice-agent

Un agente frontal de voz conversacional para dsh: habla con naturalidad mediante ByteDance Duplex, delega solicitudes a tareas en segundo plano y escucha sus resultados asíncronos informados por voz.

2el mes pasadoVisión, voz y multimodal
M

dsh-voice-chat

maoyuching/dsh-voice-chat

Chat de voz estilo Doubao para DSH: mantener pulsado el micrófono del compositor convierte la voz en texto y la envía automáticamente, y las respuestas de la IA se leen en voz alta. Condensado opcional por LLM (las respuestas largas se resumen en frases habladas cortas siguiendo el modelo de la conversación actual), limpieza de texto apta para TTS, voces Edge TTS seleccionables, parada automática por silencio ajustable y ajustes integrados en el diálogo de configuración de DSH.

2hace 8 díasVisión, voz y multimodalMIT
Y

phone-lens (phone-lens)

yxqfg/phone-lens

Convierte la cámara de un teléfono en un visor en vivo y entrada de fotos para tu sesión dsh, por LAN o USB.

2hace 3 díasVisión, voz y multimodalMIT
M

dsh-capture

max-null/dsh-capture

Captura de pantalla de doble motor para DSH: dentro del shell de escritorio SSiD, un atajo global o la bandeja abre una superposición de selección por recuadro a pantalla completa (todos los monitores, fotogramas píxel-perfecto por pantalla) con anotación de recuadro rojo en el lugar y una barra de herramientas estilo WeChat; en DSH sencillo (navegador), el botón de cámara del compositor captura la pantalla vía getDisplayMedia y reutiliza en la página la misma superposición de selección por recuadro + anotación en una sola fase. La imagen recortada llega al compositor de la conversación actual a través de la vía oficial de adjuntos.

2hace 4 díasVisión, voz y multimodalMIT
Y

phone-lens (lens-mate)

yxqfg/phone-lens

Convierte la cámara de un teléfono en visor en vivo y entrada de fotos para tu sesión de dsh, por LAN o USB.

2el mes pasadoVisión, voz y multimodalMIT
E

dsh-labnana

exoticknight/dsh-labnana

Generación de imágenes Labnana para DeepSeek Harness: texto a imagen / imagen a imagen / edición precisa con estimación de créditos, saldo de suscripción e interfaz de ajustes web.

2hace 9 díasVisión, voz y multimodalApache-2.0