- Inicio
- Categorías
- Visión, voz y multimodal
Visión, voz y multimodal
Los plugins de Visión, voz y multimodal dan ojos, oídos y voz a los modelos DeepSeek de solo texto en DeepSeek-Harness (dsh). Encuentra herramientas de visión y rutas de proveedor que hacen OCR y describen capturas pegadas mediante Zhipu GLM, Gemini, Doubao u Ollama local, entrada de voz por micrófono a través de la Web Speech API del navegador o APIs compatibles con Whisper, lectura en voz alta con Edge TTS o voces personalizadas, modos de voz full-duplex, y generadores de imágenes, vídeo y música.
312 plugins encontrados
dsh-vision-mix
haiziyao/dsh-vision-mix
Combina APIs de texto, visión y generación de imágenes en un único modelo Mix con enrutamiento automático: las solicitudes de solo texto van al modelo de chat, las imágenes del usuario y las capturas del agente van al modelo de visión, los seguimientos siguen usando la misma imagen de sesión, y los agentes pueden generar o editar imágenes con un historial de llamadas con alcance de sesión.
dsh-ernie-image
omdsh-dev/dsh-ernie-image
openflowframes
zerohackz/openflowframes
dsh-paddle-ocr
omdsh-dev/dsh-paddle-ocr
dsh-plugin-aigc-canvas
huanlinoto/dsh-plugin-aigc-canvas
Puente HTTP de AIGC independiente del proveedor + lienzo infinito + posprocesado con ffmpeg; 13 herramientas, incluyendo conexión de nodos en el lienzo, reroll y edición de medios
dsh-voice
jesse-njx/dsh-voice
Notas de voz de entrada, respuestas habladas de salida: dicta audio que se convierte en mensajes de usuario (transcribir), haz que el agente lea las respuestas en voz alta (hablar), con prioridad local bajo ~/.dsh/voice.
dsh-llm-vision-bridge
einskyle/dsh-llm-vision-bridge
Puente de visión nativo del proveedor LLM: las imágenes pegadas en el chat son descritas por un modelo de visión (Qwen3-VL vía pi-ai/llama.cpp) y esa descripción de texto se envía a DeepSeek de solo texto para la respuesta; la admisión de imágenes, el enrutamiento y la compactación pasan por mecanismos nativos del harness, con una caché LRU de descripciones y reintento en 503.
dsh-mic-input
qt-chen/dsh-mic-input
Entrada de voz por micrófono para el editor: transcripción en vivo mediante la Web Speech API del navegador, deduplicación/continuación automática, puntuación inteligente, y ajustes de idioma y envío automático.
dsh-open-eyes
hyper-dsh-plugins/dsh-open-eyes
Puente de visión para rutas de DeepSeek solo texto que analiza imágenes adjuntas y locales mediante endpoints configurables de OpenAI Responses, Chat Completions o Anthropic Messages, dejando nativas las rutas con capacidad de imagen.
dsh-gpt-image
cai-mh/dsh-gpt-image
Genera imágenes a través de una sesión web de ChatGPT ya iniciada y descárgalas a un directorio local.
dsh-ui-mockup
mackwan84/dsh-ui-mockup
Consumer de la herramienta ui_mockup: genera wireframes y bocetos de alta fidelidad de UI en la fase de debate, guarda el diseño en disco, pide confirmación y bloquea la especificación de diseño; incluye tarjetas de cliente, enrutado de imágenes e i18n.
dsh-voice-call
biliye/dsh-voice-call
Asistente de llamadas de voz para la GUI web de DSH: una bola de llamada flotante y arrastrable, VAD en el navegador que envía cada intervención tras una pausa, reconocimiento de voz FunASR HTTP o en streaming, respuestas TTS de MiniMax o compatibles con OpenAI, un modo opcional de palabra de activación con auto-suspensión y despacho de tareas a sesiones de subagente separadas con progreso, parada e informes hablados de finalización.
dsh-tool-lipsync
yu-wenchao/dsh-tool-lipsync
Plugin gratuito de generación de video con lip-sync para DSH con más de 3000 voces y más de 500 idiomas.
dsh-vision-plugin
bug-huntter/dsh-vision-plugin
Reconocimiento de imágenes configurable para modelos DSH solo de texto: los mensajes de imagen se transcriben primero mediante un modelo de visión compatible con OpenAI (URL base, ID de modelo y clave API configurados en una sección de Ajustes) y luego se pasan al modelo principal como texto, mientras se anuncia la compatibilidad con entrada de imágenes. El esquema de autenticación de la clave API es seleccionable (cabeceras de petición estilo OpenAI, Anthropic, Gemini o Azure) y se notifica la falta de una clave antes de enviar cualquier petición.
dseyesopen
balue8246-maker/dseyesopen
Puente de visión para DeepSeek solo de texto: envía imágenes (solas o mezcladas con texto) y un modelo de visión pequeño y rápido las describe entre bastidores; el chat conserva la imagen y DeepSeek solo ve texto. Complemento puro: al desinstalarlo se restaura todo.
dsh-visibridge
lhbsaa/dsh-visibridge
Evidencia visual estructurada (OCR/distribución/semántica) además de una herramienta de captura con cámara USB para un bucle de depuración «disparar-mirar-ajustar»; backends: Ollama, DeepSeek, Xiaomi.
dsh-short-video-studio
fengyungithub/dsh-short-video-studio
Banco de trabajo de creación de vídeo con IA de tipo MiniMax-Design basado en deepseek harness.
dsh-watch-video
zeshuochen/dsh-watch-video
Transcripción de vídeo que prioriza los subtítulos con exportación a SRT, controles de trabajos cancelables y un respaldo faster-whisper large-v3 cuando no hay subtítulos disponibles.
dsh-voice-agent (voice-app)
wayneyu430/dsh-voice-agent
Un agente frontal de voz conversacional para dsh: habla con naturalidad mediante ByteDance Duplex, delega solicitudes a tareas en segundo plano y escucha sus resultados asíncronos informados por voz.
dsh-voice-chat
maoyuching/dsh-voice-chat
Chat de voz estilo Doubao para DSH: mantener pulsado el micrófono del compositor convierte la voz en texto y la envía automáticamente, y las respuestas de la IA se leen en voz alta. Condensado opcional por LLM (las respuestas largas se resumen en frases habladas cortas siguiendo el modelo de la conversación actual), limpieza de texto apta para TTS, voces Edge TTS seleccionables, parada automática por silencio ajustable y ajustes integrados en el diálogo de configuración de DSH.
phone-lens (phone-lens)
yxqfg/phone-lens
Convierte la cámara de un teléfono en un visor en vivo y entrada de fotos para tu sesión dsh, por LAN o USB.
dsh-capture
max-null/dsh-capture
Captura de pantalla de doble motor para DSH: dentro del shell de escritorio SSiD, un atajo global o la bandeja abre una superposición de selección por recuadro a pantalla completa (todos los monitores, fotogramas píxel-perfecto por pantalla) con anotación de recuadro rojo en el lugar y una barra de herramientas estilo WeChat; en DSH sencillo (navegador), el botón de cámara del compositor captura la pantalla vía getDisplayMedia y reutiliza en la página la misma superposición de selección por recuadro + anotación en una sola fase. La imagen recortada llega al compositor de la conversación actual a través de la vía oficial de adjuntos.
phone-lens (lens-mate)
yxqfg/phone-lens
Convierte la cámara de un teléfono en visor en vivo y entrada de fotos para tu sesión de dsh, por LAN o USB.
dsh-labnana
exoticknight/dsh-labnana
Generación de imágenes Labnana para DeepSeek Harness: texto a imagen / imagen a imagen / edición precisa con estimación de créditos, saldo de suscripción e interfaz de ajustes web.