- Inicio
- Categorías
- Visión, voz y multimodal
Visión, voz y multimodal
Los plugins de Visión, voz y multimodal dan ojos, oídos y voz a los modelos DeepSeek de solo texto en DeepSeek-Harness (dsh). Encuentra herramientas de visión y rutas de proveedor que hacen OCR y describen capturas pegadas mediante Zhipu GLM, Gemini, Doubao u Ollama local, entrada de voz por micrófono a través de la Web Speech API del navegador o APIs compatibles con Whisper, lectura en voz alta con Edge TTS o voces personalizadas, modos de voz full-duplex, y generadores de imágenes, vídeo y música.
312 plugins encontrados
dsh-vision-sidecar
121103qwq/dsh-vision-sidecar
Sidecar de visión gratuito y alojado para DeepSeek Harness, con evidencia de sesión duradera
dsh-image-subagent
yuqingsh/dsh-image-subagent
dsh-vision-bridge
gxx182/dsh-vision-bridge
Conecta las imágenes de la sesión a proveedores de visión configurables y devuelve análisis de solo texto a las rutas de modelos elegibles de DeepSeek Harness.
dsh-omni-workstation
huashenglian/dsh-omni-workstation
Estación de trabajo omnimodal para DSH: analyze_image sobre una cadena ordenada de conmutación por error VLM de varias tarjetas, un conjunto de seis herramientas de visión (zoom, muestreo de color, diferencia de píxeles, OCR, detección de elementos y visualización en línea) que comparten el mismo resolutor de imágenes, generate_image mediante los protocolos OpenAI/DashScope/ComfyUI, generate_video asíncrono con varias tarjetas y un constructor /build-video-tool, y speak/clone_voice TTS en siete proveedores, todo gobernado por una única página de ajustes con autoguardado.
dsh-hold-to-talk
wangzhanchao883/dsh-hold-to-talk
Entrada con una sola mano y sin teclado para el compositor: mantén pulsado el ratón sobre el cuadro de entrada, habla y suelta — el texto aparece en el borrador, y deslizar hacia arriba cancela sin dejar media frase. No hay botón de micrófono al que apuntar ni atajo que recordar; la mano nunca tiene que salir del área de entrada, que es justo lo importante cuando la otra mano está ocupada. El reconocimiento se ejecuta totalmente sin conexión (SenseVoice mediante sherpa-onnx, sin clave de API, el audio nunca sale del equipo).
dsh-plugin-speech
nakamuraia/dsh-plugin-speech
Lee en voz alta las respuestas del asistente en DeepSeek Harness: proveedores de texto a voz con reproducción en streaming.
dsh-voice-assistant
supersyh-sss/dsh-voice-assistant
Asistente de voz para dsh web: di la frase de activación (p. ej. «小鲸») para activar el dictado manos libres — lo que dices se transcribe y se escribe automáticamente en el cuadro de chat. Admite comandos de edición hablados (enviar, borrar, nueva línea, detener la lectura) y lee en voz alta las respuestas del asistente en chino. El reconocimiento de voz se ejecuta localmente en el navegador mediante sherpa-onnx WASM, así que funciona sin conexión y sin clave de API.
dsh-audiogen
shimingming520/dsh-audiogen
Generación de audio con IA para la GUI web de DeepSeek Harness: TTS de múltiples proveedores, música, efectos de sonido y diseño de voz con panel lateral, comparación de modelos, biblioteca de recursos y herramientas de Agent.
dsh-voco
lgquan/dsh-voco
Conversaciones de voz continuas para DSH con escucha manos libres, pulsar para hablar, reconocimiento de voz, respuestas TTS y delegación de Agent en segundo plano.
dsh-gsv
taoruiliu19/dsh-gsv
TTS local en tiempo real para DeepSeek Harness: preajustes de voz, lectura automática, asistente de configuración del motor, botón de lectura en voz alta y un panel de ajustes para el motor GSV-TTS-Lite.
dsh-ximalaya
jerryqx/dsh-ximalaya
Escucha pódcasts y audiolibros de Ximalaya dentro de la interfaz web de DSH: busca álbumes, explora pistas paginadas y reproduce desde una barra de reproducción (anterior/reproducir/siguiente, avance, volumen, velocidad). Tras iniciar sesión con QR, la página «Mío» lista tus pistas marcadas como favoritas (clic para reproducir), los álbumes suscritos con pistas del último episodio y los locutores seguidos con sus álbumes públicos; el host retransmite los flujos de audio con soporte de Range y registra una herramienta `ximalaya_play` para que el agente pueda buscar y reproducir cuando se lo pidas.
phone-eye
boheastill/phone-eye
Permite que tu agente de IA vea y maneje un teléfono Android real: phone_look (fusión de visión y árbol de interfaz), tocar/deslizar/escribir, captura de pantalla — por adb, para cualquier cliente MCP.
dsh-image-vision
xiaoyuink/dsh-image-vision
Comprensión de imágenes para cualquier modelo de DSH: herramientas de visión, OCR, grounding y recorte con presets de dominio para histopatología, biología celular, anatomía, imágenes clínicas y figuras científicas.
Deepseek-Continuity
linxuhao/deepseek-continuity
Generación local de imagen, voz, música y efectos de sonido, además de transcripción, con identidad fijada: los personajes, animales, objetos y voces de actores se definen una vez y se reutilizan en cada llamada posterior; la salida degenerada (una imagen casi plana, audio silencioso) se rechaza en lugar de devolverse como éxito, y una línea generada puede leerse de vuelta como texto para que un clon que se tragó su final se haga visible. Los motores se descargan cuando están inactivos, y la generación de imágenes y la transcripción pueden apuntar cada una a una API con forma de OpenAI en lugar del backend local Vulkan.
dsh-ui-spec
yumimanji/dsh-ui-spec
Complemento de DeepSeek Harness que convierte capturas de pantalla de UI en especificaciones web de grado de implementación usando OCR, geometría determinista, grafos de escena, recursos y comparación de renderizado.
deepseekeyes
dttxorg/deepseekeyes
Runtime de visión auditable y Computer Use multiplataforma para DeepSeek Harness con evidencia que preserva la fuente.
voco-input-sh
nothree-code/voco-input-sh
Entrada por voz para la interfaz web: un botón de micrófono que activa el reconocimiento de voz local sin conexión VocoType y auto inserta el texto reconocido en el compositor (despliegue automático, deduplicación, dictado continuo).
dsh-stt-input
baisama-cloud/dsh-stt-input
Entrada de voz con conversión voz a texto para la interfaz web: un botón de micrófono en el compositor transcribe el habla al borrador mediante la API Web Speech del navegador (sin configuración) o una API Whisper compatible con OpenAI (OpenAI / Groq), con un modelo e idioma seleccionables en Ajustes.
visual-review
wang-bool/visual-review
Renderiza en línea las imágenes pegadas o subidas dentro del chat de DSH Web y da visión a los modelos solo de texto: la herramienta visual_review, invocable por el modelo, llama primero a cualquier API multimodal compatible con OpenAI y, si falla, recurre a un worker local de Qwen3-VL.
dsh-plugins (dsh-vision)
tzhr-invest/dsh-plugins
Herramienta de visión invocable por agentes que describe imágenes locales mediante cualquier endpoint de visión compatible con OpenAI que configures, con verificación cruzada opcional de varios modelos y sin claves integradas.
dsh-plugin-multimodal
shinjiyu/dsh-plugin-multimodal
Anuncia el pegado de imágenes en rutas de DeepSeek solo de texto, describe los archivos adjuntos con un sidecar de visión y deja intactos los modelos de visión nativos.
dsh-vision-tools
moon09300731/dsh-vision-tools
Paquete completo de capacidades de visión para DeepSeek Harness: una herramienta vision_understand (APIs de visión compatibles con OpenAI, Zhipu GLM-4V-Flash gratuito por defecto) además de puntos de entrada de pegar/arrastrar y soltar/botón para reconocimiento de imágenes.
dsh-plugin-grok2api-media-tool
lsjspl/dsh-plugin-grok2api-media-tool
Da a dsh la capacidad de generar imágenes y vídeos a través de la API grok2api.
dsh-image-gen
leemancheung/dsh-image-gen
`image_gen` de GPT Image 2 con OAuth de suscripción Codex por defecto o modo explícito de clave API: tarjeta en desarrollo, hasta tres parciales de API en vivo, reproducción duradera de adjuntos / lightbox / descarga, salida de modelo solo texto y solicitudes acotadas seguras con credenciales.