Saltar al contenido principal

Visión, voz y multimodal

Los plugins de Visión, voz y multimodal dan ojos, oídos y voz a los modelos DeepSeek de solo texto en DeepSeek-Harness (dsh). Encuentra herramientas de visión y rutas de proveedor que hacen OCR y describen capturas pegadas mediante Zhipu GLM, Gemini, Doubao u Ollama local, entrada de voz por micrófono a través de la Web Speech API del navegador o APIs compatibles con Whisper, lectura en voz alta con Edge TTS o voces personalizadas, modos de voz full-duplex, y generadores de imágenes, vídeo y música.

312 plugins encontrados

1

dsh-vision-sidecar

121103qwq/dsh-vision-sidecar

Sidecar de visión gratuito y alojado para DeepSeek Harness, con evidencia de sesión duradera

4hace 2 mesesVisión, voz y multimodalMIT
Y

dsh-image-subagent

yuqingsh/dsh-image-subagent

4hace 2 mesesVisión, voz y multimodalMIT
G

dsh-vision-bridge

gxx182/dsh-vision-bridge

Conecta las imágenes de la sesión a proveedores de visión configurables y devuelve análisis de solo texto a las rutas de modelos elegibles de DeepSeek Harness.

4hace 2 mesesVisión, voz y multimodalMIT
H

dsh-omni-workstation

huashenglian/dsh-omni-workstation

Estación de trabajo omnimodal para DSH: analyze_image sobre una cadena ordenada de conmutación por error VLM de varias tarjetas, un conjunto de seis herramientas de visión (zoom, muestreo de color, diferencia de píxeles, OCR, detección de elementos y visualización en línea) que comparten el mismo resolutor de imágenes, generate_image mediante los protocolos OpenAI/DashScope/ComfyUI, generate_video asíncrono con varias tarjetas y un constructor /build-video-tool, y speak/clone_voice TTS en siete proveedores, todo gobernado por una única página de ajustes con autoguardado.

3hace 14 díasVisión, voz y multimodalMIT
W

dsh-hold-to-talk

wangzhanchao883/dsh-hold-to-talk

Entrada con una sola mano y sin teclado para el compositor: mantén pulsado el ratón sobre el cuadro de entrada, habla y suelta — el texto aparece en el borrador, y deslizar hacia arriba cancela sin dejar media frase. No hay botón de micrófono al que apuntar ni atajo que recordar; la mano nunca tiene que salir del área de entrada, que es justo lo importante cuando la otra mano está ocupada. El reconocimiento se ejecuta totalmente sin conexión (SenseVoice mediante sherpa-onnx, sin clave de API, el audio nunca sale del equipo).

3ayerVisión, voz y multimodalMIT
N

dsh-plugin-speech

nakamuraia/dsh-plugin-speech

Lee en voz alta las respuestas del asistente en DeepSeek Harness: proveedores de texto a voz con reproducción en streaming.

3hace 18 díasVisión, voz y multimodalMIT
S

dsh-voice-assistant

supersyh-sss/dsh-voice-assistant

Asistente de voz para dsh web: di la frase de activación (p. ej. «小鲸») para activar el dictado manos libres — lo que dices se transcribe y se escribe automáticamente en el cuadro de chat. Admite comandos de edición hablados (enviar, borrar, nueva línea, detener la lectura) y lee en voz alta las respuestas del asistente en chino. El reconocimiento de voz se ejecuta localmente en el navegador mediante sherpa-onnx WASM, así que funciona sin conexión y sin clave de API.

3el mes pasadoVisión, voz y multimodalMIT
S

dsh-audiogen

shimingming520/dsh-audiogen

Generación de audio con IA para la GUI web de DeepSeek Harness: TTS de múltiples proveedores, música, efectos de sonido y diseño de voz con panel lateral, comparación de modelos, biblioteca de recursos y herramientas de Agent.

3hace 24 díasVisión, voz y multimodalApache-2.0
L

dsh-voco

lgquan/dsh-voco

Conversaciones de voz continuas para DSH con escucha manos libres, pulsar para hablar, reconocimiento de voz, respuestas TTS y delegación de Agent en segundo plano.

3el mes pasadoVisión, voz y multimodalMIT
T

dsh-gsv

taoruiliu19/dsh-gsv

TTS local en tiempo real para DeepSeek Harness: preajustes de voz, lectura automática, asistente de configuración del motor, botón de lectura en voz alta y un panel de ajustes para el motor GSV-TTS-Lite.

3el mes pasadoVisión, voz y multimodalMIT
J

dsh-ximalaya

jerryqx/dsh-ximalaya

Escucha pódcasts y audiolibros de Ximalaya dentro de la interfaz web de DSH: busca álbumes, explora pistas paginadas y reproduce desde una barra de reproducción (anterior/reproducir/siguiente, avance, volumen, velocidad). Tras iniciar sesión con QR, la página «Mío» lista tus pistas marcadas como favoritas (clic para reproducir), los álbumes suscritos con pistas del último episodio y los locutores seguidos con sus álbumes públicos; el host retransmite los flujos de audio con soporte de Range y registra una herramienta `ximalaya_play` para que el agente pueda buscar y reproducir cuando se lo pidas.

3el mes pasadoVisión, voz y multimodalMIT
B

phone-eye

boheastill/phone-eye

Permite que tu agente de IA vea y maneje un teléfono Android real: phone_look (fusión de visión y árbol de interfaz), tocar/deslizar/escribir, captura de pantalla — por adb, para cualquier cliente MCP.

3el mes pasadoVisión, voz y multimodalMIT
X

dsh-image-vision

xiaoyuink/dsh-image-vision

Comprensión de imágenes para cualquier modelo de DSH: herramientas de visión, OCR, grounding y recorte con presets de dominio para histopatología, biología celular, anatomía, imágenes clínicas y figuras científicas.

3hace 29 díasVisión, voz y multimodal
L

Deepseek-Continuity

linxuhao/deepseek-continuity

Generación local de imagen, voz, música y efectos de sonido, además de transcripción, con identidad fijada: los personajes, animales, objetos y voces de actores se definen una vez y se reutilizan en cada llamada posterior; la salida degenerada (una imagen casi plana, audio silencioso) se rechaza en lugar de devolverse como éxito, y una línea generada puede leerse de vuelta como texto para que un clon que se tragó su final se haga visible. Los motores se descargan cuando están inactivos, y la generación de imágenes y la transcripción pueden apuntar cada una a una API con forma de OpenAI en lugar del backend local Vulkan.

3hace 12 díasVisión, voz y multimodalMIT
Y

dsh-ui-spec

yumimanji/dsh-ui-spec

Complemento de DeepSeek Harness que convierte capturas de pantalla de UI en especificaciones web de grado de implementación usando OCR, geometría determinista, grafos de escena, recursos y comparación de renderizado.

3hace 2 mesesVisión, voz y multimodalMIT
D

deepseekeyes

dttxorg/deepseekeyes

Runtime de visión auditable y Computer Use multiplataforma para DeepSeek Harness con evidencia que preserva la fuente.

3hace 2 mesesVisión, voz y multimodalMIT
N

voco-input-sh

nothree-code/voco-input-sh

Entrada por voz para la interfaz web: un botón de micrófono que activa el reconocimiento de voz local sin conexión VocoType y auto inserta el texto reconocido en el compositor (despliegue automático, deduplicación, dictado continuo).

3hace 20 díasVisión, voz y multimodalMIT
B

dsh-stt-input

baisama-cloud/dsh-stt-input

Entrada de voz con conversión voz a texto para la interfaz web: un botón de micrófono en el compositor transcribe el habla al borrador mediante la API Web Speech del navegador (sin configuración) o una API Whisper compatible con OpenAI (OpenAI / Groq), con un modelo e idioma seleccionables en Ajustes.

3el mes pasadoVisión, voz y multimodalMIT
W

visual-review

wang-bool/visual-review

Renderiza en línea las imágenes pegadas o subidas dentro del chat de DSH Web y da visión a los modelos solo de texto: la herramienta visual_review, invocable por el modelo, llama primero a cualquier API multimodal compatible con OpenAI y, si falla, recurre a un worker local de Qwen3-VL.

3hace 2 mesesVisión, voz y multimodalMIT
T

dsh-plugins (dsh-vision)

tzhr-invest/dsh-plugins

Herramienta de visión invocable por agentes que describe imágenes locales mediante cualquier endpoint de visión compatible con OpenAI que configures, con verificación cruzada opcional de varios modelos y sin claves integradas.

3hace 5 díasVisión, voz y multimodalMIT
S

dsh-plugin-multimodal

shinjiyu/dsh-plugin-multimodal

Anuncia el pegado de imágenes en rutas de DeepSeek solo de texto, describe los archivos adjuntos con un sidecar de visión y deja intactos los modelos de visión nativos.

3hace 2 mesesVisión, voz y multimodalMIT
M

dsh-vision-tools

moon09300731/dsh-vision-tools

Paquete completo de capacidades de visión para DeepSeek Harness: una herramienta vision_understand (APIs de visión compatibles con OpenAI, Zhipu GLM-4V-Flash gratuito por defecto) además de puntos de entrada de pegar/arrastrar y soltar/botón para reconocimiento de imágenes.

3hace 2 mesesVisión, voz y multimodalMIT
L

dsh-plugin-grok2api-media-tool

lsjspl/dsh-plugin-grok2api-media-tool

Da a dsh la capacidad de generar imágenes y vídeos a través de la API grok2api.

3el mes pasadoVisión, voz y multimodal
L

dsh-image-gen

leemancheung/dsh-image-gen

`image_gen` de GPT Image 2 con OAuth de suscripción Codex por defecto o modo explícito de clave API: tarjeta en desarrollo, hasta tres parciales de API en vivo, reproducción duradera de adjuntos / lightbox / descarga, salida de modelo solo texto y solicitudes acotadas seguras con credenciales.

3hace 6 díasVisión, voz y multimodalMIT