Saltar al contenido principal

Visión, voz y multimodal

Los plugins de Visión, voz y multimodal dan ojos, oídos y voz a los modelos DeepSeek de solo texto en DeepSeek-Harness (dsh). Encuentra herramientas de visión y rutas de proveedor que hacen OCR y describen capturas pegadas mediante Zhipu GLM, Gemini, Doubao u Ollama local, entrada de voz por micrófono a través de la Web Speech API del navegador o APIs compatibles con Whisper, lectura en voz alta con Edge TTS o voces personalizadas, modos de voz full-duplex, y generadores de imágenes, vídeo y música.

312 plugins encontrados

F

dsh-vision-proxy

flyvhidbwo/dsh-vision-proxy

Cerebro DeepSeek + transcripción automática de imágenes: adjunta imágenes en la GUI y cada una se transcribe mediante el modelo oficial deepseek-v4-flash-vision-exp por defecto (un cerebro V4-Pro puramente textual puede ver imágenes), con cualquier VLM compatible con OpenAI u Ollama local como alternativas.

15el mes pasadoVisión, voz y multimodalMIT
D

dsh-video-lens

dundunhan/dsh-video-lens

Da a los agentes de DeepSeek Harness solo de texto comprensión de vídeo: muestreo de fotogramas consciente de la escena + VLM + transcripción ASR opcional fusionados en evidencia de línea de tiempo. / Complemento de comprensión de vídeo para modelos solo de texto (muestreo de fotogramas consciente de la escena + VLM + transcripción de voz opcional).

13el mes pasadoVisión, voz y multimodalMIT
P

dsh-vision-opencode

poiuyjie/dsh-vision-opencode

Añade un modelo de visión configurable a los modelos principales solo de texto: una herramienta vision_read_image, un selector de modelo de visión en la barra del compositor, y conversión automática de imagen a texto para rutas solo de texto.

13hace 23 díasVisión, voz y multimodalMIT
Z

dsh-agnes-studio

zmm863-commits/dsh-agnes-studio

Estudio de imagen y vídeo con IA como panel flotante de DSH, para que la creación transcurra junto a la conversación en lugar de sustituirla: texto a imagen, imagen a imagen y composición multi-imagen de 1K a 4K en ocho relaciones de aspecto; texto a vídeo e imagen a vídeo con control del primer fotograma de 4 a 12 segundos; modo cortometraje que importa un guion (.txt/.md/.json) y lo divide en planos de storyboard para previsualización y generación por lotes; y un espacio de trabajo de experto en prompts. Cero dependencias en tiempo de ejecución.

12hace 3 díasVisión, voz y multimodal
B

dsh-voice-ai-girlfriend-plugin

beiyege-01/dsh-voice-ai-girlfriend-plugin

Novia de IA por voz para la interfaz web: entrada de micrófono con FunASR, respuestas habladas con Qwen3-TTS, ventana de animación de compañía y chat bidireccional de QQ (texto/voz/imagen push) mediante NapCat.

12hace 19 díasVisión, voz y multimodal
P

dsh-plugin-xiaomi-mimo-tts

ppy-web/dsh-plugin-xiaomi-mimo-tts

Añade texto a voz Xiaomi MiMo a DSH Web con lectura en voz alta de los mensajes del asistente, streaming PCM, diseño de voz predefinido y personalizado, respaldo con la voz del navegador, controles de reproducción y sonidos de interfaz opcionales.

11hace 3 díasVisión, voz y multimodalMIT
A

dsh-speak

alan2z/dsh-speak

Complemento de anuncios de voz basado en eventos y sin dependencias: sin modelo extra, sin coste de tokens. Habla con la voz natural integrada del sistema, compatible con Windows y macOS; anuncios de respuesta final, alertas de aprobación y preguntas, anuncios opcionales de eventos (fin de turno, comando completado, cambio de objetivo, errores de herramientas, actualizaciones de tareas), respuestas finales reproducibles y una página de ajustes visual bilingüe.

11hace 7 díasVisión, voz y multimodalMIT
C

Gemini-Eyes

consolesun/gemini-eyes

Puente MCP hacia gemini.google.com: análisis de visión de imágenes y vídeos, generación de imágenes con Imagen y vídeos con Veo, y gestión de conversaciones usando la sesión del navegador ya iniciada, sin clave de API.

11el mes pasadoVisión, voz y multimodal
P

dsh-draw

perrylink/dsh-draw

Generación de texto a imagen con múltiples motores (OpenAI Images y presets de Zhipu CogView) con seguimiento de cuota por sesión, conmutación por error de motor, configuración segura de credenciales y una tarjeta de resultado con regenerar.

9hace 8 díasVisión, voz y multimodalApache-2.0
S

dsh-deepseek-vision

siegfly/dsh-deepseek-vision

Una ruta de proveedor de puerta de enlace de visión-lenguaje: las imágenes pegadas son descritas por un modelo VL configurable (Qwen-VL de forma predeterminada) antes de enviarse a DeepSeek.

9hace 22 díasVisión, voz y multimodalMIT
L

dsh-vision

linenxi-ctrl/dsh-vision

Plugin de visión externo para DeepSeek Harness: panel de configuración con botón de ballena, reconocimiento de imágenes con respuesta automática, y herramientas de captura y reconocimiento para el agente.

9hace 2 mesesVisión, voz y multimodalMIT
A

dsh-highres-vision

azwosile/dsh-highres-vision

Para el modelo de visión nativo de DeepSeek Harness deepseek-v4-flash-vision-exp, eleva los límites de admisión de imágenes a 32 MiB / 8192 px / 600 imágenes y añade una herramienta highres_read que divide en mosaicos las imágenes grandes y luego devuelve la imagen completa más mosaicos de 800x800 a través de la herramienta read_image del host.

8hace 22 díasVisión, voz y multimodalMIT
G

dsh-voice

goodandready/dsh-voice

Entrada de voz para la interfaz web: dictado segmentado por pausas y mensajes de voz, cada uno con su propia cadena de respaldo de proveedores (Deepgram, Groq, HuggingFace, whisper.cpp local o un endpoint compatible con OpenAI).

8ayerVisión, voz y multimodalMIT
3

dsh-voice

3274375092/dsh-voice

Entrada de voz para DeepSeek Harness: habla al micrófono y el texto reconocido se envía como un mensaje de chat normal, mediante reconocimiento de voz local o del navegador.

8anteayerVisión, voz y multimodalMIT
F

dsh-free-vision

fuzzysoul/dsh-free-vision

Puente de visión gratuito para modelos solo de texto: comprensión de imágenes, OCR, análisis de interfaz y depuración a través de proveedores de nivel gratuito (Qwen3-VL-Flash, Doubao, DeepSeek-OCR) con una GUI de configuración.

8el mes pasadoVisión, voz y multimodalMIT
C

dsh-chat-imagine

corrinehu/dsh-chat-imagine

Genera y muestra imágenes automáticamente en el chat de DSH a través de canales API o CLIs locales (mmx / codex / agy), y también puede reconocer imágenes usando la CLI correspondiente.

8el mes pasadoVisión, voz y multimodalMIT
S

dsh-tool-vision

scorp1o117/dsh-tool-vision

Envía imágenes locales o URLs de imágenes HTTP(S) a un endpoint de visión compatible con OpenAI configurado con la herramienta inspect_image y devuelve su respuesta de texto a la conversación.

8hace 3 díasVisión, voz y multimodal
W

dsh-appshots

wongyuye/dsh-appshots

Captura de ventana al estilo Codex para DSH Desktop en macOS y Windows: pulsa ambas teclas Command (macOS) o ambas teclas Ctrl (Windows), o el botón de cámara, para capturar la ventana frontal, adjuntarla al chat actual e inyectar un árbol de accesibilidad estilo VoiceOver como contexto oculto.

7hace 15 díasVisión, voz y multimodalMIT
5

dsh-vision

54xkeee/dsh-vision

Visión para DeepSeek de solo texto mediante Doubao Web de forma predeterminada (sin costo, sin clave de API: controla tu Chrome con sesión iniciada a través de un puente CDP de Windows), con cuota de Antigravity IDE (flash/pro) o alternativa a Gemini; escalado automático de detalle, memoria de evidencia visual con rehidratación tras compactación, caché por hash de contenido y un panel de cliente bilingüe.

7hace 2 mesesVisión, voz y multimodalMIT
Y

dsh-duet

yums/dsh-duet

Interacción por voz en chino full-dúplex para DSH Web: dicta y edita tareas, envía solicitudes, gestiona sesiones, responde preguntas de DSH y escucha anuncios concisos de finalización de tareas.

6hace 3 díasVisión, voz y multimodalApache-2.0
Y

deepseek-harness-plugins (vision-bridge)

yinxe/deepseek-harness-plugins

Deja que los modelos de solo texto vean imágenes: cuando llega una imagen con un marcador como \[image omitted because this model accepts text only], el modelo llama a la herramienta vision_describe y el plugin reenvía la referencia de la imagen junto con la pregunta a un modelo multimodal, reintentando con un modelo de reserva si falla. Se configura en la página de ajustes y se conserva mediante la API oficial de ajustes.

6anteayerVisión, voz y multimodalMIT
Z

dsh-voice-input-plugin

zhangbo-cn/dsh-voice-input-plugin

Micrófono del compositor para la interfaz web: pulsa para monitorizar la transcripción en vivo y mantén pulsado para hablar, con lectura de respuesta mediante Edge TTS del host que se transmite mientras el modelo genera, pausa de eco durante la lectura y pulsa para detener.

6el mes pasadoVisión, voz y multimodalMIT
G

dsh-ocr-local

grelvan/dsh-ocr-local

Fallback de OCR local para rutas solo de texto: cuando el modelo de sesión declara que no puede aceptar imágenes, la imagen adjunta se almacena en caché localmente y se inyecta su ruta para que el modelo pueda llamar a ocr_image — PP-OCRv5 + ONNX Runtime en CPU, sin clave de API, las imágenes nunca salen de la máquina. Silencioso cuando el modelo puede ver imágenes.

5hace 5 díasVisión, voz y multimodal
N

vision-exp-tile

nicholas023/vision-exp-tile

Reconocimiento de imágenes grandes para modelos vision-exp: reconocimiento por mosaicos 800×800 sin pérdida (smart/pipeline/full), OCR local con preprocesamiento y enrutamiento de escritura a mano, GPU multivendor opcional (DirectML/CUDA/OpenVINO) con fallback automático a CPU.

5el mes pasadoVisión, voz y multimodalMIT