- Inicio
- Categorías
- Visión, voz y multimodal
Visión, voz y multimodal
Los plugins de Visión, voz y multimodal dan ojos, oídos y voz a los modelos DeepSeek de solo texto en DeepSeek-Harness (dsh). Encuentra herramientas de visión y rutas de proveedor que hacen OCR y describen capturas pegadas mediante Zhipu GLM, Gemini, Doubao u Ollama local, entrada de voz por micrófono a través de la Web Speech API del navegador o APIs compatibles con Whisper, lectura en voz alta con Edge TTS o voces personalizadas, modos de voz full-duplex, y generadores de imágenes, vídeo y música.
312 plugins encontrados
dsh-vision-proxy
flyvhidbwo/dsh-vision-proxy
Cerebro DeepSeek + transcripción automática de imágenes: adjunta imágenes en la GUI y cada una se transcribe mediante el modelo oficial deepseek-v4-flash-vision-exp por defecto (un cerebro V4-Pro puramente textual puede ver imágenes), con cualquier VLM compatible con OpenAI u Ollama local como alternativas.
dsh-video-lens
dundunhan/dsh-video-lens
Da a los agentes de DeepSeek Harness solo de texto comprensión de vídeo: muestreo de fotogramas consciente de la escena + VLM + transcripción ASR opcional fusionados en evidencia de línea de tiempo. / Complemento de comprensión de vídeo para modelos solo de texto (muestreo de fotogramas consciente de la escena + VLM + transcripción de voz opcional).
dsh-vision-opencode
poiuyjie/dsh-vision-opencode
Añade un modelo de visión configurable a los modelos principales solo de texto: una herramienta vision_read_image, un selector de modelo de visión en la barra del compositor, y conversión automática de imagen a texto para rutas solo de texto.
dsh-agnes-studio
zmm863-commits/dsh-agnes-studio
Estudio de imagen y vídeo con IA como panel flotante de DSH, para que la creación transcurra junto a la conversación en lugar de sustituirla: texto a imagen, imagen a imagen y composición multi-imagen de 1K a 4K en ocho relaciones de aspecto; texto a vídeo e imagen a vídeo con control del primer fotograma de 4 a 12 segundos; modo cortometraje que importa un guion (.txt/.md/.json) y lo divide en planos de storyboard para previsualización y generación por lotes; y un espacio de trabajo de experto en prompts. Cero dependencias en tiempo de ejecución.
dsh-voice-ai-girlfriend-plugin
beiyege-01/dsh-voice-ai-girlfriend-plugin
Novia de IA por voz para la interfaz web: entrada de micrófono con FunASR, respuestas habladas con Qwen3-TTS, ventana de animación de compañía y chat bidireccional de QQ (texto/voz/imagen push) mediante NapCat.
dsh-plugin-xiaomi-mimo-tts
ppy-web/dsh-plugin-xiaomi-mimo-tts
Añade texto a voz Xiaomi MiMo a DSH Web con lectura en voz alta de los mensajes del asistente, streaming PCM, diseño de voz predefinido y personalizado, respaldo con la voz del navegador, controles de reproducción y sonidos de interfaz opcionales.
dsh-speak
alan2z/dsh-speak
Complemento de anuncios de voz basado en eventos y sin dependencias: sin modelo extra, sin coste de tokens. Habla con la voz natural integrada del sistema, compatible con Windows y macOS; anuncios de respuesta final, alertas de aprobación y preguntas, anuncios opcionales de eventos (fin de turno, comando completado, cambio de objetivo, errores de herramientas, actualizaciones de tareas), respuestas finales reproducibles y una página de ajustes visual bilingüe.
Gemini-Eyes
consolesun/gemini-eyes
Puente MCP hacia gemini.google.com: análisis de visión de imágenes y vídeos, generación de imágenes con Imagen y vídeos con Veo, y gestión de conversaciones usando la sesión del navegador ya iniciada, sin clave de API.
dsh-draw
perrylink/dsh-draw
Generación de texto a imagen con múltiples motores (OpenAI Images y presets de Zhipu CogView) con seguimiento de cuota por sesión, conmutación por error de motor, configuración segura de credenciales y una tarjeta de resultado con regenerar.
dsh-deepseek-vision
siegfly/dsh-deepseek-vision
Una ruta de proveedor de puerta de enlace de visión-lenguaje: las imágenes pegadas son descritas por un modelo VL configurable (Qwen-VL de forma predeterminada) antes de enviarse a DeepSeek.
dsh-vision
linenxi-ctrl/dsh-vision
Plugin de visión externo para DeepSeek Harness: panel de configuración con botón de ballena, reconocimiento de imágenes con respuesta automática, y herramientas de captura y reconocimiento para el agente.
dsh-highres-vision
azwosile/dsh-highres-vision
Para el modelo de visión nativo de DeepSeek Harness deepseek-v4-flash-vision-exp, eleva los límites de admisión de imágenes a 32 MiB / 8192 px / 600 imágenes y añade una herramienta highres_read que divide en mosaicos las imágenes grandes y luego devuelve la imagen completa más mosaicos de 800x800 a través de la herramienta read_image del host.
dsh-voice
goodandready/dsh-voice
Entrada de voz para la interfaz web: dictado segmentado por pausas y mensajes de voz, cada uno con su propia cadena de respaldo de proveedores (Deepgram, Groq, HuggingFace, whisper.cpp local o un endpoint compatible con OpenAI).
dsh-voice
3274375092/dsh-voice
Entrada de voz para DeepSeek Harness: habla al micrófono y el texto reconocido se envía como un mensaje de chat normal, mediante reconocimiento de voz local o del navegador.
dsh-free-vision
fuzzysoul/dsh-free-vision
Puente de visión gratuito para modelos solo de texto: comprensión de imágenes, OCR, análisis de interfaz y depuración a través de proveedores de nivel gratuito (Qwen3-VL-Flash, Doubao, DeepSeek-OCR) con una GUI de configuración.
dsh-chat-imagine
corrinehu/dsh-chat-imagine
Genera y muestra imágenes automáticamente en el chat de DSH a través de canales API o CLIs locales (mmx / codex / agy), y también puede reconocer imágenes usando la CLI correspondiente.
dsh-tool-vision
scorp1o117/dsh-tool-vision
Envía imágenes locales o URLs de imágenes HTTP(S) a un endpoint de visión compatible con OpenAI configurado con la herramienta inspect_image y devuelve su respuesta de texto a la conversación.
dsh-appshots
wongyuye/dsh-appshots
Captura de ventana al estilo Codex para DSH Desktop en macOS y Windows: pulsa ambas teclas Command (macOS) o ambas teclas Ctrl (Windows), o el botón de cámara, para capturar la ventana frontal, adjuntarla al chat actual e inyectar un árbol de accesibilidad estilo VoiceOver como contexto oculto.
dsh-vision
54xkeee/dsh-vision
Visión para DeepSeek de solo texto mediante Doubao Web de forma predeterminada (sin costo, sin clave de API: controla tu Chrome con sesión iniciada a través de un puente CDP de Windows), con cuota de Antigravity IDE (flash/pro) o alternativa a Gemini; escalado automático de detalle, memoria de evidencia visual con rehidratación tras compactación, caché por hash de contenido y un panel de cliente bilingüe.
dsh-duet
yums/dsh-duet
Interacción por voz en chino full-dúplex para DSH Web: dicta y edita tareas, envía solicitudes, gestiona sesiones, responde preguntas de DSH y escucha anuncios concisos de finalización de tareas.
deepseek-harness-plugins (vision-bridge)
yinxe/deepseek-harness-plugins
Deja que los modelos de solo texto vean imágenes: cuando llega una imagen con un marcador como \[image omitted because this model accepts text only], el modelo llama a la herramienta vision_describe y el plugin reenvía la referencia de la imagen junto con la pregunta a un modelo multimodal, reintentando con un modelo de reserva si falla. Se configura en la página de ajustes y se conserva mediante la API oficial de ajustes.
dsh-voice-input-plugin
zhangbo-cn/dsh-voice-input-plugin
Micrófono del compositor para la interfaz web: pulsa para monitorizar la transcripción en vivo y mantén pulsado para hablar, con lectura de respuesta mediante Edge TTS del host que se transmite mientras el modelo genera, pausa de eco durante la lectura y pulsa para detener.
dsh-ocr-local
grelvan/dsh-ocr-local
Fallback de OCR local para rutas solo de texto: cuando el modelo de sesión declara que no puede aceptar imágenes, la imagen adjunta se almacena en caché localmente y se inyecta su ruta para que el modelo pueda llamar a ocr_image — PP-OCRv5 + ONNX Runtime en CPU, sin clave de API, las imágenes nunca salen de la máquina. Silencioso cuando el modelo puede ver imágenes.
vision-exp-tile
nicholas023/vision-exp-tile
Reconocimiento de imágenes grandes para modelos vision-exp: reconocimiento por mosaicos 800×800 sin pérdida (smart/pipeline/full), OCR local con preprocesamiento y enrutamiento de escritura a mano, GPU multivendor opcional (DirectML/CUDA/OpenVINO) con fallback automático a CPU.