Saltar al contenido principal

Visión, voz y multimodal

Los plugins de Visión, voz y multimodal dan ojos, oídos y voz a los modelos DeepSeek de solo texto en DeepSeek-Harness (dsh). Encuentra herramientas de visión y rutas de proveedor que hacen OCR y describen capturas pegadas mediante Zhipu GLM, Gemini, Doubao u Ollama local, entrada de voz por micrófono a través de la Web Speech API del navegador o APIs compatibles con Whisper, lectura en voz alta con Edge TTS o voces personalizadas, modos de voz full-duplex, y generadores de imágenes, vídeo y música.

312 plugins encontrados

A

dsh-voice-kit

aaaadrop/dsh-voice-kit

Entrada de voz (Web Speech API) y lectura en voz alta (speechSynthesis) para la interfaz web de DeepSeek Harness — Kit de entrada de voz y lectura de respuestas de DSH

1el mes pasadoVisión, voz y multimodalMIT
E

dsh-sight

ericfetch/dsh-sight

Plugin de DeepSeek Harness: declaraciones directas de transferencia de imágenes multimodales + borrado de imágenes por sesión (reemplazo de superficie), con una página de configuración y controles en el compositor.

1el mes pasadoVisión, voz y multimodalMIT
H

dsh-open-file

hyper-dsh-plugins/dsh-open-file

Carga de archivos arbitrarios ligada al workspace, lectura, OCR y renderizado para DeepSeek Harness.

1hace 2 mesesVisión, voz y multimodalMIT
Y

dsh-multimodal

yauntyour/dsh-multimodal

Cadenas multimodales por tipo de archivo: los modelos de procesamiento predefinidos por comodín convierten archivos de imagen, vídeo y audio en tokens de prompt antes de que lleguen al modelo de sesión solo texto, con cadenas de respaldo por preajuste y una página de ajustes Multimodal.

1hace 2 mesesVisión, voz y multimodalMIT
L

dsh-voice-input

lhenlihai-hub/dsh-voice-input

1hace 2 mesesVisión, voz y multimodalMIT
A

dsh-vision-bridge

acc1143/dsh-vision-bridge

Plugin de enrutamiento de dos modelos para DSH: la conversación principal permanece en DeepSeek, las tareas con imágenes se distribuyen automáticamente al modelo de visión configurado explícitamente y el resultado del análisis vuelve a DeepSeek para continuar.

1hace 2 mesesVisión, voz y multimodalMIT
3

dsh-vision

314857493/dsh-vision

Plugin de DeepSeek Harness: una ruta `deepseek-vision` que declara entrada de imágenes y transcribe las imágenes pegadas mediante los modelos de visión gratuitos Zhipu GLM antes de delegar en el adaptador de DeepSeek.

1hace 2 mesesVisión, voz y multimodalMIT
A

dsh-image-plugins

alanzhao0128/dsh-image-plugins

Plugin multimodal para DeepSeek Harness: comprende imágenes y genera imágenes a través de endpoints compatibles con OpenAI o DashScope configurables.

1hace 2 mesesVisión, voz y multimodalMIT
Z

dsh-plugins

zjcdkj/dsh-plugins

Plugin out-of-tree para DeepSeek Harness: da ojos a un modelo de código solo de texto enrutando imágenes a una ruta Qwen-VL (DashScope) a través de ctx.llm y devolviendo texto.

1hace 2 mesesVisión, voz y multimodalMIT
H

dsh-open-file

hyp6666/dsh-open-file

Subida, lectura, OCR y renderizado de archivos arbitrarios vinculados al espacio de trabajo para DeepSeek Harness.

1hace 2 mesesVisión, voz y multimodalMIT
X

dsh-image-vision

xsoc1/dsh-image-vision

Puente de adjuntos de imágenes en el chat con una herramienta view_image para cualquier VLM compatible con OpenAI (Ollama local o nube): las imágenes pegadas/arrastradas se convierten en marcadores de ruta view_image antes de llegar a los modelos DeepSeek de solo texto.

1hace 2 mesesVisión, voz y multimodal
W

mimo-vision

wulusai2333/mimo-vision

Herramienta `describe_image`: un puente de visión que envía imágenes a mimo-v2.5 mediante la API opencode Zen (credencial `OPENCODE_GO_API_KEY`, ruta gratuita primero con respaldo de pago) y devuelve descripciones de texto para modelos solo de texto, con paso nativo y transcodificación ImageMagick de formatos SVG/TIFF/HEIC.

1hace 2 mesesVisión, voz y multimodalMIT
W

dsh-tool-vision

wanshichenguang/dsh-tool-vision

Herramienta image_describe (识图) orientada al modelo sobre la API compatible con OpenAI de DashScope (qwen3.7-flash), más un puente de pegado: en sesiones solo texto, las imágenes pegadas se convierten automáticamente en rutas de archivo al enviar y se vuelven a renderizar en la transcripción, para que nunca tropiecen con la admisión de imágenes. Trae tu propia DASHSCOPE_API_KEY; endpoint/modelo/presupuestos configurables, cliente HTTP a prueba de redirecciones y funciona en todos los agent presets.

1hace 2 mesesVisión, voz y multimodalMIT
R

dsh-vision-subagent

ruby1304/dsh-vision-subagent

Visión para cualquier ruta de DSH: pega imágenes en el compositor web con análisis automático según la intención, delega la lectura de imágenes del espacio de trabajo a un subagente de visión Kimi/MiniMax y materializa los originales pegados para editarlos.

1hace 23 díasVisión, voz y multimodalMIT
N

dsh-auto-vision

normanfxxkingrockwell/dsh-auto-vision

Puente de visión con autodescubrimiento para agentes DeepSeek Harness solo de texto: encuentra automáticamente un modelo capaz de procesar imágenes entre tus proveedores configurados y devuelve descripciones de las imágenes como texto plano mediante una herramienta de visión.

1hace 18 díasVisión, voz y multimodalMIT
N

dsh-llm-deepseek-vision

nagasakisoyo-ui/dsh-llm-deepseek-vision

Adaptador DeepSeek aumentado con visión: un modelo con capacidad de visión describe la imagen de entrada y luego un modelo DeepSeek solo de texto razona sobre esa descripción.

1hace 2 mesesVisión, voz y multimodalMIT
L

dsh-eyes

leeminjing/dsh-eyes

Visión bajo demanda para modelos DeepSeek solo de texto: sube imágenes y el modelo llama a una herramienta view_image respaldada por cualquier endpoint de visión compatible con OpenAI (Qwen/DashScope por defecto).

1hace 2 mesesVisión, voz y multimodalMIT
K

dsh-mindseye

kanchengw/dsh-mindseye

Visión como plugin para modelos solo de texto en DSH, con interacción nativa para comprensión y generación de imágenes, automatización de GUI, memoria de evidencia por capas y caché.

1el mes pasadoVisión, voz y multimodalMIT
G

dsh-tool-vision

gloryxpnv/dsh-tool-vision

Visión estructurada local-first para agentes solo de texto: las imágenes van a un VLM local compatible con OpenAI y vuelven como evidencia JSON (resumen, OCR literal, regiones de diseño, entidades/relaciones, colores, incertidumbre explícita), con respaldo anti-alucinación y un puente opcional de pegado/subida; coste en la nube cero, las imágenes nunca salen de la máquina.

1hace 2 mesesVisión, voz y multimodalMIT
E

dsh-plugin-mm-vision

elohia/dsh-plugin-mm-vision

Codificador de sinestesia para DSH: un modelo de visión traduce las imágenes a texto espacial estructurado y compacto (lienzo/elementos/coordenadas en porcentaje), dando a los LLM solo de texto comprensión de imagen a nivel de píxel mediante la herramienta `mm_vision`.

1hace 2 mesesVisión, voz y multimodalMIT
C

dsh-deepseek-vision

cheng-cheng9669/dsh-deepseek-vision

Reutiliza el modo de visión integrado de DeepSeek web para modelos solo de texto: la herramienta deepseek_vision controla la automatización de navegador local deepseek-vision-cli (ayuda de inicio de sesión manual, deep-think activado, cierre automático del navegador) y devuelve descripciones de imágenes como texto.

1hace 2 mesesVisión, voz y multimodalMIT
1

dsh-vision-fallback

1helloman1/dsh-vision-fallback

Enruta las imágenes del chat a un modelo de visión fijo compatible con OpenAI, devuelve observaciones factuales al modelo principal seleccionado y reutiliza las observaciones por sesión a través de repeticiones, compactación y reinicios.

1el mes pasadoVisión, voz y multimodalMIT
Z

dsh-voice

zhuiyueya/dsh-voice

Voz para DeepSeek Harness (dsh): entrada de voz a texto y lectura en voz alta mediante TTS para DeepSeek de solo texto, sin necesidad de clave de API.

1hace 2 mesesVisión, voz y multimodalMIT
S

multimodal-bridge

spirit4471/multimodal-bridge

Paquete de plugins de DeepSeek Harness: herramientas qwen_vision (comprensión de imágenes con Qwen-VL) y qwen_generate (texto a imagen con Qwen-Image) para modelos de solo texto

1hace 2 mesesVisión, voz y multimodalMIT