- Inicio
- Categorías
- Visión, voz y multimodal
Visión, voz y multimodal
Los plugins de Visión, voz y multimodal dan ojos, oídos y voz a los modelos DeepSeek de solo texto en DeepSeek-Harness (dsh). Encuentra herramientas de visión y rutas de proveedor que hacen OCR y describen capturas pegadas mediante Zhipu GLM, Gemini, Doubao u Ollama local, entrada de voz por micrófono a través de la Web Speech API del navegador o APIs compatibles con Whisper, lectura en voz alta con Edge TTS o voces personalizadas, modos de voz full-duplex, y generadores de imágenes, vídeo y música.
312 plugins encontrados
dsh-voice-kit
aaaadrop/dsh-voice-kit
Entrada de voz (Web Speech API) y lectura en voz alta (speechSynthesis) para la interfaz web de DeepSeek Harness — Kit de entrada de voz y lectura de respuestas de DSH
dsh-sight
ericfetch/dsh-sight
Plugin de DeepSeek Harness: declaraciones directas de transferencia de imágenes multimodales + borrado de imágenes por sesión (reemplazo de superficie), con una página de configuración y controles en el compositor.
dsh-open-file
hyper-dsh-plugins/dsh-open-file
Carga de archivos arbitrarios ligada al workspace, lectura, OCR y renderizado para DeepSeek Harness.
dsh-multimodal
yauntyour/dsh-multimodal
Cadenas multimodales por tipo de archivo: los modelos de procesamiento predefinidos por comodín convierten archivos de imagen, vídeo y audio en tokens de prompt antes de que lleguen al modelo de sesión solo texto, con cadenas de respaldo por preajuste y una página de ajustes Multimodal.
dsh-voice-input
lhenlihai-hub/dsh-voice-input
dsh-vision-bridge
acc1143/dsh-vision-bridge
Plugin de enrutamiento de dos modelos para DSH: la conversación principal permanece en DeepSeek, las tareas con imágenes se distribuyen automáticamente al modelo de visión configurado explícitamente y el resultado del análisis vuelve a DeepSeek para continuar.
dsh-vision
314857493/dsh-vision
Plugin de DeepSeek Harness: una ruta `deepseek-vision` que declara entrada de imágenes y transcribe las imágenes pegadas mediante los modelos de visión gratuitos Zhipu GLM antes de delegar en el adaptador de DeepSeek.
dsh-image-plugins
alanzhao0128/dsh-image-plugins
Plugin multimodal para DeepSeek Harness: comprende imágenes y genera imágenes a través de endpoints compatibles con OpenAI o DashScope configurables.
dsh-plugins
zjcdkj/dsh-plugins
Plugin out-of-tree para DeepSeek Harness: da ojos a un modelo de código solo de texto enrutando imágenes a una ruta Qwen-VL (DashScope) a través de ctx.llm y devolviendo texto.
dsh-open-file
hyp6666/dsh-open-file
Subida, lectura, OCR y renderizado de archivos arbitrarios vinculados al espacio de trabajo para DeepSeek Harness.
dsh-image-vision
xsoc1/dsh-image-vision
Puente de adjuntos de imágenes en el chat con una herramienta view_image para cualquier VLM compatible con OpenAI (Ollama local o nube): las imágenes pegadas/arrastradas se convierten en marcadores de ruta view_image antes de llegar a los modelos DeepSeek de solo texto.
mimo-vision
wulusai2333/mimo-vision
Herramienta `describe_image`: un puente de visión que envía imágenes a mimo-v2.5 mediante la API opencode Zen (credencial `OPENCODE_GO_API_KEY`, ruta gratuita primero con respaldo de pago) y devuelve descripciones de texto para modelos solo de texto, con paso nativo y transcodificación ImageMagick de formatos SVG/TIFF/HEIC.
dsh-tool-vision
wanshichenguang/dsh-tool-vision
Herramienta image_describe (识图) orientada al modelo sobre la API compatible con OpenAI de DashScope (qwen3.7-flash), más un puente de pegado: en sesiones solo texto, las imágenes pegadas se convierten automáticamente en rutas de archivo al enviar y se vuelven a renderizar en la transcripción, para que nunca tropiecen con la admisión de imágenes. Trae tu propia DASHSCOPE_API_KEY; endpoint/modelo/presupuestos configurables, cliente HTTP a prueba de redirecciones y funciona en todos los agent presets.
dsh-vision-subagent
ruby1304/dsh-vision-subagent
Visión para cualquier ruta de DSH: pega imágenes en el compositor web con análisis automático según la intención, delega la lectura de imágenes del espacio de trabajo a un subagente de visión Kimi/MiniMax y materializa los originales pegados para editarlos.
dsh-auto-vision
normanfxxkingrockwell/dsh-auto-vision
Puente de visión con autodescubrimiento para agentes DeepSeek Harness solo de texto: encuentra automáticamente un modelo capaz de procesar imágenes entre tus proveedores configurados y devuelve descripciones de las imágenes como texto plano mediante una herramienta de visión.
dsh-llm-deepseek-vision
nagasakisoyo-ui/dsh-llm-deepseek-vision
Adaptador DeepSeek aumentado con visión: un modelo con capacidad de visión describe la imagen de entrada y luego un modelo DeepSeek solo de texto razona sobre esa descripción.
dsh-eyes
leeminjing/dsh-eyes
Visión bajo demanda para modelos DeepSeek solo de texto: sube imágenes y el modelo llama a una herramienta view_image respaldada por cualquier endpoint de visión compatible con OpenAI (Qwen/DashScope por defecto).
dsh-mindseye
kanchengw/dsh-mindseye
Visión como plugin para modelos solo de texto en DSH, con interacción nativa para comprensión y generación de imágenes, automatización de GUI, memoria de evidencia por capas y caché.
dsh-tool-vision
gloryxpnv/dsh-tool-vision
Visión estructurada local-first para agentes solo de texto: las imágenes van a un VLM local compatible con OpenAI y vuelven como evidencia JSON (resumen, OCR literal, regiones de diseño, entidades/relaciones, colores, incertidumbre explícita), con respaldo anti-alucinación y un puente opcional de pegado/subida; coste en la nube cero, las imágenes nunca salen de la máquina.
dsh-plugin-mm-vision
elohia/dsh-plugin-mm-vision
Codificador de sinestesia para DSH: un modelo de visión traduce las imágenes a texto espacial estructurado y compacto (lienzo/elementos/coordenadas en porcentaje), dando a los LLM solo de texto comprensión de imagen a nivel de píxel mediante la herramienta `mm_vision`.
dsh-deepseek-vision
cheng-cheng9669/dsh-deepseek-vision
Reutiliza el modo de visión integrado de DeepSeek web para modelos solo de texto: la herramienta deepseek_vision controla la automatización de navegador local deepseek-vision-cli (ayuda de inicio de sesión manual, deep-think activado, cierre automático del navegador) y devuelve descripciones de imágenes como texto.
dsh-vision-fallback
1helloman1/dsh-vision-fallback
Enruta las imágenes del chat a un modelo de visión fijo compatible con OpenAI, devuelve observaciones factuales al modelo principal seleccionado y reutiliza las observaciones por sesión a través de repeticiones, compactación y reinicios.
dsh-voice
zhuiyueya/dsh-voice
Voz para DeepSeek Harness (dsh): entrada de voz a texto y lectura en voz alta mediante TTS para DeepSeek de solo texto, sin necesidad de clave de API.
multimodal-bridge
spirit4471/multimodal-bridge
Paquete de plugins de DeepSeek Harness: herramientas qwen_vision (comprensión de imágenes con Qwen-VL) y qwen_generate (texto a imagen con Qwen-Image) para modelos de solo texto