- Inicio
- Categorías
- Visión, voz y multimodal
Visión, voz y multimodal
Los plugins de Visión, voz y multimodal dan ojos, oídos y voz a los modelos DeepSeek de solo texto en DeepSeek-Harness (dsh). Encuentra herramientas de visión y rutas de proveedor que hacen OCR y describen capturas pegadas mediante Zhipu GLM, Gemini, Doubao u Ollama local, entrada de voz por micrófono a través de la Web Speech API del navegador o APIs compatibles con Whisper, lectura en voz alta con Edge TTS o voces personalizadas, modos de voz full-duplex, y generadores de imágenes, vídeo y música.
312 plugins encontrados
dsh-web-ui (dsh-tool-describe-image)
zhu1090093659/dsh-web-ui
Una herramienta de visión `describe_image` para modelos solo de texto: las imágenes (ruta local, URL, adjunto) se envían a un endpoint de visión configurable compatible con OpenAI y solo el texto devuelto entra en la sesión.
ipollowork
devin-axis/ipollowork
iPolloWork HyperFrames Video Studio y 27 plantillas de video editables como una vista de conversación nativa de DeepSeek Harness.
modlens
liustack/modlens
Puente de visión para modelos de solo texto: pega una imagen y obtén evidencia JSON estructurada (OCR, diseño, semántica).
dsh-vision-router
ysr666/dsh-vision-router
Visión gratuita para agentes de solo texto: cadena de visión integrada sin clave más herramientas de píxeles (preguntas y respuestas, grounding, recorte, diff de píxeles, colores, OCR, trazado SVG, recorte de figuras, capturas de pantalla); pega una imagen para usarla.
dsh-vision-toolkit
anionex/dsh-vision-toolkit
Visión para modelos solo de texto: al pegar una imagen, el modelo cambia a la variante Vision Toolkit para preguntas y respuestas sobre imágenes, comparación de múltiples imágenes, OCR de capturas largas, reproducción de UI a partir de capturas, localización de elementos y diferencias de píxeles. Sin clave de API por defecto — las imágenes se procesan mediante el servicio gratuito alojado por el autor, 100 por máquina al día; configurable a tu propio proveedor.
tongflow
tong-io/tongflow
Complemento de estudio TongFlow para DeepSeek Harness (dsh): modelo de proyecto al estilo de un equipo de rodaje, flujos de trabajo TongFlow creados por el agente, generación multimedia determinista, lienzo integrado.
dsh-image-gen
shanliuling/dsh-image-gen
Generación de imágenes conversacional nativa para DeepSeek Harness: pide al agente que cree una imagen y se encarga de la generación y conserva el resultado directamente en la conversación.
watch-skill
oxbshw/watch-skill
Las capacidades de DeepWatch, instalables en un perfil de DeepSeek Harness existente.
dsh-imagegen
dickpy/dsh-imagegen
Generación de imágenes con IA para la GUI web de DSH: texto a imagen e imagen a imagen mediante un endpoint configurable compatible con OpenAI (gpt-image-2 / gpt-image-1 / dall-e-3), con una tarjeta de configuración api_url/api_key y un estudio de generación de panel dividido en la barra lateral.
dsh-comfyui
fandc520/dsh-comfyui
Controla un servidor ComfyUI local o remoto desde DeepSeek Harness: las herramientas comfyui_run / comfyui_object_info / comfyui_workflow generan y editan imágenes y vídeos, con una biblioteca de flujos de trabajo (extracción de grafos: por componente / flujo principal / todo), un área de carga con coincidencia automática de resolución, una cola en vivo, plantillas de SDXL y Wan 2.1, una habilidad complementaria y un proxy de medios del mismo origen.
dsh-omi-voice
polinnizhong/dsh-omi-voice
Lectura en voz alta dentro del chat para DeepSeek Harness: toca para leer, pausar y reanudar las respuestas de la IA con voces naturales de Doubao TTS (BYOK); lee solo la respuesta final, con código, tablas y diagramas filtrados; motor local, el complemento no guarda ninguna clave de API.
deepseek-harness-video-director
chiphoton/deepseek-harness-video-director
🎬Director impulsado por IA: plugin de generación de vídeo MiniMax-H3 dirigido por DeepSeek-Harness. 🤖Más que prompts. 🪄UI de lienzo.
dsh-design-qa
sunxin-ai/dsh-design-qa
QA de fidelidad de diseño para modelos solo de texto: una herramienta `deepseek_vision` toma prestado un ojo de cualquier ruta de visión compatible con OpenAI, de modo que el modelo pueda juzgar si una implementación coincide con su maqueta — se entrega con el benchmark detrás de ese juicio (cuatro fixtures, 23 defectos inyectados, transcripciones en bruto) y la disciplina de cuestionamiento de la que depende.
picturereader
jing-hy/picturereader
"Lectura" de imágenes para modelos de solo texto: reduce la escala + reduce la profundidad de color + convierte huellas de estructura/color en cuadrículas de texto que se devuelven a la conversación, permitiendo que el modelo haga zoom, muestreo y OCR de forma autónoma como un modelo multimodal; totalmente local y sin dependencia de modelos externos, incluye una skill de metodología de lectura de imágenes y PaddleOCR opcional.
dsh-voice-scribe
pensivefei/dsh-voice-scribe
Entrada de voz para la interfaz web: pulsa Alt (o Alt+Space) para iniciar/detener el dictado, Web Speech del navegador (sin configuración) o ASR en la nube compatible con OpenAI, pulido opcional mediante el LLM configurado en DSH, interfaz de ajustes.
dsh-vision
oil-oil/dsh-vision
Comprensión de imágenes casi nativa para DeepSeek Harness
dsh-web-ui (dsh-tool-describe-image)
damonkoy/dsh-web-ui
Proporciona a un modelo solo de texto comprensión de imágenes mediante un modelo de visión-lenguaje, expuesto como herramienta `describe_image`.
dsh-ears
wiziscool/dsh-ears
Plugin de entrada de voz para DeepSeek Harness (dsh): un botón de micrófono en el compositor convierte el habla en un borrador transcrito, con opción de backends de reconocimiento de voz, pulido opcional mediante las rutas LLM propias de dsh y una página de configuración nativa.
dsh-plugin-tts
1624318455/dsh-plugin-tts
Lee en voz alta las respuestas del asistente mediante Edge TTS gratuito o tus propios modelos de voz RVC: botones de lectura en voz alta + lectura automática, reproducción progresiva por fragmentos adaptativa (lecturas largas sin cortes), instalación de paquetes de voz con un clic desde un registro y un runtime RVC portátil.
dsh-media-skills
mjorgin/dsh-media-skills
Puente de visión gratuito y generación de imágenes para modelos de solo texto: lectura de imágenes pegadas, conmutación por error entre los motores GLM-4V-Flash y Gemini, evidencia estructurada al estilo ModLens, y una ruta de modelo de visión gratuita preconfigurada.
dsh-aigc-canvas
dsh-external/dsh-aigc-canvas
Plugin de lienzo AIGC (cordis).
dsh-talk
perrylink/dsh-talk
Entrada/salida de voz para DeepSeek Harness: reconocimiento de voz a texto y texto a voz a través del micrófono y la salida de audio.
dsh-visual-plugin
jyh20030112/dsh-visual-plugin
Da visión a los modelos solo de texto: reenvía las imágenes del usuario a un modelo de visión compatible con OpenAI y muestra las descripciones en un panel derecho de la interfaz web.
dsh-voice-mode (dsh-voice-mode)
qishuilalala/dsh-voice-mode
Modo de voz dúplex completo para la interfaz web de DeepSeek Harness: conmutación (envío automático tras pausa de 2 s) o dictado pulsar-para-hablar en un borrador editable con ASR en streaming zipformer2, palabra de activación opcional; lectura en voz alta Edge TTS oración por oración con subtítulos en vivo, y la voz interrumpe la reproducción y el turno en curso (barge-in real). ASR en el dispositivo, sin clave de API.