Saltar al contenido principal

Visión, voz y multimodal

Los plugins de Visión, voz y multimodal dan ojos, oídos y voz a los modelos DeepSeek de solo texto en DeepSeek-Harness (dsh). Encuentra herramientas de visión y rutas de proveedor que hacen OCR y describen capturas pegadas mediante Zhipu GLM, Gemini, Doubao u Ollama local, entrada de voz por micrófono a través de la Web Speech API del navegador o APIs compatibles con Whisper, lectura en voz alta con Edge TTS o voces personalizadas, modos de voz full-duplex, y generadores de imágenes, vídeo y música.

312 plugins encontrados

Z

dsh-web-ui (dsh-tool-describe-image)

zhu1090093659/dsh-web-ui

Una herramienta de visión `describe_image` para modelos solo de texto: las imágenes (ruta local, URL, adjunto) se envían a un endpoint de visión configurable compatible con OpenAI y solo el texto devuelto entra en la sesión.

8khace 6 díasVisión, voz y multimodalApache-2.0
D

ipollowork

devin-axis/ipollowork

iPolloWork HyperFrames Video Studio y 27 plantillas de video editables como una vista de conversación nativa de DeepSeek Harness.

4.2khace 2 mesesVisión, voz y multimodal
L

modlens

liustack/modlens

Puente de visión para modelos de solo texto: pega una imagen y obtén evidencia JSON estructurada (OCR, diseño, semántica).

4.1khace 5 díasVisión, voz y multimodalMIT
Y

dsh-vision-router

ysr666/dsh-vision-router

Visión gratuita para agentes de solo texto: cadena de visión integrada sin clave más herramientas de píxeles (preguntas y respuestas, grounding, recorte, diff de píxeles, colores, OCR, trazado SVG, recorte de figuras, capturas de pantalla); pega una imagen para usarla.

1.1kayerVisión, voz y multimodalMIT
A

dsh-vision-toolkit

anionex/dsh-vision-toolkit

Visión para modelos solo de texto: al pegar una imagen, el modelo cambia a la variante Vision Toolkit para preguntas y respuestas sobre imágenes, comparación de múltiples imágenes, OCR de capturas largas, reproducción de UI a partir de capturas, localización de elementos y diferencias de píxeles. Sin clave de API por defecto — las imágenes se procesan mediante el servicio gratuito alojado por el autor, 100 por máquina al día; configurable a tu propio proveedor.

887anteayerVisión, voz y multimodalMIT
T

tongflow

tong-io/tongflow

Complemento de estudio TongFlow para DeepSeek Harness (dsh): modelo de proyecto al estilo de un equipo de rodaje, flujos de trabajo TongFlow creados por el agente, generación multimedia determinista, lienzo integrado.

870el mes pasadoVisión, voz y multimodalAGPL-3.0
S

dsh-image-gen

shanliuling/dsh-image-gen

Generación de imágenes conversacional nativa para DeepSeek Harness: pide al agente que cree una imagen y se encarga de la generación y conserva el resultado directamente en la conversación.

564hace 3 díasVisión, voz y multimodalApache-2.0
O

watch-skill

oxbshw/watch-skill

Las capacidades de DeepWatch, instalables en un perfil de DeepSeek Harness existente.

378hace 18 díasVisión, voz y multimodalMIT
D

dsh-imagegen

dickpy/dsh-imagegen

Generación de imágenes con IA para la GUI web de DSH: texto a imagen e imagen a imagen mediante un endpoint configurable compatible con OpenAI (gpt-image-2 / gpt-image-1 / dall-e-3), con una tarjeta de configuración api_url/api_key y un estudio de generación de panel dividido en la barra lateral.

99anteayerVisión, voz y multimodalApache-2.0
F

dsh-comfyui

fandc520/dsh-comfyui

Controla un servidor ComfyUI local o remoto desde DeepSeek Harness: las herramientas comfyui_run / comfyui_object_info / comfyui_workflow generan y editan imágenes y vídeos, con una biblioteca de flujos de trabajo (extracción de grafos: por componente / flujo principal / todo), un área de carga con coincidencia automática de resolución, una cola en vivo, plantillas de SDXL y Wan 2.1, una habilidad complementaria y un proxy de medios del mismo origen.

93hace 6 díasVisión, voz y multimodalMIT
P

dsh-omi-voice

polinnizhong/dsh-omi-voice

Lectura en voz alta dentro del chat para DeepSeek Harness: toca para leer, pausar y reanudar las respuestas de la IA con voces naturales de Doubao TTS (BYOK); lee solo la respuesta final, con código, tablas y diagramas filtrados; motor local, el complemento no guarda ninguna clave de API.

74el mes pasadoVisión, voz y multimodalMIT
C

deepseek-harness-video-director

chiphoton/deepseek-harness-video-director

🎬Director impulsado por IA: plugin de generación de vídeo MiniMax-H3 dirigido por DeepSeek-Harness. 🤖Más que prompts. 🪄UI de lienzo.

69hace 4 díasVisión, voz y multimodalMIT
S

dsh-design-qa

sunxin-ai/dsh-design-qa

QA de fidelidad de diseño para modelos solo de texto: una herramienta `deepseek_vision` toma prestado un ojo de cualquier ruta de visión compatible con OpenAI, de modo que el modelo pueda juzgar si una implementación coincide con su maqueta — se entrega con el benchmark detrás de ese juicio (cuatro fixtures, 23 defectos inyectados, transcripciones en bruto) y la disciplina de cuestionamiento de la que depende.

44hace 26 díasVisión, voz y multimodalMIT
J

picturereader

jing-hy/picturereader

"Lectura" de imágenes para modelos de solo texto: reduce la escala + reduce la profundidad de color + convierte huellas de estructura/color en cuadrículas de texto que se devuelven a la conversación, permitiendo que el modelo haga zoom, muestreo y OCR de forma autónoma como un modelo multimodal; totalmente local y sin dependencia de modelos externos, incluye una skill de metodología de lectura de imágenes y PaddleOCR opcional.

37hace 3 díasVisión, voz y multimodalMIT
P

dsh-voice-scribe

pensivefei/dsh-voice-scribe

Entrada de voz para la interfaz web: pulsa Alt (o Alt+Space) para iniciar/detener el dictado, Web Speech del navegador (sin configuración) o ASR en la nube compatible con OpenAI, pulido opcional mediante el LLM configurado en DSH, interfaz de ajustes.

34hace 3 díasVisión, voz y multimodalMIT
O

dsh-vision

oil-oil/dsh-vision

Comprensión de imágenes casi nativa para DeepSeek Harness

24hace 2 mesesVisión, voz y multimodalMIT
D

dsh-web-ui (dsh-tool-describe-image)

damonkoy/dsh-web-ui

Proporciona a un modelo solo de texto comprensión de imágenes mediante un modelo de visión-lenguaje, expuesto como herramienta `describe_image`.

22hace 2 mesesVisión, voz y multimodalApache-2.0
W

dsh-ears

wiziscool/dsh-ears

Plugin de entrada de voz para DeepSeek Harness (dsh): un botón de micrófono en el compositor convierte el habla en un borrador transcrito, con opción de backends de reconocimiento de voz, pulido opcional mediante las rutas LLM propias de dsh y una página de configuración nativa.

21ayerVisión, voz y multimodalMIT
1

dsh-plugin-tts

1624318455/dsh-plugin-tts

Lee en voz alta las respuestas del asistente mediante Edge TTS gratuito o tus propios modelos de voz RVC: botones de lectura en voz alta + lectura automática, reproducción progresiva por fragmentos adaptativa (lecturas largas sin cortes), instalación de paquetes de voz con un clic desde un registro y un runtime RVC portátil.

21hace 6 díasVisión, voz y multimodalMIT
M

dsh-media-skills

mjorgin/dsh-media-skills

Puente de visión gratuito y generación de imágenes para modelos de solo texto: lectura de imágenes pegadas, conmutación por error entre los motores GLM-4V-Flash y Gemini, evidencia estructurada al estilo ModLens, y una ruta de modelo de visión gratuita preconfigurada.

19hace 12 díasVisión, voz y multimodalMIT
D

dsh-aigc-canvas

dsh-external/dsh-aigc-canvas

Plugin de lienzo AIGC (cordis).

17hace 22 díasVisión, voz y multimodal
P

dsh-talk

perrylink/dsh-talk

Entrada/salida de voz para DeepSeek Harness: reconocimiento de voz a texto y texto a voz a través del micrófono y la salida de audio.

16hace 8 díasVisión, voz y multimodalApache-2.0
J

dsh-visual-plugin

jyh20030112/dsh-visual-plugin

Da visión a los modelos solo de texto: reenvía las imágenes del usuario a un modelo de visión compatible con OpenAI y muestra las descripciones en un panel derecho de la interfaz web.

16hace 3 díasVisión, voz y multimodalMIT
Q

dsh-voice-mode (dsh-voice-mode)

qishuilalala/dsh-voice-mode

Modo de voz dúplex completo para la interfaz web de DeepSeek Harness: conmutación (envío automático tras pausa de 2 s) o dictado pulsar-para-hablar en un borrador editable con ASR en streaming zipformer2, palabra de activación opcional; lectura en voz alta Edge TTS oración por oración con subtítulos en vivo, y la voz interrumpe la reproducción y el turno en curso (barge-in real). ASR en el dispositivo, sin clave de API.

15hace 10 horasVisión, voz y multimodalMIT