- Inicio
- Categorías
- Visión, voz y multimodal
Visión, voz y multimodal
Los plugins de Visión, voz y multimodal dan ojos, oídos y voz a los modelos DeepSeek de solo texto en DeepSeek-Harness (dsh). Encuentra herramientas de visión y rutas de proveedor que hacen OCR y describen capturas pegadas mediante Zhipu GLM, Gemini, Doubao u Ollama local, entrada de voz por micrófono a través de la Web Speech API del navegador o APIs compatibles con Whisper, lectura en voz alta con Edge TTS o voces personalizadas, modos de voz full-duplex, y generadores de imágenes, vídeo y música.
312 plugins encontrados
dsh-ocr-local
balcoz/dsh-ocr-local
OCR local para DeepSeek Harness: pegue o adjunte una imagen, obtenga su texto mediante PP-OCRv5 + ONNX Runtime, totalmente sin conexión. TUI (cc-tui) y Web.
dsh-vision-bridge
sfyyy/dsh-vision-bridge
Visión bajo demanda para sesiones DSH solo de texto: las imágenes se convierten en marcadores, y una herramienta vision_describe envía solo la imagen y la pregunta a un modelo de visión compatible con OpenAI
dsh-voice-input
0nt-one/dsh-voice-input
Botón de micrófono en la fila de herramientas del compositor: voz a texto con la API Web Speech (Chrome/Edge), cambio de idioma y envío automático opcional, cero dependencias.
dsh-plugin-appshot
tauruswood/dsh-plugin-appshot
Codex Appshots para DSH: captura la ventana activa en primer plano mediante atajo global y móntala sin problemas en el composer para consultas del agente.
dsh-screenshot
paicat1/dsh-screenshot
Captura de pantalla sin dependencias para DSH: Lightweight — cero dependencias, cero binarios; Stage & shoot — captura en un clic de pantalla completa, disposición de ventanas y ventanas ocluidas con hover-snap; Agent self-service — entrega solo por ruta; las rutas son universales, combínalo con modlens (opcional) para evidencia estructurada en una sola llamada.
dsh-guide-dog
atropinoltt/dsh-guide-dog
Plugin multimodal impulsado por MiniMax: modo de llamada de voz en tiempo real (conversación en streaming, interfaz de dock flotante), modo de voz y entrada de voz por micrófono, además de herramientas de generación de imagen/video/música/voz y de inspección visual.
canvas-workbench
elangan1997-cmyk/canvas-workbench
Taller local de generación de imágenes, sin suscripciones: usa tu propia API para generar imágenes (cualquier interfaz compatible con OpenAI, suscripción cero), maquetación en lienzo + retoque/borrado/quitar fondo/OCR/vectorización, entrega PSD/AI editable, puente bidireccional a nivel de capa con Photoshop/Illustrator
dsh-tts-bridge
yuuyuko-uu/dsh-tts-bridge
Lee las conversaciones de DSH en voz alta utilizando la lectura en voz alta integrada de la página web de DeepSeek, controlada por una pequeña extensión del navegador.
dsh-cycle-image-gen
chengzzzi44/dsh-cycle-image-gen
Herramienta de generación de imágenes para DeepSeek Harness sobre cualquier endpoint de imágenes compatible con OpenAI, con una galería integrada en la interfaz web.
tripo3d-plugin-dsh
vast-ai-research/tripo3d-plugin-dsh
Skills de Tripo 3D para DeepSeek Harness: genera recursos 3D listos para el motor a partir de un prompt de texto o una imagen de referencia mediante tripo-cli, con texturizado, rigging, retopología y conversión de formato en una sola pasada.
deepseek-vl-support
limccn/deepseek-vl-support
Otorga visión a los modelos DeepSeek (solo texto) en los clientes Claude Code, Codex y Agent Plugins: describe imágenes mediante cualquier endpoint de visión compatible con OpenAI.
screenshot-feedback-hook-mcp (dsh-plugin)
lkh081231/screenshot-feedback-hook-mcp
Añade una herramienta de captura de pantalla más dos puntos de captura automática opcionales, poniendo la pantalla en la conversación como un bloque de imagen; requiere un modelo con capacidad de imagen.
dsh-pdf-reader
angeloszou/dsh-pdf-reader
Un complemento de lectura de PDF consciente del contenido para modelos de visión: perfila cada página para figuras (vectoriales y rasterizadas), tablas, riesgo de fórmulas y diseño de doble columna, luego aplica extracción híbrida consciente del contenido, renderizando páginas con figuras/tablas/fórmulas como recortes de región de alta DPI. Proporciona una vista previa de baja resolución para entender el diseño de página y renderiza una región especificada en alta resolución. Empaquetado como múltiples herramientas para agentes.
dsh-hos-scrcpy
ns-zzj/dsh-hos-scrcpy
Controla un teléfono HarmonyOS desde la interfaz web de DSH con IA: duplicación de pantalla H.264 en vivo, toque con ratón y teclas del sistema, transmisión de hilog y herramientas agénticas que permiten al modelo leer la pantalla, localizar controles de UI y luego tocar, mantener pulsado, pulsar teclas o escribir.
dsh-vision-hub (tool-vision)
xing666173/dsh-vision-hub
Caja de herramientas de visión mejorada: 14 herramientas de visión a nivel de píxel (describe, ground, detect, crop, pixel-diff, OCR, OCR de captura larga, vectorize, colors, cutout, screenshot, present, materialize, html-screenshot) impulsadas por un endpoint compatible con OpenAI, con marcadores de puente limpios [图片: path], clasificación de seguridad de contenido y auto-retry por límite de tasa.
dsh-image-pathify
dami9527/dsh-image-pathify
Permite que los modelos de solo texto manejen imágenes pegadas en el chat, con una experiencia de visión nativa, visualización de imágenes por lotes y una herramienta analyze_image integrada compatible con OpenAI; los modelos con capacidad de visión no se ven afectados.
dsh-voice
stardustlc666/dsh-voice
Herramientas de voz: síntesis de voz neuronal gratuita con edge-tts, transcripción ASR compatible con OpenAI, lista de voces, vista previa de voces por lotes y autodiagnóstico de estado.
dsh-voice
haoku123/dsh-voice
Modo de voz full-dúplex para la interfaz web: dictado con toque para alternar o mantener pulsado (tecla de envío o `Ctrl`) con subtítulos en vivo, ASR SenseVoice del lado del host mediante sherpa-onnx, respuestas habladas oración por oración, y hablar interrumpe la reproducción y el turno en curso (verdadera interrupción). Sin clave de API.
dsh-chatvoice
fuzzysoul/dsh-chatvoice
Bucle de voz gratuito para la interfaz web: entrada de micrófono con SpeechRecognition del navegador con resultados provisionales en vivo, además de botones de altavoz para leer en voz alta y lectura automática de las respuestas del asistente, sin configuración y sin clave de API.
dsh-draw-router
xiaozhe7772222/dsh-draw-router
Enrutador unificado de generación de imágenes para DeepSeek Harness (DSH): descubre automáticamente modelos de imagen desde cualquier endpoint compatible con OpenAI, proporciona herramientas draw_image y draw_list_sources, y es compatible con SenseNova, StepFun, Agnes, Qwen, Flux, SD, Imagen y más.
free-vision-skill
niyongsheng/free-vision-skill
Comprensión de imágenes y OCR completamente locales mediante el Vision Framework de macOS: `ocr_image` (texto, diseño de tabla + coordenadas) y `view_image` (escena, caras, QR): pega varias imágenes en el cuadro de entrada web o pasa ruta/URL/base64; las imágenes nunca salen de tu Mac.
deepseek-vision (dsh-plugin-deepseek-vision)
gou-gee/deepseek-vision
Bundle MCP de visión y DSH para DeepSeek solo de texto: herramientas analyze_image, analyze_clipboard, compare_images y vision_status, una página de configuración visual, GLM-4.6V-Flash gratuito por defecto, almacenamiento en caché de resultados y tolerancia al límite de tasa; las claves no aparecen en los registros.
dsh-plugin-deepeye
favio8/dsh-plugin-deepeye
Plugin de visión DeepEye para DeepSeek Harness (DSH): descripción de imágenes, OCR, VQA, diseño de UI y análisis del portapapeles.
dsh-her-eyes
huashenglian/dsh-her-eyes
Un plugin de dsh que permite a la IA invocar automáticamente VLM (modelos multimodales) para el análisis visual.