- Inicio
- Categorías
- Visión, voz y multimodal
Visión, voz y multimodal
Los plugins de Visión, voz y multimodal dan ojos, oídos y voz a los modelos DeepSeek de solo texto en DeepSeek-Harness (dsh). Encuentra herramientas de visión y rutas de proveedor que hacen OCR y describen capturas pegadas mediante Zhipu GLM, Gemini, Doubao u Ollama local, entrada de voz por micrófono a través de la Web Speech API del navegador o APIs compatibles con Whisper, lectura en voz alta con Edge TTS o voces personalizadas, modos de voz full-duplex, y generadores de imágenes, vídeo y música.
312 plugins encontrados
dsh-tts
goodandready/dsh-tts
Reproduce las respuestas del agente en la interfaz web de DeepSeek Harness mediante una cadena de respaldo de proveedores (OpenAI, ElevenLabs, Google, Azure, Groq, Deepgram, OpenRouter, Edge, Piper, eSpeak), de modo que un proveedor que falle o tenga límite de tasa pase al siguiente en lugar de quedar en silencio.
DSH-dseyes
okkay712/dsh-dseyes
Adjuntos de imagen nativos para DeepSeek solo texto en la Web GUI: las imágenes pegadas o soltadas aparecen como miniaturas en la sesión y, antes del envío, el host las lee con la API de visión gratuita Zhipu GLM-4V-Flash (cadena de respaldo glm-4v-flash) y sustituye la descripción, de modo que DeepSeek responde sobre la imagen mientras el original se conserva en el historial.
dsh-wm
waynejin0918/dsh-wm
Kit de herramientas de investigación de modelos del mundo: inspecciona fotogramas, nombra rutas 3D/píxel/latentes, puntúa pred vs GT y habilidades RSI / wm.yaml.
dsh-tool-visual-primitives
inkshadewoods/dsh-tool-visual-primitives
Analiza imágenes de conversación mediante prompts específicos por modo (caption, UI, documento, grounding, topología, etc.) e inyecta evidencia estructurada con primitivas de coordenadas (cajas, puntos, referencias) como texto, con caché a nivel de sesión para reutilización entre replay y compaction.
dsh-smart-input
v-quest123456/dsh-smart-input
Complemento de entrada inteligente para DeepSeek Harness — entrada de voz + optimización de prompts
dsh-vision-bridge
goodandready/dsh-vision-bridge
Enruta imágenes a un modelo de visión de tu elección — reescritura automática, herramientas explícitas o híbrido — para que un modelo de chat solo texto no falle un turno que contiene una imagen.
muxiva-dsh-voice
piyotahu/muxiva-dsh-voice
Voz dúplex completa local-first para DeepSeek Harness, orquestada por Muxiva
dsh-voice-call
pandapolo/dsh-voice-call
Llamadas de voz iniciadas por el agente: `offer_call` hace sonar al humano (接听/拒接/稍后再说); las llamadas aceptadas se sintetizan y reproducen localmente con CrispASR + Qwen3-TTS (9 voces, 2 dialectos chinos), y las rechazadas devuelven la decisión al agente.
dsh-fish-tts
mari23333/dsh-fish-tts
Lee en voz alta las respuestas del asistente solo mediante la API de Fish Audio (lleva tu propia clave): lectura por mensaje, interruptor de autolectura y una página de ajustes para el modelo, el reference_id de la voz, la clave de API cifrada y el proxy.
dsh-vision
xiaoshihou514/dsh-vision
Extensión nativa de capacidad de visión, que utiliza Zhipu (gratis) o Qwen-VL (local).
dsh-vision-recognizer
kaixinbaba/dsh-vision-recognizer
Ruta de proveedor de visión que transcribe imágenes adjuntas a texto mediante un modelo configurable (más de 15 proveedores compatibles con OpenAI y Anthropic) mientras DeepSeek sigue respondiendo.
dsh-open-eyes
hyp6666/dsh-open-eyes
Puente de visión para rutas de DeepSeek solo de texto que analiza imágenes adjuntas y locales mediante endpoints configurables de OpenAI Responses, Chat Completions o Anthropic Messages, mientras deja nativas las rutas con capacidad de imagen.
dsh-youreyes
54xkeee/dsh-youreyes
Kit de visión para DeepSeek solo de texto: herramienta `vision` invocable por el modelo, adaptadores contenedores para deepseek/opencode-go (v4 flash/pro), cuota de Antigravity IDE (default, flash/pro) / cualquier VLM compatible con OpenAI / Gemini / canales locales de Ollama, memoria de evidencias con rehidratación por compactación, caché de hash de contenido y un panel de cliente bilingüe.
dsh-vision (vision-tool)
314857493/dsh-vision
Herramienta `vision` invocable por el modelo para DeepSeek Harness: describe y aplica OCR a archivos de imagen llamando directamente a la API de visión gratuita Zhipu GLM (cadena de respaldo glm-4v-flash), sin necesidad de CLI externo.
dsh-vision (vision-route)
314857493/dsh-vision
Registra una ruta de proveedor `deepseek-vision`: la interfaz web acepta imágenes pegadas y las transcribe a texto mediante la API de visión gratuita Zhipu GLM antes de delegar al adaptador DeepSeek.
dsh-vision-bridge
ximengxiaolan/dsh-vision-bridge
Las imágenes adjuntas en el editor se transcriben a texto mediante un modelo de visión compatible con OpenAI antes de llegar a los modelos de DeepSeek de solo texto.
dsh-live2d-voice
john-walks-slow/dsh-live2d-voice
Live2D session view with realtime voice: continuous voice input, streaming TTS, subtitle translation, multi-model catalog, standalone entry / Live2D 实时语音会话视图:连续语音输入、流式 TTS、字幕翻译、多模型目录、独立入口
dsh-multi-tts
wyr-233/dsh-multi-tts
Per-reply read-aloud with a multi-provider settings page — MiniMax or any OpenAI-compatible /audio/speech endpoint, with voice, emotion, speed and model selection plus an auto-read toggle.
dsh-live-voice
victorwads/dsh-live-voice
Local-first voice conversations for DSH, with local speech recognition and synthesis and optional external providers.
dsh-vision-autoswitch
cultofluna/dsh-vision-autoswitch
DeepSeek Harness plugin: auto-route image-bearing requests to deepseek-v4-flash-vision-exp, then fall back to the original model.
dsh-dictate
navneetset/dsh-dictate
Live speech-to-text dictation into the dsh web composer via OpenRouter STT
dsh-minimax-asr
moluyao/dsh-minimax-asr
MiniMax 语音识别(asr-1.0)+ 语音合成(speech-2.8-hd)的 DeepSeek Harness 全局插件:转写工具、任务结束后用喇叭念一句的播报、实时免手对话、303 个音色可选
dsh-imgdraw
ninjasln-labs/dsh-imgdraw
Text-to-image for DeepSeek Harness: a `draw_image` model tool, an input-bar 生图 button with a prompt popup (async generation, 4-grid results, download / keep / delete), an /imgdraw image route, and persisted history. Backends: DashScope wan2.7-image (free
dsh-voice-talk
duoduoqian708/dsh-voice-talk
Voice conversation mode for the DSH Web GUI: tap the mic to start a full-screen call, talk hands-free, and hear each reply read aloud as it streams. Bilingual (Chinese/English) UI, light and dark themes, adjustable speech rate, and switchable voices.