Saltar al contenido principal

Visión, voz y multimodal

Los plugins de Visión, voz y multimodal dan ojos, oídos y voz a los modelos DeepSeek de solo texto en DeepSeek-Harness (dsh). Encuentra herramientas de visión y rutas de proveedor que hacen OCR y describen capturas pegadas mediante Zhipu GLM, Gemini, Doubao u Ollama local, entrada de voz por micrófono a través de la Web Speech API del navegador o APIs compatibles con Whisper, lectura en voz alta con Edge TTS o voces personalizadas, modos de voz full-duplex, y generadores de imágenes, vídeo y música.

312 plugins encontrados

G

dsh-tts

goodandready/dsh-tts

Reproduce las respuestas del agente en la interfaz web de DeepSeek Harness mediante una cadena de respaldo de proveedores (OpenAI, ElevenLabs, Google, Azure, Groq, Deepgram, OpenRouter, Edge, Piper, eSpeak), de modo que un proveedor que falle o tenga límite de tasa pase al siguiente en lugar de quedar en silencio.

2hace 6 díasVisión, voz y multimodalMIT
O

DSH-dseyes

okkay712/dsh-dseyes

Adjuntos de imagen nativos para DeepSeek solo texto en la Web GUI: las imágenes pegadas o soltadas aparecen como miniaturas en la sesión y, antes del envío, el host las lee con la API de visión gratuita Zhipu GLM-4V-Flash (cadena de respaldo glm-4v-flash) y sustituye la descripción, de modo que DeepSeek responde sobre la imagen mientras el original se conserva en el historial.

2el mes pasadoVisión, voz y multimodalMIT
W

dsh-wm

waynejin0918/dsh-wm

Kit de herramientas de investigación de modelos del mundo: inspecciona fotogramas, nombra rutas 3D/píxel/latentes, puntúa pred vs GT y habilidades RSI / wm.yaml.

2hace 2 mesesVisión, voz y multimodalMIT
I

dsh-tool-visual-primitives

inkshadewoods/dsh-tool-visual-primitives

Analiza imágenes de conversación mediante prompts específicos por modo (caption, UI, documento, grounding, topología, etc.) e inyecta evidencia estructurada con primitivas de coordenadas (cajas, puntos, referencias) como texto, con caché a nivel de sesión para reutilización entre replay y compaction.

2hace 3 díasVisión, voz y multimodalMIT
V

dsh-smart-input

v-quest123456/dsh-smart-input

Complemento de entrada inteligente para DeepSeek Harness — entrada de voz + optimización de prompts

2hace 2 mesesVisión, voz y multimodalMIT
G

dsh-vision-bridge

goodandready/dsh-vision-bridge

Enruta imágenes a un modelo de visión de tu elección — reescritura automática, herramientas explícitas o híbrido — para que un modelo de chat solo texto no falle un turno que contiene una imagen.

2hace 6 díasVisión, voz y multimodalMIT
P

muxiva-dsh-voice

piyotahu/muxiva-dsh-voice

Voz dúplex completa local-first para DeepSeek Harness, orquestada por Muxiva

2hace 2 mesesVisión, voz y multimodalApache-2.0
P

dsh-voice-call

pandapolo/dsh-voice-call

Llamadas de voz iniciadas por el agente: `offer_call` hace sonar al humano (接听/拒接/稍后再说); las llamadas aceptadas se sintetizan y reproducen localmente con CrispASR + Qwen3-TTS (9 voces, 2 dialectos chinos), y las rechazadas devuelven la decisión al agente.

2hace 3 díasVisión, voz y multimodalMIT
M

dsh-fish-tts

mari23333/dsh-fish-tts

Lee en voz alta las respuestas del asistente solo mediante la API de Fish Audio (lleva tu propia clave): lectura por mensaje, interruptor de autolectura y una página de ajustes para el modelo, el reference_id de la voz, la clave de API cifrada y el proxy.

2anteayerVisión, voz y multimodalMIT
X

dsh-vision

xiaoshihou514/dsh-vision

Extensión nativa de capacidad de visión, que utiliza Zhipu (gratis) o Qwen-VL (local).

2el mes pasadoVisión, voz y multimodalMIT
K

dsh-vision-recognizer

kaixinbaba/dsh-vision-recognizer

Ruta de proveedor de visión que transcribe imágenes adjuntas a texto mediante un modelo configurable (más de 15 proveedores compatibles con OpenAI y Anthropic) mientras DeepSeek sigue respondiendo.

2el mes pasadoVisión, voz y multimodalMIT
H

dsh-open-eyes

hyp6666/dsh-open-eyes

Puente de visión para rutas de DeepSeek solo de texto que analiza imágenes adjuntas y locales mediante endpoints configurables de OpenAI Responses, Chat Completions o Anthropic Messages, mientras deja nativas las rutas con capacidad de imagen.

2hace 27 díasVisión, voz y multimodalMIT
5

dsh-youreyes

54xkeee/dsh-youreyes

Kit de visión para DeepSeek solo de texto: herramienta `vision` invocable por el modelo, adaptadores contenedores para deepseek/opencode-go (v4 flash/pro), cuota de Antigravity IDE (default, flash/pro) / cualquier VLM compatible con OpenAI / Gemini / canales locales de Ollama, memoria de evidencias con rehidratación por compactación, caché de hash de contenido y un panel de cliente bilingüe.

2hace 2 mesesVisión, voz y multimodalMIT
3

dsh-vision (vision-tool)

314857493/dsh-vision

Herramienta `vision` invocable por el modelo para DeepSeek Harness: describe y aplica OCR a archivos de imagen llamando directamente a la API de visión gratuita Zhipu GLM (cadena de respaldo glm-4v-flash), sin necesidad de CLI externo.

2hace 28 díasVisión, voz y multimodalMIT
3

dsh-vision (vision-route)

314857493/dsh-vision

Registra una ruta de proveedor `deepseek-vision`: la interfaz web acepta imágenes pegadas y las transcribe a texto mediante la API de visión gratuita Zhipu GLM antes de delegar al adaptador DeepSeek.

2hace 28 díasVisión, voz y multimodalMIT
X

dsh-vision-bridge

ximengxiaolan/dsh-vision-bridge

Las imágenes adjuntas en el editor se transcriben a texto mediante un modelo de visión compatible con OpenAI antes de llegar a los modelos de DeepSeek de solo texto.

2hace 2 mesesVisión, voz y multimodalMIT
J

dsh-live2d-voice

john-walks-slow/dsh-live2d-voice

Live2D session view with realtime voice: continuous voice input, streaming TTS, subtitle translation, multi-model catalog, standalone entry / Live2D 实时语音会话视图:连续语音输入、流式 TTS、字幕翻译、多模型目录、独立入口

1hace 4 díasVisión, voz y multimodalMIT
W

dsh-multi-tts

wyr-233/dsh-multi-tts

Per-reply read-aloud with a multi-provider settings page — MiniMax or any OpenAI-compatible /audio/speech endpoint, with voice, emotion, speed and model selection plus an auto-read toggle.

1hace 22 díasVisión, voz y multimodal
V

dsh-live-voice

victorwads/dsh-live-voice

Local-first voice conversations for DSH, with local speech recognition and synthesis and optional external providers.

1hace 18 díasVisión, voz y multimodalGPL-3.0
C

dsh-vision-autoswitch

cultofluna/dsh-vision-autoswitch

DeepSeek Harness plugin: auto-route image-bearing requests to deepseek-v4-flash-vision-exp, then fall back to the original model.

1el mes pasadoVisión, voz y multimodalMIT
N

dsh-dictate

navneetset/dsh-dictate

Live speech-to-text dictation into the dsh web composer via OpenRouter STT

1hace 27 díasVisión, voz y multimodalMIT
M

dsh-minimax-asr

moluyao/dsh-minimax-asr

MiniMax 语音识别(asr-1.0)+ 语音合成(speech-2.8-hd)的 DeepSeek Harness 全局插件:转写工具、任务结束后用喇叭念一句的播报、实时免手对话、303 个音色可选

1hace 19 díasVisión, voz y multimodalMIT
N

dsh-imgdraw

ninjasln-labs/dsh-imgdraw

Text-to-image for DeepSeek Harness: a `draw_image` model tool, an input-bar 生图 button with a prompt popup (async generation, 4-grid results, download / keep / delete), an /imgdraw image route, and persisted history. Backends: DashScope wan2.7-image (free

1hace 28 díasVisión, voz y multimodalMIT
D

dsh-voice-talk

duoduoqian708/dsh-voice-talk

Voice conversation mode for the DSH Web GUI: tap the mic to start a full-screen call, talk hands-free, and hear each reply read aloud as it streams. Bilingual (Chinese/English) UI, light and dark themes, adjustable speech rate, and switchable voices.

1hace 20 díasVisión, voz y multimodalMIT