Visione, voce e multimodale
I plugin Visione, voce e multimodale danno occhi, orecchie e voce ai modelli DeepSeek solo testo di DeepSeek-Harness (dsh). Trova strumenti di visione e route di provider che eseguono OCR e descrivono gli screenshot incollati tramite Zhipu GLM, Gemini, Doubao o Ollama in locale, input vocale dal microfono tramite la Web Speech API del browser o API compatibili con Whisper, lettura ad alta voce con Edge TTS o voci personalizzate, modalità vocali full-duplex, e generatori di immagini, video e musica.
312 plugin trovati
dsh-tts
goodandready/dsh-tts
Pronuncia le risposte dell'agente nell'interfaccia web di DeepSeek Harness tramite una catena di fallback dei fornitori (OpenAI, ElevenLabs, Google, Azure, Groq, Deepgram, OpenRouter, Edge, Piper, eSpeak), così un fornitore in errore o con limite di velocità passa al successivo invece di restare in silenzio.
DSH-dseyes
okkay712/dsh-dseyes
Allegati immagine nativi per DeepSeek solo testo nella Web GUI: le immagini incollate o rilasciate appaiono come miniature nella sessione e, prima dell'invio, l'host le legge con l'API di visione gratuita Zhipu GLM-4V-Flash (catena di fallback glm-4v-flash) e sostituisce la descrizione, così DeepSeek risponde sull'immagine mentre l'originale viene conservato nella cronologia.
dsh-wm
waynejin0918/dsh-wm
Toolkit di ricerca sui modelli del mondo: ispeziona frame, assegna nomi a percorsi 3D/pixel/latent, assegna punteggi pred vs GT e competenze RSI / wm.yaml.
dsh-tool-visual-primitives
inkshadewoods/dsh-tool-visual-primitives
Analizza le immagini della conversazione tramite prompt specifici per modalità (caption, UI, documento, grounding, topologia, ecc.) e inietta evidenze strutturate con primitive di coordinate (box, punti, riferimenti) come testo, con caching a livello di sessione per il riutilizzo durante replay e compaction.
dsh-smart-input
v-quest123456/dsh-smart-input
Plugin di input intelligente per DeepSeek Harness — input vocale + ottimizzazione dei prompt
dsh-vision-bridge
goodandready/dsh-vision-bridge
Instrada le immagini verso il modello di visione che preferisci - riscrittura automatica, strumenti espliciti o ibrido - così un modello di chat solo testuale non fallisce un turno che contiene un'immagine.
muxiva-dsh-voice
piyotahu/muxiva-dsh-voice
Voce full-duplex local-first per DeepSeek Harness, orchestrata da Muxiva
dsh-voice-call
pandapolo/dsh-voice-call
Chiamate vocali avviate dall’agente: `offer_call` fa squillare l’umano (接听/拒接/稍后再说); le chiamate accettate vengono sintetizzate e riprodotte in locale con CrispASR + Qwen3-TTS (9 voci, 2 dialetti cinesi), mentre quelle rifiutate restituiscono la decisione all’agente.
dsh-fish-tts
mari23333/dsh-fish-tts
Legge ad alta voce le risposte dell’assistente solo tramite Fish Audio API (porta la tua chiave): lettura per messaggio, interruttore di lettura automatica e una pagina impostazioni per modello, reference_id della voce, chiave API cifrata e proxy.
dsh-vision
xiaoshihou514/dsh-vision
Estensione nativa delle capacità visive, che utilizza Zhipu (gratuito) o Qwen-VL (locale).
dsh-vision-recognizer
kaixinbaba/dsh-vision-recognizer
Rotta del provider di visione che trascrive le immagini allegate in testo tramite un modello configurabile (oltre 15 fornitori compatibili con OpenAI e Anthropic) mentre DeepSeek continua a rispondere.
dsh-open-eyes
hyp6666/dsh-open-eyes
Bridge vision per route DeepSeek solo testo che analizza immagini allegate e locali tramite endpoint configurabili OpenAI Responses, Chat Completions o Anthropic Messages, lasciando native le route abilitate alle immagini.
dsh-youreyes
54xkeee/dsh-youreyes
Toolkit vision per DeepSeek solo testo: strumento `vision` invocabile dal modello, adapter wrapper per deepseek/opencode-go (v4 flash/pro), quota Antigravity IDE (default, flash/pro) / qualsiasi VLM compatibile OpenAI / Gemini / canali locali Ollama, memoria delle evidenze con reidratazione da compattazione, cache dell’hash dei contenuti e un pannello client bilingue.
dsh-vision (vision-tool)
314857493/dsh-vision
Strumento `vision` invocabile dal modello per DeepSeek Harness: descrive e fa OCR dei file immagine chiamando direttamente la free Zhipu GLM vision API (catena di fallback glm-4v-flash), senza CLI esterno.
dsh-vision (vision-route)
314857493/dsh-vision
Registra una route provider `deepseek-vision`: la GUI web accetta immagini incollate e le trascrive in testo tramite la free Zhipu GLM vision API prima di delegare all’adattatore DeepSeek.
dsh-vision-bridge
ximengxiaolan/dsh-vision-bridge
Le immagini allegate nel composer vengono trascritte in testo da un modello di visione compatibile con OpenAI prima di raggiungere i modelli DeepSeek solo testo
dsh-live2d-voice
john-walks-slow/dsh-live2d-voice
Live2D session view with realtime voice: continuous voice input, streaming TTS, subtitle translation, multi-model catalog, standalone entry / Live2D 实时语音会话视图:连续语音输入、流式 TTS、字幕翻译、多模型目录、独立入口
dsh-multi-tts
wyr-233/dsh-multi-tts
Per-reply read-aloud with a multi-provider settings page — MiniMax or any OpenAI-compatible /audio/speech endpoint, with voice, emotion, speed and model selection plus an auto-read toggle.
dsh-live-voice
victorwads/dsh-live-voice
Local-first voice conversations for DSH, with local speech recognition and synthesis and optional external providers.
dsh-vision-autoswitch
cultofluna/dsh-vision-autoswitch
DeepSeek Harness plugin: auto-route image-bearing requests to deepseek-v4-flash-vision-exp, then fall back to the original model.
dsh-dictate
navneetset/dsh-dictate
Live speech-to-text dictation into the dsh web composer via OpenRouter STT
dsh-minimax-asr
moluyao/dsh-minimax-asr
MiniMax 语音识别(asr-1.0)+ 语音合成(speech-2.8-hd)的 DeepSeek Harness 全局插件:转写工具、任务结束后用喇叭念一句的播报、实时免手对话、303 个音色可选
dsh-imgdraw
ninjasln-labs/dsh-imgdraw
Text-to-image for DeepSeek Harness: a `draw_image` model tool, an input-bar 生图 button with a prompt popup (async generation, 4-grid results, download / keep / delete), an /imgdraw image route, and persisted history. Backends: DashScope wan2.7-image (free
dsh-voice-talk
duoduoqian708/dsh-voice-talk
Voice conversation mode for the DSH Web GUI: tap the mic to start a full-screen call, talk hands-free, and hear each reply read aloud as it streams. Bilingual (Chinese/English) UI, light and dark themes, adjustable speech rate, and switchable voices.