Vai al contenuto principale

Visione, voce e multimodale

I plugin Visione, voce e multimodale danno occhi, orecchie e voce ai modelli DeepSeek solo testo di DeepSeek-Harness (dsh). Trova strumenti di visione e route di provider che eseguono OCR e descrivono gli screenshot incollati tramite Zhipu GLM, Gemini, Doubao o Ollama in locale, input vocale dal microfono tramite la Web Speech API del browser o API compatibili con Whisper, lettura ad alta voce con Edge TTS o voci personalizzate, modalità vocali full-duplex, e generatori di immagini, video e musica.

312 plugin trovati

G

dsh-tts

goodandready/dsh-tts

Pronuncia le risposte dell'agente nell'interfaccia web di DeepSeek Harness tramite una catena di fallback dei fornitori (OpenAI, ElevenLabs, Google, Azure, Groq, Deepgram, OpenRouter, Edge, Piper, eSpeak), così un fornitore in errore o con limite di velocità passa al successivo invece di restare in silenzio.

26 giorni faVisione, voce e multimodaleMIT
O

DSH-dseyes

okkay712/dsh-dseyes

Allegati immagine nativi per DeepSeek solo testo nella Web GUI: le immagini incollate o rilasciate appaiono come miniature nella sessione e, prima dell'invio, l'host le legge con l'API di visione gratuita Zhipu GLM-4V-Flash (catena di fallback glm-4v-flash) e sostituisce la descrizione, così DeepSeek risponde sull'immagine mentre l'originale viene conservato nella cronologia.

2mese scorsoVisione, voce e multimodaleMIT
W

dsh-wm

waynejin0918/dsh-wm

Toolkit di ricerca sui modelli del mondo: ispeziona frame, assegna nomi a percorsi 3D/pixel/latent, assegna punteggi pred vs GT e competenze RSI / wm.yaml.

22 mesi faVisione, voce e multimodaleMIT
I

dsh-tool-visual-primitives

inkshadewoods/dsh-tool-visual-primitives

Analizza le immagini della conversazione tramite prompt specifici per modalità (caption, UI, documento, grounding, topologia, ecc.) e inietta evidenze strutturate con primitive di coordinate (box, punti, riferimenti) come testo, con caching a livello di sessione per il riutilizzo durante replay e compaction.

23 giorni faVisione, voce e multimodaleMIT
V

dsh-smart-input

v-quest123456/dsh-smart-input

Plugin di input intelligente per DeepSeek Harness — input vocale + ottimizzazione dei prompt

22 mesi faVisione, voce e multimodaleMIT
G

dsh-vision-bridge

goodandready/dsh-vision-bridge

Instrada le immagini verso il modello di visione che preferisci - riscrittura automatica, strumenti espliciti o ibrido - così un modello di chat solo testuale non fallisce un turno che contiene un'immagine.

26 giorni faVisione, voce e multimodaleMIT
P

muxiva-dsh-voice

piyotahu/muxiva-dsh-voice

Voce full-duplex local-first per DeepSeek Harness, orchestrata da Muxiva

22 mesi faVisione, voce e multimodaleApache-2.0
P

dsh-voice-call

pandapolo/dsh-voice-call

Chiamate vocali avviate dall’agente: `offer_call` fa squillare l’umano (接听/拒接/稍后再说); le chiamate accettate vengono sintetizzate e riprodotte in locale con CrispASR + Qwen3-TTS (9 voci, 2 dialetti cinesi), mentre quelle rifiutate restituiscono la decisione all’agente.

23 giorni faVisione, voce e multimodaleMIT
M

dsh-fish-tts

mari23333/dsh-fish-tts

Legge ad alta voce le risposte dell’assistente solo tramite Fish Audio API (porta la tua chiave): lettura per messaggio, interruttore di lettura automatica e una pagina impostazioni per modello, reference_id della voce, chiave API cifrata e proxy.

2l’altro ieriVisione, voce e multimodaleMIT
X

dsh-vision

xiaoshihou514/dsh-vision

Estensione nativa delle capacità visive, che utilizza Zhipu (gratuito) o Qwen-VL (locale).

2mese scorsoVisione, voce e multimodaleMIT
K

dsh-vision-recognizer

kaixinbaba/dsh-vision-recognizer

Rotta del provider di visione che trascrive le immagini allegate in testo tramite un modello configurabile (oltre 15 fornitori compatibili con OpenAI e Anthropic) mentre DeepSeek continua a rispondere.

2mese scorsoVisione, voce e multimodaleMIT
H

dsh-open-eyes

hyp6666/dsh-open-eyes

Bridge vision per route DeepSeek solo testo che analizza immagini allegate e locali tramite endpoint configurabili OpenAI Responses, Chat Completions o Anthropic Messages, lasciando native le route abilitate alle immagini.

227 giorni faVisione, voce e multimodaleMIT
5

dsh-youreyes

54xkeee/dsh-youreyes

Toolkit vision per DeepSeek solo testo: strumento `vision` invocabile dal modello, adapter wrapper per deepseek/opencode-go (v4 flash/pro), quota Antigravity IDE (default, flash/pro) / qualsiasi VLM compatibile OpenAI / Gemini / canali locali Ollama, memoria delle evidenze con reidratazione da compattazione, cache dell’hash dei contenuti e un pannello client bilingue.

22 mesi faVisione, voce e multimodaleMIT
3

dsh-vision (vision-tool)

314857493/dsh-vision

Strumento `vision` invocabile dal modello per DeepSeek Harness: descrive e fa OCR dei file immagine chiamando direttamente la free Zhipu GLM vision API (catena di fallback glm-4v-flash), senza CLI esterno.

228 giorni faVisione, voce e multimodaleMIT
3

dsh-vision (vision-route)

314857493/dsh-vision

Registra una route provider `deepseek-vision`: la GUI web accetta immagini incollate e le trascrive in testo tramite la free Zhipu GLM vision API prima di delegare all’adattatore DeepSeek.

228 giorni faVisione, voce e multimodaleMIT
X

dsh-vision-bridge

ximengxiaolan/dsh-vision-bridge

Le immagini allegate nel composer vengono trascritte in testo da un modello di visione compatibile con OpenAI prima di raggiungere i modelli DeepSeek solo testo

22 mesi faVisione, voce e multimodaleMIT
J

dsh-live2d-voice

john-walks-slow/dsh-live2d-voice

Live2D session view with realtime voice: continuous voice input, streaming TTS, subtitle translation, multi-model catalog, standalone entry / Live2D 实时语音会话视图:连续语音输入、流式 TTS、字幕翻译、多模型目录、独立入口

14 giorni faVisione, voce e multimodaleMIT
W

dsh-multi-tts

wyr-233/dsh-multi-tts

Per-reply read-aloud with a multi-provider settings page — MiniMax or any OpenAI-compatible /audio/speech endpoint, with voice, emotion, speed and model selection plus an auto-read toggle.

122 giorni faVisione, voce e multimodale
V

dsh-live-voice

victorwads/dsh-live-voice

Local-first voice conversations for DSH, with local speech recognition and synthesis and optional external providers.

118 giorni faVisione, voce e multimodaleGPL-3.0
C

dsh-vision-autoswitch

cultofluna/dsh-vision-autoswitch

DeepSeek Harness plugin: auto-route image-bearing requests to deepseek-v4-flash-vision-exp, then fall back to the original model.

1mese scorsoVisione, voce e multimodaleMIT
N

dsh-dictate

navneetset/dsh-dictate

Live speech-to-text dictation into the dsh web composer via OpenRouter STT

127 giorni faVisione, voce e multimodaleMIT
M

dsh-minimax-asr

moluyao/dsh-minimax-asr

MiniMax 语音识别(asr-1.0)+ 语音合成(speech-2.8-hd)的 DeepSeek Harness 全局插件:转写工具、任务结束后用喇叭念一句的播报、实时免手对话、303 个音色可选

119 giorni faVisione, voce e multimodaleMIT
N

dsh-imgdraw

ninjasln-labs/dsh-imgdraw

Text-to-image for DeepSeek Harness: a `draw_image` model tool, an input-bar 生图 button with a prompt popup (async generation, 4-grid results, download / keep / delete), an /imgdraw image route, and persisted history. Backends: DashScope wan2.7-image (free

128 giorni faVisione, voce e multimodaleMIT
D

dsh-voice-talk

duoduoqian708/dsh-voice-talk

Voice conversation mode for the DSH Web GUI: tap the mic to start a full-screen call, talk hands-free, and hear each reply read aloud as it streams. Bilingual (Chinese/English) UI, light and dark themes, adjustable speech rate, and switchable voices.

120 giorni faVisione, voce e multimodaleMIT