Visione, voce e multimodale
I plugin Visione, voce e multimodale danno occhi, orecchie e voce ai modelli DeepSeek solo testo di DeepSeek-Harness (dsh). Trova strumenti di visione e route di provider che eseguono OCR e descrivono gli screenshot incollati tramite Zhipu GLM, Gemini, Doubao o Ollama in locale, input vocale dal microfono tramite la Web Speech API del browser o API compatibili con Whisper, lettura ad alta voce con Edge TTS o voci personalizzate, modalità vocali full-duplex, e generatori di immagini, video e musica.
312 plugin trovati
dsh-vision-sidecar
121103qwq/dsh-vision-sidecar
Sidecar di vision gratuito e ospitato per DeepSeek Harness, con prove di sessione persistenti.
dsh-image-subagent
yuqingsh/dsh-image-subagent
dsh-vision-bridge
gxx182/dsh-vision-bridge
Collega le immagini della sessione a provider di visione configurabili e restituisce analisi solo testo alle route di modelli DeepSeek Harness idonee.
dsh-omni-workstation
huashenglian/dsh-omni-workstation
Workstation omni-modale per DSH: analyze_image su una catena ordinata multi-scheda di failover VLM, un toolkit di visione con sei strumenti (zoom, campionamento colori, pixel diff, OCR, rilevamento elementi, visualizzazione inline) che condivide lo stesso resolver di immagini, generate_image sui protocolli OpenAI/DashScope/ComfyUI, generate_video asincrono multi-scheda con un builder /build-video-tool, più TTS speak/clone_voice su sette provider, tutto governato da un'unica pagina di impostazioni con salvataggio automatico.
dsh-hold-to-talk
wangzhanchao883/dsh-hold-to-talk
Input a una mano e senza tastiera per il composer: tieni premuto il mouse sulla casella di input, parla, rilascia — il testo finisce nella bozza, e scorrendo verso l'alto annulli senza lasciare una frase a metà. Nessun pulsante microfono da centrare e nessuna scorciatoia da ricordare; la mano non deve mai lasciare l'area di input, che è il punto quando l'altra mano è occupata. Il riconoscimento gira completamente offline (SenseVoice via sherpa-onnx, nessuna chiave API, l'audio non lascia mai la macchina).
dsh-plugin-speech
nakamuraia/dsh-plugin-speech
Legge ad alta voce le risposte dell'assistente in DeepSeek Harness: fornitori di sintesi vocale con riproduzione in streaming.
dsh-voice-assistant
supersyh-sss/dsh-voice-assistant
Assistente vocale per il web dsh: pronuncia la frase di attivazione (ad es. "小鲸") per attivare la dettatura a mani libere — ciò che dici viene trascritto e digitato automaticamente nella casella della chat. Supporta comandi di modifica vocali (invia, cancella, nuova riga, interrompi lettura) e legge ad alta voce in cinese le risposte dell'assistente. Il riconoscimento vocale gira localmente nel browser via sherpa-onnx WASM, quindi funziona offline senza chiave API.
dsh-audiogen
shimingming520/dsh-audiogen
Generazione audio IA per la GUI web di DeepSeek Harness — TTS multi-vendor, musica, effetti sonori e design della voce con pannello laterale, confronto modelli, libreria di risorse e strumenti Agent.
dsh-voco
lgquan/dsh-voco
Conversazioni vocali continue per DSH con ascolto a mani libere, push-to-talk, riconoscimento vocale, risposte TTS e delega di Agent in background.
dsh-gsv
taoruiliu19/dsh-gsv
TTS locale in tempo reale per DeepSeek Harness: preset vocali, lettura automatica, assistente di configurazione del motore, pulsante di lettura ad alta voce e un pannello delle impostazioni per il motore GSV-TTS-Lite.
dsh-ximalaya
jerryqx/dsh-ximalaya
Ascolta podcast e audiolibri Ximalaya dentro la web UI di DSH: cerca album, sfoglia tracce paginate e riproduci tramite una barra now-playing (prev/play/next, seek, volume, velocità). Dopo il login via QR, la pagina "Mine" elenca le tracce che ti piacciono (clic per riprodurre), gli album sottoscritti con suggerimenti sull'ultimo episodio e gli anchor seguiti con i loro album pubblici; l'host inoltra gli stream audio con supporto Range e registra uno strumento `ximalaya_play` così l'agente può cercare e riprodurre su richiesta.
phone-eye
boheastill/phone-eye
Il tuo agente AI può vedere e usare un vero telefono Android: phone_look (fusione di visione e UI-tree), tap/swipe/type, screenshot — via adb, per qualsiasi client MCP.
dsh-image-vision
xiaoyuink/dsh-image-vision
Comprensione delle immagini per qualsiasi modello DSH: strumenti di visione, OCR, grounding e ritaglio con preset di dominio per istopatologia, biologia cellulare, anatomia, immagini cliniche e figure scientifiche.
Deepseek-Continuity
linxuhao/deepseek-continuity
Generazione locale di immagini, voce, musica ed effetti sonori, più trascrizione, con identità fissata: personaggi, animali, oggetti e voci degli attori vengono definiti una volta e riutilizzati in ogni chiamata successiva; l'output degenerato (immagine quasi piatta, audio silenzioso) viene rifiutato invece di essere restituito come successo, e una riga generata può essere riletta come testo, così che un clone che ha inghiottito la propria fine diventi visibile. I motori si scaricano quando inattivi, e la generazione di immagini e la trascrizione possono ciascuna puntare a un'API di forma OpenAI invece del backend Vulkan locale.
dsh-ui-spec
yumimanji/dsh-ui-spec
Plugin DeepSeek Harness che trasforma screenshot UI in specifiche web di grado implementativo utilizzando OCR, geometria deterministica, grafi di scena, asset e confronto di rendering.
deepseekeyes
dttxorg/deepseekeyes
Runtime di visione e Computer Use multipiattaforma verificabile per DeepSeek Harness con prove che preservano la fonte.
voco-input-sh
nothree-code/voco-input-sh
Input vocale per la Web UI: un pulsante microfono che usa il riconoscimento vocale offline locale di VocoType e inserisce automaticamente il testo riconosciuto nel compositore (auto-deploy, dedupe, dettatura continua).
dsh-stt-input
baisama-cloud/dsh-stt-input
Input vocale speech-to-text per la web UI: un pulsante microfono nel composer trascrive il parlato nella bozza tramite la Web Speech API del browser (zero-config) o un'API Whisper compatibile OpenAI (OpenAI / Groq), con modello e lingua selezionabili nelle Impostazioni.
visual-review
wang-bool/visual-review
Visualizza inline nel chat di DSH Web le immagini incollate o caricate e dà la vista ai modelli solo testuali: lo strumento visual_review, richiamabile dal modello, usa prima una qualsiasi API multimodale compatibile con OpenAI e, se fallisce, passa a un worker locale Qwen3-VL.
dsh-plugins (dsh-vision)
tzhr-invest/dsh-plugins
Strumento vision invocabile dall’agente che descrive immagini locali tramite qualsiasi endpoint vision compatibile OpenAI configurato, con controllo incrociato opzionale multi-modello e senza chiavi integrate.
dsh-plugin-multimodal
shinjiyu/dsh-plugin-multimodal
Pubblicizza l'incollaggio di immagini sui percorsi DeepSeek solo testo, descrive gli allegati con un sidecar di visione e lascia intatti i modelli di visione nativi.
dsh-vision-tools
moon09300731/dsh-vision-tools
Bundle completo di capacità di visione per DeepSeek Harness: uno strumento vision_understand (API di visione compatibili con OpenAI, Zhipu GLM-4V-Flash gratuito per impostazione predefinita) oltre a punti di ingresso incolla/trascina e rilascia/pulsante per il riconoscimento delle immagini.
dsh-plugin-grok2api-media-tool
lsjspl/dsh-plugin-grok2api-media-tool
Dà a dsh la capacità di generare immagini e video tramite l’API grok2api.
dsh-image-gen
leemancheung/dsh-image-gen
`image_gen` di GPT Image 2 con OAuth dell’abbonamento Codex come predefinito oppure modalità esplicita con chiave API: scheda in sviluppo, fino a tre partial API live, replay durevole degli allegati / lightbox / download, output del modello solo testo e richieste limitate e sicure per le credenziali.