Vai al contenuto principale

Visione, voce e multimodale

I plugin Visione, voce e multimodale danno occhi, orecchie e voce ai modelli DeepSeek solo testo di DeepSeek-Harness (dsh). Trova strumenti di visione e route di provider che eseguono OCR e descrivono gli screenshot incollati tramite Zhipu GLM, Gemini, Doubao o Ollama in locale, input vocale dal microfono tramite la Web Speech API del browser o API compatibili con Whisper, lettura ad alta voce con Edge TTS o voci personalizzate, modalità vocali full-duplex, e generatori di immagini, video e musica.

312 plugin trovati

H

dsh-vision-mix

haiziyao/dsh-vision-mix

Combina API di testo, visione e generazione di immagini in un unico modello Mix con routing automatico: le richieste solo testo vanno al modello chat, le immagini utente e gli screenshot dell'agente vanno al modello di visione, i follow-up continuano a usare la stessa immagine di sessione, e gli agenti possono generare o modificare immagini con cronologia delle chiamate a livello di sessione.

324 giorni faVisione, voce e multimodaleMIT
O

dsh-ernie-image

omdsh-dev/dsh-ernie-image

32 mesi faVisione, voce e multimodaleBSD-3-Clause
Z

openflowframes

zerohackz/openflowframes

32 mesi faVisione, voce e multimodaleGPL-3.0
O

dsh-paddle-ocr

omdsh-dev/dsh-paddle-ocr

32 mesi faVisione, voce e multimodaleBSD-3-Clause
H

dsh-plugin-aigc-canvas

huanlinoto/dsh-plugin-aigc-canvas

Ponte HTTP AIGC indipendente dal provider + canvas infinito + post-elaborazione ffmpeg, 13 strumenti tra cui collegamento sul canvas, reroll e modifica dei media.

32 mesi faVisione, voce e multimodale
J

dsh-voice

jesse-njx/dsh-voice

Note vocali in ingresso, risposte parlate in uscita: detta audio che diventa messaggi utente (trascrizione), fai leggere ad alta voce le risposte dall'agente (sintesi vocale), local-first sotto ~/.dsh/voice

32 mesi faVisione, voce e multimodaleMIT
E

dsh-llm-vision-bridge

einskyle/dsh-llm-vision-bridge

Bridge di visione nativo del provider LLM: le immagini incollate in chat vengono descritte da un modello di visione (Qwen3-VL via pi-ai/llama.cpp) e la descrizione testuale viene passata a DeepSeek solo testo per la risposta — ammissione delle immagini, instradamento e compattazione avvengono tutti tramite meccanismi nativi dell'harness, con una cache LRU delle descrizioni e retry sui 503

32 mesi faVisione, voce e multimodaleMIT
Q

dsh-mic-input

qt-chen/dsh-mic-input

Input vocale da microfono per il composer: trascrizione live tramite Web Speech API del browser, deduplicazione/auto-continuazione, punteggiatura intelligente, impostazioni di lingua e invio automatico

32 mesi faVisione, voce e multimodaleMIT
H

dsh-open-eyes

hyper-dsh-plugins/dsh-open-eyes

Ponte di visione per le rotte DeepSeek solo testuali che analizza immagini allegate e locali tramite endpoint configurabili OpenAI Responses, Chat Completions o Anthropic Messages, lasciando native le rotte con capacità di immagini.

227 giorni faVisione, voce e multimodaleMIT
C

dsh-gpt-image

cai-mh/dsh-gpt-image

Genera immagini tramite una sessione ChatGPT web con accesso effettuato e le scarica in una directory locale.

224 giorni faVisione, voce e multimodaleMIT
M

dsh-ui-mockup

mackwan84/dsh-ui-mockup

Consumer dello strumento ui_mockup: nella fase di discussione genera wireframe e bozzetti ad alta fedeltà di UI, salva il progetto su disco, chiede conferma e poi blocca la specifica di design; include card client, routing delle immagini e i18n.

222 giorni faVisione, voce e multimodaleMIT
B

dsh-voice-call

biliye/dsh-voice-call

Assistente di chiamata vocale per la GUI web di DSH: una pallina di chiamata fluttuante e trascinabile, VAD lato browser che invia ogni frase dopo una pausa, riconoscimento vocale FunASR HTTP o in streaming, risposte TTS di MiniMax o compatibili OpenAI, una modalità opzionale con wake word e auto-sospensione, e invio di attività a sessioni subagente separate con progresso, stop e resoconti vocali di completamento.

25 giorni faVisione, voce e multimodaleMIT
Y

dsh-tool-lipsync

yu-wenchao/dsh-tool-lipsync

Plugin DSH gratuito per generare video lip-sync con oltre 3000 voci e oltre 500 lingue.

228 giorni faVisione, voce e multimodaleMIT
B

dsh-vision-plugin

bug-huntter/dsh-vision-plugin

Riconoscimento immagini configurabile per modelli DSH solo testo: i messaggi immagine vengono prima trascritti da un modello vision compatibile con OpenAI (URL di base, ID modello e chiave API impostati in una sezione Impostazioni) e poi passati al modello principale come testo, mentre viene dichiarato il supporto all'input immagine. Lo schema di autenticazione della chiave API è selezionabile (intestazioni di richiesta in stile OpenAI, Anthropic, Gemini o Azure) e la mancanza di una chiave viene segnalata prima dell'invio di qualsiasi richiesta.

25 giorni faVisione, voce e multimodaleMIT
B

dseyesopen

balue8246-maker/dseyesopen

Ponte vision per DeepSeek solo testo: inviate immagini (da sole o miste a testo) e un modello vision piccolo e veloce le descrive dietro le quinte; la chat conserva l'immagine, DeepSeek vede solo testo. Plugin puro: la disinstallazione ripristina tutto.

2mese scorsoVisione, voce e multimodale
L

dsh-visibridge

lhbsaa/dsh-visibridge

Evidenza visiva strutturata (OCR/layout/semantica) più uno strumento di acquisizione da camera USB per un ciclo di debug «scatta-guarda-regola»; backend: Ollama, DeepSeek, Xiaomi.

2mese scorsoVisione, voce e multimodaleMIT
F

dsh-short-video-studio

fengyungithub/dsh-short-video-studio

Banco di lavoro per l'attività di creazione video con AI in stile MiniMax-Design, basato su deepseek harness

2mese scorsoVisione, voce e multimodaleApache-2.0
Z

dsh-watch-video

zeshuochen/dsh-watch-video

Trascrizione video con priorità ai sottotitoli, esportazione SRT, controlli di processo annullabili e fallback a faster-whisper large-v3 quando i sottotitoli non sono disponibili.

2mese scorsoVisione, voce e multimodale
W

dsh-voice-agent (voice-app)

wayneyu430/dsh-voice-agent

Un Agent vocale conversazionale come frontend per dsh: parla naturalmente tramite ByteDance Duplex, delega le richieste a task in background e senti i loro risultati asincroni riportati a voce.

2mese scorsoVisione, voce e multimodale
M

dsh-voice-chat

maoyuching/dsh-voice-chat

Chat vocale in stile Doubao per DSH: tenere premuto il microfono del compositore converte la voce in testo e invia automaticamente, e le risposte dell'IA vengono lette a voce alta. Condensazione opzionale tramite LLM (le risposte lunghe vengono riassunte in brevi frasi parlate, seguendo il modello della conversazione corrente), pulizia del testo adatta al TTS, voci Edge TTS selezionabili, arresto automatico al silenzio regolabile e impostazioni incorporate nella finestra di dialogo delle impostazioni di DSH.

28 giorni faVisione, voce e multimodaleMIT
Y

phone-lens (phone-lens)

yxqfg/phone-lens

Trasforma la fotocamera di un telefono in un mirino live e ingresso foto per la tua sessione dsh, tramite LAN o USB.

23 giorni faVisione, voce e multimodaleMIT
M

dsh-capture

max-null/dsh-capture

Cattura schermo a doppio motore per DSH: dentro la shell desktop SSiD, un tasto rapido globale o il vassoio apre un overlay di selezione a riquadro a schermo intero (tutti i monitor, frame perfetti al pixel per schermo) con annotazione a riquadro rosso sul posto e una barra degli strumenti in stile WeChat; nel semplice DSH (browser), il pulsante fotocamera del compositore cattura lo schermo via getDisplayMedia e riutilizza nella pagina lo stesso overlay di selezione a riquadro + annotazione in una sola fase. L'immagine ritagliata arriva nel compositore della conversazione corrente tramite il percorso ufficiale degli allegati.

24 giorni faVisione, voce e multimodaleMIT
Y

phone-lens (lens-mate)

yxqfg/phone-lens

Trasforma la fotocamera di un telefono in mirino dal vivo e ingresso foto per la tua sessione dsh, via LAN o USB.

2mese scorsoVisione, voce e multimodaleMIT
E

dsh-labnana

exoticknight/dsh-labnana

Generazione di immagini Labnana per DeepSeek Harness: testo in immagine / immagine in immagine / editing preciso con stima dei crediti, saldo dell'abbonamento e interfaccia di impostazioni web.

29 giorni faVisione, voce e multimodaleApache-2.0