Vai al contenuto principale

Visione, voce e multimodale

I plugin Visione, voce e multimodale danno occhi, orecchie e voce ai modelli DeepSeek solo testo di DeepSeek-Harness (dsh). Trova strumenti di visione e route di provider che eseguono OCR e descrivono gli screenshot incollati tramite Zhipu GLM, Gemini, Doubao o Ollama in locale, input vocale dal microfono tramite la Web Speech API del browser o API compatibili con Whisper, lettura ad alta voce con Edge TTS o voci personalizzate, modalità vocali full-duplex, e generatori di immagini, video e musica.

312 plugin trovati

F

dsh-vision-proxy

flyvhidbwo/dsh-vision-proxy

Cervello DeepSeek + trascrizione automatica delle immagini: allega immagini nella GUI e ognuna viene trascritta tramite il deepseek-v4-flash-vision-exp ufficiale per impostazione predefinita (un cervello V4-Pro puramente testuale può vedere le immagini), con qualsiasi VLM compatibile con OpenAI o Ollama locale come alternative.

15mese scorsoVisione, voce e multimodaleMIT
D

dsh-video-lens

dundunhan/dsh-video-lens

Fornisce agli agenti DeepSeek Harness solo testo la comprensione video: campionamento fotogrammi consapevole della scena + VLM + trascrizione ASR opzionale fusi in prove sulla linea temporale. / Plugin di comprensione video per modelli solo testo (campionamento fotogrammi consapevole della scena + VLM + trascrizione vocale opzionale).

13mese scorsoVisione, voce e multimodaleMIT
P

dsh-vision-opencode

poiuyjie/dsh-vision-opencode

Aggiunge un modello di visione configurabile ai modelli principali solo testuali: uno strumento vision_read_image, un selettore del modello di visione nella barra del compositore e la conversione automatica da immagine a testo per i percorsi solo testuali.

1323 giorni faVisione, voce e multimodaleMIT
Z

dsh-agnes-studio

zmm863-commits/dsh-agnes-studio

Studio AI per immagini e video come pannello flottante DSH, così la creazione procede accanto alla conversazione invece di sostituirla: da testo a immagine, da immagine a immagine e composizione multi-immagine da 1K a 4K su otto rapporti d'aspetto; da testo a video e da immagine a video con controllo del primo fotogramma da 4 a 12 secondi; modalità cortometraggio che importa una sceneggiatura (.txt/.md/.json) e la suddivide in inquadrature storyboard per anteprima e generazione in blocco; e uno spazio di lavoro per prompt expert. Zero dipendenze a runtime.

123 giorni faVisione, voce e multimodale
B

dsh-voice-ai-girlfriend-plugin

beiyege-01/dsh-voice-ai-girlfriend-plugin

Fidanzata IA vocale per la UI Web: input microfono con FunASR, risposte vocali Qwen3-TTS, finestra animata del compagno e chat QQ bidirezionale (push di testo/voce/immagine) tramite NapCat.

1219 giorni faVisione, voce e multimodale
P

dsh-plugin-xiaomi-mimo-tts

ppy-web/dsh-plugin-xiaomi-mimo-tts

Aggiunge la sintesi vocale Xiaomi MiMo a DSH Web con lettura ad alta voce dei messaggi dell'assistente, streaming PCM, voci predefinite e personalizzate, fallback alla sintesi vocale del browser, controlli di riproduzione e suoni dell'interfaccia opzionali.

113 giorni faVisione, voce e multimodaleMIT
A

dsh-speak

alan2z/dsh-speak

Plugin di annunci vocali senza dipendenze, basato su eventi: nessun modello extra, nessun costo di token. Parla con la voce naturale integrata del sistema, supportando sia Windows che macOS; annunci di risposta finale, avvisi di approvazione e domande, annunci opzionali di eventi (fine turno, comando completato, cambio obiettivo, errori strumenti, aggiornamenti attività), risposte finali riproducibili e una pagina delle impostazioni visiva bilingue.

117 giorni faVisione, voce e multimodaleMIT
C

Gemini-Eyes

consolesun/gemini-eyes

Ponte MCP verso gemini.google.com: analisi visiva di immagini e video, generazione di immagini con Imagen e video con Veo, e gestione delle conversazioni tramite la sessione del browser già autenticata, senza chiave API.

11mese scorsoVisione, voce e multimodale
P

dsh-draw

perrylink/dsh-draw

Generazione text-to-image multi-motore (preset OpenAI Images e Zhipu CogView) con tracciamento della quota per sessione, failover del motore, configurazione sicura delle credenziali e una scheda risultato con rigenera.

98 giorni faVisione, voce e multimodaleApache-2.0
S

dsh-deepseek-vision

siegfly/dsh-deepseek-vision

Un percorso del provider gateway visione-linguaggio: le immagini incollate vengono descritte da un modello VL configurabile (Qwen-VL per impostazione predefinita) prima di essere inviate a DeepSeek.

921 giorni faVisione, voce e multimodaleMIT
L

dsh-vision

linenxi-ctrl/dsh-vision

Plugin di vision esterno per DeepSeek Harness: pannello di configurazione con pulsante balena, riconoscimento immagini con risposta automatica e strumenti agente per screenshot/riconoscimento.

92 mesi faVisione, voce e multimodaleMIT
A

dsh-highres-vision

azwosile/dsh-highres-vision

Per il modello di visione nativo di DeepSeek Harness deepseek-v4-flash-vision-exp, innalza i limiti di ammissione delle immagini a 32 MiB / 8192 px / 600 immagini e aggiunge uno strumento highres_read che suddivide le immagini grandi in riquadri, per poi restituire l'immagine intera più riquadri di 800x800 tramite lo strumento read_image dell'host.

822 giorni faVisione, voce e multimodaleMIT
G

dsh-voice

goodandready/dsh-voice

Input vocale per la Web UI: dettatura segmentata dalle pause e messaggi vocali, ciascuno con la propria catena di fallback del provider (Deepgram, Groq, HuggingFace, whisper.cpp locale o endpoint compatibile con OpenAI).

8ieriVisione, voce e multimodaleMIT
3

dsh-voice

3274375092/dsh-voice

Input vocale per DeepSeek Harness: parla nel microfono e il testo riconosciuto viene inviato come un normale messaggio di chat, tramite riconoscimento vocale locale o del browser.

8l’altro ieriVisione, voce e multimodaleMIT
F

dsh-free-vision

fuzzysoul/dsh-free-vision

Bridge di visione gratuito per modelli solo testo: comprensione delle immagini, OCR, analisi dell'interfaccia e debug tramite provider di livello gratuito (Qwen3-VL-Flash, Doubao, DeepSeek-OCR) con una GUI delle impostazioni.

8mese scorsoVisione, voce e multimodaleMIT
C

dsh-chat-imagine

corrinehu/dsh-chat-imagine

Genera e visualizza automaticamente immagini nella chat DSH tramite canali API o CLI locali (mmx / codex / agy), e può anche riconoscere immagini utilizzando la CLI corrispondente.

8mese scorsoVisione, voce e multimodaleMIT
S

dsh-tool-vision

scorp1o117/dsh-tool-vision

Invia immagini locali o URL di immagini HTTP(S) a un endpoint vision compatibile con OpenAI configurato usando lo strumento inspect_image e restituisce alla conversazione la risposta testuale.

83 giorni faVisione, voce e multimodale
W

dsh-appshots

wongyuye/dsh-appshots

Cattura della finestra in stile Codex per DSH Desktop su macOS e Windows: premi entrambi i tasti Command (macOS) o entrambi i tasti Ctrl (Windows), oppure il pulsante fotocamera, per catturare la finestra in primo piano, allegarla alla chat corrente e iniettare un albero di accessibilità in stile VoiceOver come contesto nascosto.

715 giorni faVisione, voce e multimodaleMIT
5

dsh-vision

54xkeee/dsh-vision

Visione per DeepSeek solo testo tramite Doubao Web per impostazione predefinita (gratuito, senza chiave API: guida il tuo Chrome connesso tramite un bridge CDP Windows), con quota Antigravity IDE (flash/pro) o fallback su Gemini; escalation automatica del livello di dettaglio, memoria delle evidenze visive con reidratazione dopo la compattazione, cache basata su hash dei contenuti e un pannello client bilingue.

72 mesi faVisione, voce e multimodaleMIT
Y

dsh-duet

yums/dsh-duet

Interazione vocale cinese full-duplex per DSH Web: detta e modifica le attività, invia richieste, gestisci le sessioni, rispondi alle domande DSH e ascolta annunci concisi di completamento delle attività.

63 giorni faVisione, voce e multimodaleApache-2.0
Y

deepseek-harness-plugins (vision-bridge)

yinxe/deepseek-harness-plugins

Permette ai modelli solo testo di vedere le immagini: quando arriva un'immagine con un segnaposto come \[image omitted because this model accepts text only], il modello chiama lo strumento vision_describe e il plugin inoltra il riferimento dell'immagine più la domanda a un modello multimodale, riprovando con un modello di fallback in caso di errore. Si configura nella pagina delle impostazioni ed è persistito tramite l'API ufficiale delle impostazioni.

6l’altro ieriVisione, voce e multimodaleMIT
Z

dsh-voice-input-plugin

zhangbo-cn/dsh-voice-input-plugin

Microfono del compositore per l'interfaccia web: tocca per monitorare la trascrizione dal vivo e tieni premuto per parlare, con lettura della risposta tramite Edge TTS dell'host che viene trasmessa mentre il modello genera, pausa dell'eco durante la lettura e tocco per interrompere.

6mese scorsoVisione, voce e multimodaleMIT
G

dsh-ocr-local

grelvan/dsh-ocr-local

Fallback OCR locale per percorsi solo testo: quando il modello di sessione dichiara di non poter accettare immagini, l'immagine allegata viene memorizzata nella cache locale e il suo percorso viene iniettato così che il modello possa chiamare ocr_image — PP-OCRv5 + ONNX Runtime su CPU, nessuna chiave API, le immagini non lasciano mai la macchina. Silenzioso quando il modello può vedere le immagini.

55 giorni faVisione, voce e multimodale
N

vision-exp-tile

nicholas023/vision-exp-tile

Riconoscimento di immagini grandi per modelli vision-exp: riconoscimento a tile 800×800 senza perdita (smart/pipeline/full), OCR locale con pre-elaborazione e instradamento della grafia, GPU multi-vendor opzionale (DirectML/CUDA/OpenVINO) con fallback automatico a CPU.

5mese scorsoVisione, voce e multimodaleMIT