Visione, voce e multimodale
I plugin Visione, voce e multimodale danno occhi, orecchie e voce ai modelli DeepSeek solo testo di DeepSeek-Harness (dsh). Trova strumenti di visione e route di provider che eseguono OCR e descrivono gli screenshot incollati tramite Zhipu GLM, Gemini, Doubao o Ollama in locale, input vocale dal microfono tramite la Web Speech API del browser o API compatibili con Whisper, lettura ad alta voce con Edge TTS o voci personalizzate, modalità vocali full-duplex, e generatori di immagini, video e musica.
312 plugin trovati
dsh-vision-proxy
flyvhidbwo/dsh-vision-proxy
Cervello DeepSeek + trascrizione automatica delle immagini: allega immagini nella GUI e ognuna viene trascritta tramite il deepseek-v4-flash-vision-exp ufficiale per impostazione predefinita (un cervello V4-Pro puramente testuale può vedere le immagini), con qualsiasi VLM compatibile con OpenAI o Ollama locale come alternative.
dsh-video-lens
dundunhan/dsh-video-lens
Fornisce agli agenti DeepSeek Harness solo testo la comprensione video: campionamento fotogrammi consapevole della scena + VLM + trascrizione ASR opzionale fusi in prove sulla linea temporale. / Plugin di comprensione video per modelli solo testo (campionamento fotogrammi consapevole della scena + VLM + trascrizione vocale opzionale).
dsh-vision-opencode
poiuyjie/dsh-vision-opencode
Aggiunge un modello di visione configurabile ai modelli principali solo testuali: uno strumento vision_read_image, un selettore del modello di visione nella barra del compositore e la conversione automatica da immagine a testo per i percorsi solo testuali.
dsh-agnes-studio
zmm863-commits/dsh-agnes-studio
Studio AI per immagini e video come pannello flottante DSH, così la creazione procede accanto alla conversazione invece di sostituirla: da testo a immagine, da immagine a immagine e composizione multi-immagine da 1K a 4K su otto rapporti d'aspetto; da testo a video e da immagine a video con controllo del primo fotogramma da 4 a 12 secondi; modalità cortometraggio che importa una sceneggiatura (.txt/.md/.json) e la suddivide in inquadrature storyboard per anteprima e generazione in blocco; e uno spazio di lavoro per prompt expert. Zero dipendenze a runtime.
dsh-voice-ai-girlfriend-plugin
beiyege-01/dsh-voice-ai-girlfriend-plugin
Fidanzata IA vocale per la UI Web: input microfono con FunASR, risposte vocali Qwen3-TTS, finestra animata del compagno e chat QQ bidirezionale (push di testo/voce/immagine) tramite NapCat.
dsh-plugin-xiaomi-mimo-tts
ppy-web/dsh-plugin-xiaomi-mimo-tts
Aggiunge la sintesi vocale Xiaomi MiMo a DSH Web con lettura ad alta voce dei messaggi dell'assistente, streaming PCM, voci predefinite e personalizzate, fallback alla sintesi vocale del browser, controlli di riproduzione e suoni dell'interfaccia opzionali.
dsh-speak
alan2z/dsh-speak
Plugin di annunci vocali senza dipendenze, basato su eventi: nessun modello extra, nessun costo di token. Parla con la voce naturale integrata del sistema, supportando sia Windows che macOS; annunci di risposta finale, avvisi di approvazione e domande, annunci opzionali di eventi (fine turno, comando completato, cambio obiettivo, errori strumenti, aggiornamenti attività), risposte finali riproducibili e una pagina delle impostazioni visiva bilingue.
Gemini-Eyes
consolesun/gemini-eyes
Ponte MCP verso gemini.google.com: analisi visiva di immagini e video, generazione di immagini con Imagen e video con Veo, e gestione delle conversazioni tramite la sessione del browser già autenticata, senza chiave API.
dsh-draw
perrylink/dsh-draw
Generazione text-to-image multi-motore (preset OpenAI Images e Zhipu CogView) con tracciamento della quota per sessione, failover del motore, configurazione sicura delle credenziali e una scheda risultato con rigenera.
dsh-deepseek-vision
siegfly/dsh-deepseek-vision
Un percorso del provider gateway visione-linguaggio: le immagini incollate vengono descritte da un modello VL configurabile (Qwen-VL per impostazione predefinita) prima di essere inviate a DeepSeek.
dsh-vision
linenxi-ctrl/dsh-vision
Plugin di vision esterno per DeepSeek Harness: pannello di configurazione con pulsante balena, riconoscimento immagini con risposta automatica e strumenti agente per screenshot/riconoscimento.
dsh-highres-vision
azwosile/dsh-highres-vision
Per il modello di visione nativo di DeepSeek Harness deepseek-v4-flash-vision-exp, innalza i limiti di ammissione delle immagini a 32 MiB / 8192 px / 600 immagini e aggiunge uno strumento highres_read che suddivide le immagini grandi in riquadri, per poi restituire l'immagine intera più riquadri di 800x800 tramite lo strumento read_image dell'host.
dsh-voice
goodandready/dsh-voice
Input vocale per la Web UI: dettatura segmentata dalle pause e messaggi vocali, ciascuno con la propria catena di fallback del provider (Deepgram, Groq, HuggingFace, whisper.cpp locale o endpoint compatibile con OpenAI).
dsh-voice
3274375092/dsh-voice
Input vocale per DeepSeek Harness: parla nel microfono e il testo riconosciuto viene inviato come un normale messaggio di chat, tramite riconoscimento vocale locale o del browser.
dsh-free-vision
fuzzysoul/dsh-free-vision
Bridge di visione gratuito per modelli solo testo: comprensione delle immagini, OCR, analisi dell'interfaccia e debug tramite provider di livello gratuito (Qwen3-VL-Flash, Doubao, DeepSeek-OCR) con una GUI delle impostazioni.
dsh-chat-imagine
corrinehu/dsh-chat-imagine
Genera e visualizza automaticamente immagini nella chat DSH tramite canali API o CLI locali (mmx / codex / agy), e può anche riconoscere immagini utilizzando la CLI corrispondente.
dsh-tool-vision
scorp1o117/dsh-tool-vision
Invia immagini locali o URL di immagini HTTP(S) a un endpoint vision compatibile con OpenAI configurato usando lo strumento inspect_image e restituisce alla conversazione la risposta testuale.
dsh-appshots
wongyuye/dsh-appshots
Cattura della finestra in stile Codex per DSH Desktop su macOS e Windows: premi entrambi i tasti Command (macOS) o entrambi i tasti Ctrl (Windows), oppure il pulsante fotocamera, per catturare la finestra in primo piano, allegarla alla chat corrente e iniettare un albero di accessibilità in stile VoiceOver come contesto nascosto.
dsh-vision
54xkeee/dsh-vision
Visione per DeepSeek solo testo tramite Doubao Web per impostazione predefinita (gratuito, senza chiave API: guida il tuo Chrome connesso tramite un bridge CDP Windows), con quota Antigravity IDE (flash/pro) o fallback su Gemini; escalation automatica del livello di dettaglio, memoria delle evidenze visive con reidratazione dopo la compattazione, cache basata su hash dei contenuti e un pannello client bilingue.
dsh-duet
yums/dsh-duet
Interazione vocale cinese full-duplex per DSH Web: detta e modifica le attività, invia richieste, gestisci le sessioni, rispondi alle domande DSH e ascolta annunci concisi di completamento delle attività.
deepseek-harness-plugins (vision-bridge)
yinxe/deepseek-harness-plugins
Permette ai modelli solo testo di vedere le immagini: quando arriva un'immagine con un segnaposto come \[image omitted because this model accepts text only], il modello chiama lo strumento vision_describe e il plugin inoltra il riferimento dell'immagine più la domanda a un modello multimodale, riprovando con un modello di fallback in caso di errore. Si configura nella pagina delle impostazioni ed è persistito tramite l'API ufficiale delle impostazioni.
dsh-voice-input-plugin
zhangbo-cn/dsh-voice-input-plugin
Microfono del compositore per l'interfaccia web: tocca per monitorare la trascrizione dal vivo e tieni premuto per parlare, con lettura della risposta tramite Edge TTS dell'host che viene trasmessa mentre il modello genera, pausa dell'eco durante la lettura e tocco per interrompere.
dsh-ocr-local
grelvan/dsh-ocr-local
Fallback OCR locale per percorsi solo testo: quando il modello di sessione dichiara di non poter accettare immagini, l'immagine allegata viene memorizzata nella cache locale e il suo percorso viene iniettato così che il modello possa chiamare ocr_image — PP-OCRv5 + ONNX Runtime su CPU, nessuna chiave API, le immagini non lasciano mai la macchina. Silenzioso quando il modello può vedere le immagini.
vision-exp-tile
nicholas023/vision-exp-tile
Riconoscimento di immagini grandi per modelli vision-exp: riconoscimento a tile 800×800 senza perdita (smart/pipeline/full), OCR locale con pre-elaborazione e instradamento della grafia, GPU multi-vendor opzionale (DirectML/CUDA/OpenVINO) con fallback automatico a CPU.