Vai al contenuto principale

Visione, voce e multimodale

I plugin Visione, voce e multimodale danno occhi, orecchie e voce ai modelli DeepSeek solo testo di DeepSeek-Harness (dsh). Trova strumenti di visione e route di provider che eseguono OCR e descrivono gli screenshot incollati tramite Zhipu GLM, Gemini, Doubao o Ollama in locale, input vocale dal microfono tramite la Web Speech API del browser o API compatibili con Whisper, lettura ad alta voce con Edge TTS o voci personalizzate, modalità vocali full-duplex, e generatori di immagini, video e musica.

312 plugin trovati

A

dsh-voice-kit

aaaadrop/dsh-voice-kit

Inserimento vocale (Web Speech API) e lettura ad alta voce (speechSynthesis) per l'interfaccia web di DeepSeek Harness — kit di input vocale + lettura delle risposte per DSH

1mese scorsoVisione, voce e multimodaleMIT
E

dsh-sight

ericfetch/dsh-sight

Plugin per DeepSeek Harness: dichiarazioni dirette di trasferimento di immagini multimodali + cancellazione delle immagini per sessione (sostituzione della superficie), con una pagina di impostazioni e controlli nel compositore.

1mese scorsoVisione, voce e multimodaleMIT
H

dsh-open-file

hyper-dsh-plugins/dsh-open-file

Caricamento di file arbitrari vincolato al workspace, lettura, OCR e rendering per DeepSeek Harness.

1mese scorsoVisione, voce e multimodaleMIT
Y

dsh-multimodal

yauntyour/dsh-multimodal

Catene multimodali per tipo di file: i modelli di elaborazione preimpostati per wildcard convertono file immagine, video e audio in token di prompt prima che raggiungano il modello di sessione solo testo, con catene di fallback per preset e una pagina impostazioni Multimodal.

12 mesi faVisione, voce e multimodaleMIT
L

dsh-voice-input

lhenlihai-hub/dsh-voice-input

12 mesi faVisione, voce e multimodaleMIT
A

dsh-vision-bridge

acc1143/dsh-vision-bridge

Plugin di routing a due modelli per DSH: la conversazione principale resta su DeepSeek, le attività con immagini vengono distribuite automaticamente al modello di visione configurato esplicitamente e il risultato dell'analisi torna a DeepSeek per proseguire.

12 mesi faVisione, voce e multimodaleMIT
3

dsh-vision

314857493/dsh-vision

Plugin DeepSeek Harness: una rotta `deepseek-vision` che dichiara l'input di immagini e trascrive le immagini incollate tramite i modelli di visione gratuiti Zhipu GLM prima di delegare all'adattatore DeepSeek.

12 mesi faVisione, voce e multimodaleMIT
A

dsh-image-plugins

alanzhao0128/dsh-image-plugins

Plugin multimodale per DeepSeek Harness: comprende le immagini e genera immagini tramite endpoint compatibili con OpenAI o DashScope configurabili.

12 mesi faVisione, voce e multimodaleMIT
Z

dsh-plugins

zjcdkj/dsh-plugins

Plugin out-of-tree per DeepSeek Harness: dona gli occhi a un modello di coding solo testo instradando le immagini a una rotta Qwen-VL (DashScope) tramite ctx.llm e restituendo testo.

12 mesi faVisione, voce e multimodaleMIT
H

dsh-open-file

hyp6666/dsh-open-file

Caricamento, lettura, OCR e rendering di file arbitrari legati all'area di lavoro per DeepSeek Harness.

12 mesi faVisione, voce e multimodaleMIT
X

dsh-image-vision

xsoc1/dsh-image-vision

Ponte per gli allegati immagine nella chat con uno strumento view_image per qualsiasi VLM compatibile OpenAI (Ollama locale o cloud): le immagini incollate/trascinate diventano marcatori di percorso view_image prima di raggiungere i modelli DeepSeek solo testo.

12 mesi faVisione, voce e multimodale
W

mimo-vision

wulusai2333/mimo-vision

Strumento `describe_image`: un ponte di visione che invia le immagini a mimo-v2.5 tramite l'API opencode Zen (credenziale `OPENCODE_GO_API_KEY`, prima rotta gratuita con fallback a pagamento) e restituisce descrizioni testuali ai modelli solo testo, con passthrough nativo e transcodifica ImageMagick di SVG/TIFF/HEIC.

12 mesi faVisione, voce e multimodaleMIT
W

dsh-tool-vision

wanshichenguang/dsh-tool-vision

Strumento image_describe (识图) rivolto al modello sull'API compatibile OpenAI di DashScope (qwen3.7-flash), più un ponte di incollaggio: nelle sessioni solo testo le immagini incollate si convertono automaticamente in percorsi file all'invio e vengono renderizzate di nuovo nel transcript, così non inciampano mai nell'ammissione delle immagini. Porta la tua DASHSCOPE_API_KEY; endpoint/modello/budget configurabili, client HTTP a prova di redirect, funziona in ogni agent preset.

12 mesi faVisione, voce e multimodaleMIT
R

dsh-vision-subagent

ruby1304/dsh-vision-subagent

Visione per qualsiasi rotta DSH: incolla immagini nel compositore web con analisi automatica guidata dall'intento, delega la lettura delle immagini dello spazio di lavoro a un subagente di visione Kimi/MiniMax e materializza gli originali incollati per modificarli.

123 giorni faVisione, voce e multimodaleMIT
N

dsh-auto-vision

normanfxxkingrockwell/dsh-auto-vision

Ponte di visione con scoperta automatica per agenti DeepSeek Harness solo testo: trova da sé un modello capace di immagini tra i provider configurati e restituisce descrizioni delle immagini come testo semplice tramite uno strumento di visione.

118 giorni faVisione, voce e multimodaleMIT
N

dsh-llm-deepseek-vision

nagasakisoyo-ui/dsh-llm-deepseek-vision

Adattatore DeepSeek aumentato con la visione: un modello capace di visione descrive l'immagine in ingresso, poi un modello DeepSeek solo testo ragiona su quella descrizione.

12 mesi faVisione, voce e multimodaleMIT
L

dsh-eyes

leeminjing/dsh-eyes

Visione su richiesta per i modelli DeepSeek solo testo: carichi le immagini e il modello chiama uno strumento view_image basato su qualsiasi endpoint di visione compatibile OpenAI (Qwen/DashScope per impostazione predefinita).

12 mesi faVisione, voce e multimodaleMIT
K

dsh-mindseye

kanchengw/dsh-mindseye

Visione come plugin per i modelli solo testo su DSH, con interazione nativa per comprensione e generazione di immagini, automazione della GUI, memoria delle prove a strati e cache.

1mese scorsoVisione, voce e multimodaleMIT
G

dsh-tool-vision

gloryxpnv/dsh-tool-vision

Visione strutturata local-first per agenti solo testo: le immagini vanno a un VLM locale compatibile OpenAI e tornano come prove JSON (sintesi, OCR letterale, regioni di layout, entità/relazioni, colori, incertezza esplicita), con fallback anti-allucinazione e un ponte opzionale di incolla/carica; costo cloud zero, le immagini non lasciano mai la macchina.

12 mesi faVisione, voce e multimodaleMIT
E

dsh-plugin-mm-vision

elohia/dsh-plugin-mm-vision

Codificatore di sinestesia per DSH: un modello di visione traduce le immagini in testo spaziale strutturato e compatto (canvas/elementi/coordinate in percentuale), dando ai LLM solo testo una comprensione delle immagini a livello di pixel tramite lo strumento `mm_vision`.

12 mesi faVisione, voce e multimodaleMIT
C

dsh-deepseek-vision

cheng-cheng9669/dsh-deepseek-vision

Riutilizza la modalità visione integrata di DeepSeek web per i modelli solo testo: lo strumento deepseek_vision pilota l'automazione browser locale deepseek-vision-cli (aiuto all'accesso manuale, deep-think attivo, chiusura automatica del browser) e restituisce descrizioni delle immagini come testo.

12 mesi faVisione, voce e multimodaleMIT
1

dsh-vision-fallback

1helloman1/dsh-vision-fallback

Instrada le immagini della chat verso un modello di visione fisso compatibile OpenAI, restituisce osservazioni fattuali al modello principale selezionato e riusa le osservazioni per sessione attraverso replay, compattazione e riavvii.

1mese scorsoVisione, voce e multimodaleMIT
Z

dsh-voice

zhuiyueya/dsh-voice

Voce per DeepSeek Harness (dsh) — input speech-to-text + lettura ad alta voce TTS per DeepSeek solo testo, senza chiave API

12 mesi faVisione, voce e multimodaleMIT
S

multimodal-bridge

spirit4471/multimodal-bridge

Bundle di plugin per DeepSeek Harness: strumenti qwen_vision (comprensione delle immagini con Qwen-VL) e qwen_generate (testo-immagine con Qwen-Image) per modelli solo testo

12 mesi faVisione, voce e multimodaleMIT