Visione, voce e multimodale
I plugin Visione, voce e multimodale danno occhi, orecchie e voce ai modelli DeepSeek solo testo di DeepSeek-Harness (dsh). Trova strumenti di visione e route di provider che eseguono OCR e descrivono gli screenshot incollati tramite Zhipu GLM, Gemini, Doubao o Ollama in locale, input vocale dal microfono tramite la Web Speech API del browser o API compatibili con Whisper, lettura ad alta voce con Edge TTS o voci personalizzate, modalità vocali full-duplex, e generatori di immagini, video e musica.
312 plugin trovati
dsh-voice-kit
aaaadrop/dsh-voice-kit
Inserimento vocale (Web Speech API) e lettura ad alta voce (speechSynthesis) per l'interfaccia web di DeepSeek Harness — kit di input vocale + lettura delle risposte per DSH
dsh-sight
ericfetch/dsh-sight
Plugin per DeepSeek Harness: dichiarazioni dirette di trasferimento di immagini multimodali + cancellazione delle immagini per sessione (sostituzione della superficie), con una pagina di impostazioni e controlli nel compositore.
dsh-open-file
hyper-dsh-plugins/dsh-open-file
Caricamento di file arbitrari vincolato al workspace, lettura, OCR e rendering per DeepSeek Harness.
dsh-multimodal
yauntyour/dsh-multimodal
Catene multimodali per tipo di file: i modelli di elaborazione preimpostati per wildcard convertono file immagine, video e audio in token di prompt prima che raggiungano il modello di sessione solo testo, con catene di fallback per preset e una pagina impostazioni Multimodal.
dsh-voice-input
lhenlihai-hub/dsh-voice-input
dsh-vision-bridge
acc1143/dsh-vision-bridge
Plugin di routing a due modelli per DSH: la conversazione principale resta su DeepSeek, le attività con immagini vengono distribuite automaticamente al modello di visione configurato esplicitamente e il risultato dell'analisi torna a DeepSeek per proseguire.
dsh-vision
314857493/dsh-vision
Plugin DeepSeek Harness: una rotta `deepseek-vision` che dichiara l'input di immagini e trascrive le immagini incollate tramite i modelli di visione gratuiti Zhipu GLM prima di delegare all'adattatore DeepSeek.
dsh-image-plugins
alanzhao0128/dsh-image-plugins
Plugin multimodale per DeepSeek Harness: comprende le immagini e genera immagini tramite endpoint compatibili con OpenAI o DashScope configurabili.
dsh-plugins
zjcdkj/dsh-plugins
Plugin out-of-tree per DeepSeek Harness: dona gli occhi a un modello di coding solo testo instradando le immagini a una rotta Qwen-VL (DashScope) tramite ctx.llm e restituendo testo.
dsh-open-file
hyp6666/dsh-open-file
Caricamento, lettura, OCR e rendering di file arbitrari legati all'area di lavoro per DeepSeek Harness.
dsh-image-vision
xsoc1/dsh-image-vision
Ponte per gli allegati immagine nella chat con uno strumento view_image per qualsiasi VLM compatibile OpenAI (Ollama locale o cloud): le immagini incollate/trascinate diventano marcatori di percorso view_image prima di raggiungere i modelli DeepSeek solo testo.
mimo-vision
wulusai2333/mimo-vision
Strumento `describe_image`: un ponte di visione che invia le immagini a mimo-v2.5 tramite l'API opencode Zen (credenziale `OPENCODE_GO_API_KEY`, prima rotta gratuita con fallback a pagamento) e restituisce descrizioni testuali ai modelli solo testo, con passthrough nativo e transcodifica ImageMagick di SVG/TIFF/HEIC.
dsh-tool-vision
wanshichenguang/dsh-tool-vision
Strumento image_describe (识图) rivolto al modello sull'API compatibile OpenAI di DashScope (qwen3.7-flash), più un ponte di incollaggio: nelle sessioni solo testo le immagini incollate si convertono automaticamente in percorsi file all'invio e vengono renderizzate di nuovo nel transcript, così non inciampano mai nell'ammissione delle immagini. Porta la tua DASHSCOPE_API_KEY; endpoint/modello/budget configurabili, client HTTP a prova di redirect, funziona in ogni agent preset.
dsh-vision-subagent
ruby1304/dsh-vision-subagent
Visione per qualsiasi rotta DSH: incolla immagini nel compositore web con analisi automatica guidata dall'intento, delega la lettura delle immagini dello spazio di lavoro a un subagente di visione Kimi/MiniMax e materializza gli originali incollati per modificarli.
dsh-auto-vision
normanfxxkingrockwell/dsh-auto-vision
Ponte di visione con scoperta automatica per agenti DeepSeek Harness solo testo: trova da sé un modello capace di immagini tra i provider configurati e restituisce descrizioni delle immagini come testo semplice tramite uno strumento di visione.
dsh-llm-deepseek-vision
nagasakisoyo-ui/dsh-llm-deepseek-vision
Adattatore DeepSeek aumentato con la visione: un modello capace di visione descrive l'immagine in ingresso, poi un modello DeepSeek solo testo ragiona su quella descrizione.
dsh-eyes
leeminjing/dsh-eyes
Visione su richiesta per i modelli DeepSeek solo testo: carichi le immagini e il modello chiama uno strumento view_image basato su qualsiasi endpoint di visione compatibile OpenAI (Qwen/DashScope per impostazione predefinita).
dsh-mindseye
kanchengw/dsh-mindseye
Visione come plugin per i modelli solo testo su DSH, con interazione nativa per comprensione e generazione di immagini, automazione della GUI, memoria delle prove a strati e cache.
dsh-tool-vision
gloryxpnv/dsh-tool-vision
Visione strutturata local-first per agenti solo testo: le immagini vanno a un VLM locale compatibile OpenAI e tornano come prove JSON (sintesi, OCR letterale, regioni di layout, entità/relazioni, colori, incertezza esplicita), con fallback anti-allucinazione e un ponte opzionale di incolla/carica; costo cloud zero, le immagini non lasciano mai la macchina.
dsh-plugin-mm-vision
elohia/dsh-plugin-mm-vision
Codificatore di sinestesia per DSH: un modello di visione traduce le immagini in testo spaziale strutturato e compatto (canvas/elementi/coordinate in percentuale), dando ai LLM solo testo una comprensione delle immagini a livello di pixel tramite lo strumento `mm_vision`.
dsh-deepseek-vision
cheng-cheng9669/dsh-deepseek-vision
Riutilizza la modalità visione integrata di DeepSeek web per i modelli solo testo: lo strumento deepseek_vision pilota l'automazione browser locale deepseek-vision-cli (aiuto all'accesso manuale, deep-think attivo, chiusura automatica del browser) e restituisce descrizioni delle immagini come testo.
dsh-vision-fallback
1helloman1/dsh-vision-fallback
Instrada le immagini della chat verso un modello di visione fisso compatibile OpenAI, restituisce osservazioni fattuali al modello principale selezionato e riusa le osservazioni per sessione attraverso replay, compattazione e riavvii.
dsh-voice
zhuiyueya/dsh-voice
Voce per DeepSeek Harness (dsh) — input speech-to-text + lettura ad alta voce TTS per DeepSeek solo testo, senza chiave API
multimodal-bridge
spirit4471/multimodal-bridge
Bundle di plugin per DeepSeek Harness: strumenti qwen_vision (comprensione delle immagini con Qwen-VL) e qwen_generate (testo-immagine con Qwen-Image) per modelli solo testo