Vai al contenuto principale

Visione, voce e multimodale

I plugin Visione, voce e multimodale danno occhi, orecchie e voce ai modelli DeepSeek solo testo di DeepSeek-Harness (dsh). Trova strumenti di visione e route di provider che eseguono OCR e descrivono gli screenshot incollati tramite Zhipu GLM, Gemini, Doubao o Ollama in locale, input vocale dal microfono tramite la Web Speech API del browser o API compatibili con Whisper, lettura ad alta voce con Edge TTS o voci personalizzate, modalità vocali full-duplex, e generatori di immagini, video e musica.

312 plugin trovati

1

dsh-vision-sidecar

121103qwq/dsh-vision-sidecar

Sidecar di vision gratuito e ospitato per DeepSeek Harness, con prove di sessione persistenti.

42 mesi faVisione, voce e multimodaleMIT
Y

dsh-image-subagent

yuqingsh/dsh-image-subagent

42 mesi faVisione, voce e multimodaleMIT
G

dsh-vision-bridge

gxx182/dsh-vision-bridge

Collega le immagini della sessione a provider di visione configurabili e restituisce analisi solo testo alle route di modelli DeepSeek Harness idonee.

42 mesi faVisione, voce e multimodaleMIT
H

dsh-omni-workstation

huashenglian/dsh-omni-workstation

Workstation omni-modale per DSH: analyze_image su una catena ordinata multi-scheda di failover VLM, un toolkit di visione con sei strumenti (zoom, campionamento colori, pixel diff, OCR, rilevamento elementi, visualizzazione inline) che condivide lo stesso resolver di immagini, generate_image sui protocolli OpenAI/DashScope/ComfyUI, generate_video asincrono multi-scheda con un builder /build-video-tool, più TTS speak/clone_voice su sette provider, tutto governato da un'unica pagina di impostazioni con salvataggio automatico.

314 giorni faVisione, voce e multimodaleMIT
W

dsh-hold-to-talk

wangzhanchao883/dsh-hold-to-talk

Input a una mano e senza tastiera per il composer: tieni premuto il mouse sulla casella di input, parla, rilascia — il testo finisce nella bozza, e scorrendo verso l'alto annulli senza lasciare una frase a metà. Nessun pulsante microfono da centrare e nessuna scorciatoia da ricordare; la mano non deve mai lasciare l'area di input, che è il punto quando l'altra mano è occupata. Il riconoscimento gira completamente offline (SenseVoice via sherpa-onnx, nessuna chiave API, l'audio non lascia mai la macchina).

323 ore faVisione, voce e multimodaleMIT
N

dsh-plugin-speech

nakamuraia/dsh-plugin-speech

Legge ad alta voce le risposte dell'assistente in DeepSeek Harness: fornitori di sintesi vocale con riproduzione in streaming.

318 giorni faVisione, voce e multimodaleMIT
S

dsh-voice-assistant

supersyh-sss/dsh-voice-assistant

Assistente vocale per il web dsh: pronuncia la frase di attivazione (ad es. "小鲸") per attivare la dettatura a mani libere — ciò che dici viene trascritto e digitato automaticamente nella casella della chat. Supporta comandi di modifica vocali (invia, cancella, nuova riga, interrompi lettura) e legge ad alta voce in cinese le risposte dell'assistente. Il riconoscimento vocale gira localmente nel browser via sherpa-onnx WASM, quindi funziona offline senza chiave API.

3mese scorsoVisione, voce e multimodaleMIT
S

dsh-audiogen

shimingming520/dsh-audiogen

Generazione audio IA per la GUI web di DeepSeek Harness — TTS multi-vendor, musica, effetti sonori e design della voce con pannello laterale, confronto modelli, libreria di risorse e strumenti Agent.

324 giorni faVisione, voce e multimodaleApache-2.0
L

dsh-voco

lgquan/dsh-voco

Conversazioni vocali continue per DSH con ascolto a mani libere, push-to-talk, riconoscimento vocale, risposte TTS e delega di Agent in background.

3mese scorsoVisione, voce e multimodaleMIT
T

dsh-gsv

taoruiliu19/dsh-gsv

TTS locale in tempo reale per DeepSeek Harness: preset vocali, lettura automatica, assistente di configurazione del motore, pulsante di lettura ad alta voce e un pannello delle impostazioni per il motore GSV-TTS-Lite.

3mese scorsoVisione, voce e multimodaleMIT
J

dsh-ximalaya

jerryqx/dsh-ximalaya

Ascolta podcast e audiolibri Ximalaya dentro la web UI di DSH: cerca album, sfoglia tracce paginate e riproduci tramite una barra now-playing (prev/play/next, seek, volume, velocità). Dopo il login via QR, la pagina "Mine" elenca le tracce che ti piacciono (clic per riprodurre), gli album sottoscritti con suggerimenti sull'ultimo episodio e gli anchor seguiti con i loro album pubblici; l'host inoltra gli stream audio con supporto Range e registra uno strumento `ximalaya_play` così l'agente può cercare e riprodurre su richiesta.

3mese scorsoVisione, voce e multimodaleMIT
B

phone-eye

boheastill/phone-eye

Il tuo agente AI può vedere e usare un vero telefono Android: phone_look (fusione di visione e UI-tree), tap/swipe/type, screenshot — via adb, per qualsiasi client MCP.

3mese scorsoVisione, voce e multimodaleMIT
X

dsh-image-vision

xiaoyuink/dsh-image-vision

Comprensione delle immagini per qualsiasi modello DSH: strumenti di visione, OCR, grounding e ritaglio con preset di dominio per istopatologia, biologia cellulare, anatomia, immagini cliniche e figure scientifiche.

329 giorni faVisione, voce e multimodale
L

Deepseek-Continuity

linxuhao/deepseek-continuity

Generazione locale di immagini, voce, musica ed effetti sonori, più trascrizione, con identità fissata: personaggi, animali, oggetti e voci degli attori vengono definiti una volta e riutilizzati in ogni chiamata successiva; l'output degenerato (immagine quasi piatta, audio silenzioso) viene rifiutato invece di essere restituito come successo, e una riga generata può essere riletta come testo, così che un clone che ha inghiottito la propria fine diventi visibile. I motori si scaricano quando inattivi, e la generazione di immagini e la trascrizione possono ciascuna puntare a un'API di forma OpenAI invece del backend Vulkan locale.

312 giorni faVisione, voce e multimodaleMIT
Y

dsh-ui-spec

yumimanji/dsh-ui-spec

Plugin DeepSeek Harness che trasforma screenshot UI in specifiche web di grado implementativo utilizzando OCR, geometria deterministica, grafi di scena, asset e confronto di rendering.

32 mesi faVisione, voce e multimodaleMIT
D

deepseekeyes

dttxorg/deepseekeyes

Runtime di visione e Computer Use multipiattaforma verificabile per DeepSeek Harness con prove che preservano la fonte.

32 mesi faVisione, voce e multimodaleMIT
N

voco-input-sh

nothree-code/voco-input-sh

Input vocale per la Web UI: un pulsante microfono che usa il riconoscimento vocale offline locale di VocoType e inserisce automaticamente il testo riconosciuto nel compositore (auto-deploy, dedupe, dettatura continua).

319 giorni faVisione, voce e multimodaleMIT
B

dsh-stt-input

baisama-cloud/dsh-stt-input

Input vocale speech-to-text per la web UI: un pulsante microfono nel composer trascrive il parlato nella bozza tramite la Web Speech API del browser (zero-config) o un'API Whisper compatibile OpenAI (OpenAI / Groq), con modello e lingua selezionabili nelle Impostazioni.

3mese scorsoVisione, voce e multimodaleMIT
W

visual-review

wang-bool/visual-review

Visualizza inline nel chat di DSH Web le immagini incollate o caricate e dà la vista ai modelli solo testuali: lo strumento visual_review, richiamabile dal modello, usa prima una qualsiasi API multimodale compatibile con OpenAI e, se fallisce, passa a un worker locale Qwen3-VL.

32 mesi faVisione, voce e multimodaleMIT
T

dsh-plugins (dsh-vision)

tzhr-invest/dsh-plugins

Strumento vision invocabile dall’agente che descrive immagini locali tramite qualsiasi endpoint vision compatibile OpenAI configurato, con controllo incrociato opzionale multi-modello e senza chiavi integrate.

35 giorni faVisione, voce e multimodaleMIT
S

dsh-plugin-multimodal

shinjiyu/dsh-plugin-multimodal

Pubblicizza l'incollaggio di immagini sui percorsi DeepSeek solo testo, descrive gli allegati con un sidecar di visione e lascia intatti i modelli di visione nativi.

32 mesi faVisione, voce e multimodaleMIT
M

dsh-vision-tools

moon09300731/dsh-vision-tools

Bundle completo di capacità di visione per DeepSeek Harness: uno strumento vision_understand (API di visione compatibili con OpenAI, Zhipu GLM-4V-Flash gratuito per impostazione predefinita) oltre a punti di ingresso incolla/trascina e rilascia/pulsante per il riconoscimento delle immagini.

32 mesi faVisione, voce e multimodaleMIT
L

dsh-plugin-grok2api-media-tool

lsjspl/dsh-plugin-grok2api-media-tool

Dà a dsh la capacità di generare immagini e video tramite l’API grok2api.

3mese scorsoVisione, voce e multimodale
L

dsh-image-gen

leemancheung/dsh-image-gen

`image_gen` di GPT Image 2 con OAuth dell’abbonamento Codex come predefinito oppure modalità esplicita con chiave API: scheda in sviluppo, fino a tre partial API live, replay durevole degli allegati / lightbox / download, output del modello solo testo e richieste limitate e sicure per le credenziali.

35 giorni faVisione, voce e multimodaleMIT