Visione, voce e multimodale
I plugin Visione, voce e multimodale danno occhi, orecchie e voce ai modelli DeepSeek solo testo di DeepSeek-Harness (dsh). Trova strumenti di visione e route di provider che eseguono OCR e descrivono gli screenshot incollati tramite Zhipu GLM, Gemini, Doubao o Ollama in locale, input vocale dal microfono tramite la Web Speech API del browser o API compatibili con Whisper, lettura ad alta voce con Edge TTS o voci personalizzate, modalità vocali full-duplex, e generatori di immagini, video e musica.
312 plugin trovati
dsh-vision-mix
haiziyao/dsh-vision-mix
Combina API di testo, visione e generazione di immagini in un unico modello Mix con routing automatico: le richieste solo testo vanno al modello chat, le immagini utente e gli screenshot dell'agente vanno al modello di visione, i follow-up continuano a usare la stessa immagine di sessione, e gli agenti possono generare o modificare immagini con cronologia delle chiamate a livello di sessione.
dsh-ernie-image
omdsh-dev/dsh-ernie-image
openflowframes
zerohackz/openflowframes
dsh-paddle-ocr
omdsh-dev/dsh-paddle-ocr
dsh-plugin-aigc-canvas
huanlinoto/dsh-plugin-aigc-canvas
Ponte HTTP AIGC indipendente dal provider + canvas infinito + post-elaborazione ffmpeg, 13 strumenti tra cui collegamento sul canvas, reroll e modifica dei media.
dsh-voice
jesse-njx/dsh-voice
Note vocali in ingresso, risposte parlate in uscita: detta audio che diventa messaggi utente (trascrizione), fai leggere ad alta voce le risposte dall'agente (sintesi vocale), local-first sotto ~/.dsh/voice
dsh-llm-vision-bridge
einskyle/dsh-llm-vision-bridge
Bridge di visione nativo del provider LLM: le immagini incollate in chat vengono descritte da un modello di visione (Qwen3-VL via pi-ai/llama.cpp) e la descrizione testuale viene passata a DeepSeek solo testo per la risposta — ammissione delle immagini, instradamento e compattazione avvengono tutti tramite meccanismi nativi dell'harness, con una cache LRU delle descrizioni e retry sui 503
dsh-mic-input
qt-chen/dsh-mic-input
Input vocale da microfono per il composer: trascrizione live tramite Web Speech API del browser, deduplicazione/auto-continuazione, punteggiatura intelligente, impostazioni di lingua e invio automatico
dsh-open-eyes
hyper-dsh-plugins/dsh-open-eyes
Ponte di visione per le rotte DeepSeek solo testuali che analizza immagini allegate e locali tramite endpoint configurabili OpenAI Responses, Chat Completions o Anthropic Messages, lasciando native le rotte con capacità di immagini.
dsh-gpt-image
cai-mh/dsh-gpt-image
Genera immagini tramite una sessione ChatGPT web con accesso effettuato e le scarica in una directory locale.
dsh-ui-mockup
mackwan84/dsh-ui-mockup
Consumer dello strumento ui_mockup: nella fase di discussione genera wireframe e bozzetti ad alta fedeltà di UI, salva il progetto su disco, chiede conferma e poi blocca la specifica di design; include card client, routing delle immagini e i18n.
dsh-voice-call
biliye/dsh-voice-call
Assistente di chiamata vocale per la GUI web di DSH: una pallina di chiamata fluttuante e trascinabile, VAD lato browser che invia ogni frase dopo una pausa, riconoscimento vocale FunASR HTTP o in streaming, risposte TTS di MiniMax o compatibili OpenAI, una modalità opzionale con wake word e auto-sospensione, e invio di attività a sessioni subagente separate con progresso, stop e resoconti vocali di completamento.
dsh-tool-lipsync
yu-wenchao/dsh-tool-lipsync
Plugin DSH gratuito per generare video lip-sync con oltre 3000 voci e oltre 500 lingue.
dsh-vision-plugin
bug-huntter/dsh-vision-plugin
Riconoscimento immagini configurabile per modelli DSH solo testo: i messaggi immagine vengono prima trascritti da un modello vision compatibile con OpenAI (URL di base, ID modello e chiave API impostati in una sezione Impostazioni) e poi passati al modello principale come testo, mentre viene dichiarato il supporto all'input immagine. Lo schema di autenticazione della chiave API è selezionabile (intestazioni di richiesta in stile OpenAI, Anthropic, Gemini o Azure) e la mancanza di una chiave viene segnalata prima dell'invio di qualsiasi richiesta.
dseyesopen
balue8246-maker/dseyesopen
Ponte vision per DeepSeek solo testo: inviate immagini (da sole o miste a testo) e un modello vision piccolo e veloce le descrive dietro le quinte; la chat conserva l'immagine, DeepSeek vede solo testo. Plugin puro: la disinstallazione ripristina tutto.
dsh-visibridge
lhbsaa/dsh-visibridge
Evidenza visiva strutturata (OCR/layout/semantica) più uno strumento di acquisizione da camera USB per un ciclo di debug «scatta-guarda-regola»; backend: Ollama, DeepSeek, Xiaomi.
dsh-short-video-studio
fengyungithub/dsh-short-video-studio
Banco di lavoro per l'attività di creazione video con AI in stile MiniMax-Design, basato su deepseek harness
dsh-watch-video
zeshuochen/dsh-watch-video
Trascrizione video con priorità ai sottotitoli, esportazione SRT, controlli di processo annullabili e fallback a faster-whisper large-v3 quando i sottotitoli non sono disponibili.
dsh-voice-agent (voice-app)
wayneyu430/dsh-voice-agent
Un Agent vocale conversazionale come frontend per dsh: parla naturalmente tramite ByteDance Duplex, delega le richieste a task in background e senti i loro risultati asincroni riportati a voce.
dsh-voice-chat
maoyuching/dsh-voice-chat
Chat vocale in stile Doubao per DSH: tenere premuto il microfono del compositore converte la voce in testo e invia automaticamente, e le risposte dell'IA vengono lette a voce alta. Condensazione opzionale tramite LLM (le risposte lunghe vengono riassunte in brevi frasi parlate, seguendo il modello della conversazione corrente), pulizia del testo adatta al TTS, voci Edge TTS selezionabili, arresto automatico al silenzio regolabile e impostazioni incorporate nella finestra di dialogo delle impostazioni di DSH.
phone-lens (phone-lens)
yxqfg/phone-lens
Trasforma la fotocamera di un telefono in un mirino live e ingresso foto per la tua sessione dsh, tramite LAN o USB.
dsh-capture
max-null/dsh-capture
Cattura schermo a doppio motore per DSH: dentro la shell desktop SSiD, un tasto rapido globale o il vassoio apre un overlay di selezione a riquadro a schermo intero (tutti i monitor, frame perfetti al pixel per schermo) con annotazione a riquadro rosso sul posto e una barra degli strumenti in stile WeChat; nel semplice DSH (browser), il pulsante fotocamera del compositore cattura lo schermo via getDisplayMedia e riutilizza nella pagina lo stesso overlay di selezione a riquadro + annotazione in una sola fase. L'immagine ritagliata arriva nel compositore della conversazione corrente tramite il percorso ufficiale degli allegati.
phone-lens (lens-mate)
yxqfg/phone-lens
Trasforma la fotocamera di un telefono in mirino dal vivo e ingresso foto per la tua sessione dsh, via LAN o USB.
dsh-labnana
exoticknight/dsh-labnana
Generazione di immagini Labnana per DeepSeek Harness: testo in immagine / immagine in immagine / editing preciso con stima dei crediti, saldo dell'abbonamento e interfaccia di impostazioni web.