Vai al contenuto principale

Visione, voce e multimodale

I plugin Visione, voce e multimodale danno occhi, orecchie e voce ai modelli DeepSeek solo testo di DeepSeek-Harness (dsh). Trova strumenti di visione e route di provider che eseguono OCR e descrivono gli screenshot incollati tramite Zhipu GLM, Gemini, Doubao o Ollama in locale, input vocale dal microfono tramite la Web Speech API del browser o API compatibili con Whisper, lettura ad alta voce con Edge TTS o voci personalizzate, modalità vocali full-duplex, e generatori di immagini, video e musica.

312 plugin trovati

Z

dsh-web-ui (dsh-tool-describe-image)

zhu1090093659/dsh-web-ui

Uno strumento vision `describe_image` per modelli solo testo: le immagini (percorso locale, URL, allegato) vengono inviate a un endpoint vision configurabile compatibile con OpenAI e solo il testo restituito entra nella sessione.

8k6 giorni faVisione, voce e multimodaleApache-2.0
D

ipollowork

devin-axis/ipollowork

iPolloWork HyperFrames Video Studio e 27 modelli video modificabili come vista di conversazione nativa di DeepSeek Harness.

4.2kmese scorsoVisione, voce e multimodale
L

modlens

liustack/modlens

Ponte visivo per modelli solo testuali: incolla un'immagine e ottieni prove strutturate in JSON (OCR, layout, semantica).

4.1k5 giorni faVisione, voce e multimodaleMIT
Y

dsh-vision-router

ysr666/dsh-vision-router

Vision gratuita per agenti solo testuali: catena di vision integrata senza chiave, più strumenti pixel (Q&A, grounding, ritaglio, confronto pixel, colori, OCR, tracciamento SVG, ritaglio silhouette, screenshot); incolla un'immagine per usarla.

1.1kieriVisione, voce e multimodaleMIT
A

dsh-vision-toolkit

anionex/dsh-vision-toolkit

Visione per modelli solo testo: incolla un'immagine e il modello passa alla variante Vision Toolkit per domande e risposte su immagini, confronto tra più immagini, OCR di screenshot lunghi, riproduzione dell'UI da screenshot, grounding degli elementi e differenze pixel. Nessuna chiave API per impostazione predefinita — le immagini vengono elaborate dal servizio gratuito ospitato dall'autore, 100 per macchina al giorno; configurabile sul proprio provider.

887l’altro ieriVisione, voce e multimodaleMIT
T

tongflow

tong-io/tongflow

Plugin studio TongFlow per DeepSeek Harness (dsh): modello di progetto in stile troupe cinematografica, flussi di lavoro TongFlow creati dall'agente, generazione multimediale deterministica, tela incorporata.

870mese scorsoVisione, voce e multimodaleAGPL-3.0
S

dsh-image-gen

shanliuling/dsh-image-gen

Generazione di immagini conversazionale nativa per DeepSeek Harness: chiedi all'agente di creare un'immagine e si occupa della generazione e mantiene il risultato direttamente nella conversazione.

5643 giorni faVisione, voce e multimodaleApache-2.0
O

watch-skill

oxbshw/watch-skill

Le capacità di DeepWatch, installabili in un profilo DeepSeek Harness esistente

37818 giorni faVisione, voce e multimodaleMIT
D

dsh-imagegen

dickpy/dsh-imagegen

Generazione di immagini basata su IA per la GUI web di DSH: da testo a immagine e da immagine a immagine tramite un endpoint configurabile compatibile con OpenAI (gpt-image-2 / gpt-image-1 / dall-e-3), con una scheda di impostazioni api_url/api_key e uno studio di generazione a riquadri divisi nella barra laterale.

99l’altro ieriVisione, voce e multimodaleApache-2.0
F

dsh-comfyui

fandc520/dsh-comfyui

Guida un server ComfyUI locale o remoto da DeepSeek Harness: gli strumenti comfyui_run / comfyui_object_info / comfyui_workflow generano e modificano immagini e video, con una libreria di workflow (estrazione del grafo: per componente / flusso principale / tutto), un'area di caricamento con corrispondenza automatica della risoluzione, una coda in tempo reale, modelli SDXL e Wan 2.1, una skill complementare e un proxy multimediale della stessa origine.

936 giorni faVisione, voce e multimodaleMIT
P

dsh-omi-voice

polinnizhong/dsh-omi-voice

Lettura ad alta voce in chat per DeepSeek Harness: tocca per leggere, mettere in pausa e riprendere le risposte dell'IA con voci Doubao TTS naturali (BYOK); legge solo la risposta finale, con codice, tabelle e diagrammi filtrati; motore locale, il plugin non conserva alcuna chiave API.

74mese scorsoVisione, voce e multimodaleMIT
C

deepseek-harness-video-director

chiphoton/deepseek-harness-video-director

🎬Regista basato sull'IA: plugin di generazione video MiniMax-H3 diretto da DeepSeek-Harness. 🤖Più che prompt. 🪄Interfaccia a canvas.

694 giorni faVisione, voce e multimodaleMIT
S

dsh-design-qa

sunxin-ai/dsh-design-qa

QA di fedeltà al design per modelli solo testuali: uno strumento `deepseek_vision` prende in prestito un occhio da qualsiasi percorso vision compatibile con OpenAI, così il modello può giudicare se un'implementazione corrisponde al mock — fornito con il benchmark alla base di quel giudizio (quattro fixture, 23 difetti iniettati, trascrizioni grezze) e la disciplina di interrogazione da cui dipende.

4426 giorni faVisione, voce e multimodaleMIT
J

picturereader

jing-hy/picturereader

«Lettura» delle immagini per modelli solo testo: riduzione della scala + riduzione della profondità colore + impronte di struttura/colore convertite in griglie di testo restituite alla conversazione, permettendo al modello di ingrandire, campionare ed eseguire OCR in autonomia come un modello multimodale; completamente locale, senza alcuna dipendenza da modelli esterni, include una skill di metodologia di lettura delle immagini e PaddleOCR opzionale.

37l’altro ieriVisione, voce e multimodaleMIT
P

dsh-voice-scribe

pensivefei/dsh-voice-scribe

Input vocale per l'interfaccia web: premi Alt (o Alt+Space) per avviare/arrestare la dettatura, Web Speech del browser (zero-config) o ASR cloud compatibile con OpenAI, rifinitura opzionale tramite LLM configurato in DSH, interfaccia impostazioni.

343 giorni faVisione, voce e multimodaleMIT
O

dsh-vision

oil-oil/dsh-vision

Comprensione delle immagini quasi nativa per DeepSeek Harness.

242 mesi faVisione, voce e multimodaleMIT
D

dsh-web-ui (dsh-tool-describe-image)

damonkoy/dsh-web-ui

Fornisce comprensione delle immagini a un modello solo testo tramite un modello vision-language, esposto come strumento `describe_image`.

222 mesi faVisione, voce e multimodaleApache-2.0
W

dsh-ears

wiziscool/dsh-ears

Plugin di input vocale per DeepSeek Harness (dsh): un pulsante microfono nel compositore converte il parlato in una bozza trascritta, con scelta di backend di riconoscimento vocale, rifinitura opzionale tramite i percorsi LLM propri di dsh e una pagina delle impostazioni nativa.

2122 ore faVisione, voce e multimodaleMIT
1

dsh-plugin-tts

1624318455/dsh-plugin-tts

Legge ad alta voce le risposte dell'assistente tramite Edge TTS gratuito o i tuoi modelli vocali RVC: pulsanti di lettura ad alta voce + lettura automatica, riproduzione progressiva a blocchi adattivi (letture lunghe senza interruzioni), installazione con un clic di pacchetti vocali da un registro e un runtime RVC portatile.

216 giorni faVisione, voce e multimodaleMIT
M

dsh-media-skills

mjorgin/dsh-media-skills

Ponte visivo gratuito e generazione di immagini per modelli solo testo: lettura di immagini incollate, failover tra i motori GLM-4V-Flash e Gemini, evidenze strutturate in stile ModLens e un percorso di modello visivo gratuito preconfigurato.

1912 giorni faVisione, voce e multimodaleMIT
D

dsh-aigc-canvas

dsh-external/dsh-aigc-canvas

Plugin canvas AIGC (cordis).

1721 giorni faVisione, voce e multimodale
P

dsh-talk

perrylink/dsh-talk

I/O vocale per DeepSeek Harness — speech-to-text e text-to-speech tramite microfono e uscita audio.

168 giorni faVisione, voce e multimodaleApache-2.0
J

dsh-visual-plugin

jyh20030112/dsh-visual-plugin

Dona la vista ai modelli solo testuali: inoltra le immagini dell'utente a un modello di visione compatibile con OpenAI e mostra le descrizioni in un pannello destro dell'interfaccia web.

163 giorni faVisione, voce e multimodaleMIT
Q

dsh-voice-mode (dsh-voice-mode)

qishuilalala/dsh-voice-mode

Modalità vocale full-duplex per la Web UI di DeepSeek Harness: toggle (invio automatico dopo pausa di 2s) o dettatura hold-to-talk in una bozza editabile con ASR streaming zipformer2, wake word opzionale; lettura ad alta voce Edge TTS frase per frase con sottotitoli live, e il parlato interrompe la riproduzione e il turno in corso (vero barge-in). ASR on-device, nessuna chiave API.

157 ore faVisione, voce e multimodaleMIT