Visione, voce e multimodale
I plugin Visione, voce e multimodale danno occhi, orecchie e voce ai modelli DeepSeek solo testo di DeepSeek-Harness (dsh). Trova strumenti di visione e route di provider che eseguono OCR e descrivono gli screenshot incollati tramite Zhipu GLM, Gemini, Doubao o Ollama in locale, input vocale dal microfono tramite la Web Speech API del browser o API compatibili con Whisper, lettura ad alta voce con Edge TTS o voci personalizzate, modalità vocali full-duplex, e generatori di immagini, video e musica.
312 plugin trovati
dsh-web-ui (dsh-tool-describe-image)
zhu1090093659/dsh-web-ui
Uno strumento vision `describe_image` per modelli solo testo: le immagini (percorso locale, URL, allegato) vengono inviate a un endpoint vision configurabile compatibile con OpenAI e solo il testo restituito entra nella sessione.
ipollowork
devin-axis/ipollowork
iPolloWork HyperFrames Video Studio e 27 modelli video modificabili come vista di conversazione nativa di DeepSeek Harness.
modlens
liustack/modlens
Ponte visivo per modelli solo testuali: incolla un'immagine e ottieni prove strutturate in JSON (OCR, layout, semantica).
dsh-vision-router
ysr666/dsh-vision-router
Vision gratuita per agenti solo testuali: catena di vision integrata senza chiave, più strumenti pixel (Q&A, grounding, ritaglio, confronto pixel, colori, OCR, tracciamento SVG, ritaglio silhouette, screenshot); incolla un'immagine per usarla.
dsh-vision-toolkit
anionex/dsh-vision-toolkit
Visione per modelli solo testo: incolla un'immagine e il modello passa alla variante Vision Toolkit per domande e risposte su immagini, confronto tra più immagini, OCR di screenshot lunghi, riproduzione dell'UI da screenshot, grounding degli elementi e differenze pixel. Nessuna chiave API per impostazione predefinita — le immagini vengono elaborate dal servizio gratuito ospitato dall'autore, 100 per macchina al giorno; configurabile sul proprio provider.
tongflow
tong-io/tongflow
Plugin studio TongFlow per DeepSeek Harness (dsh): modello di progetto in stile troupe cinematografica, flussi di lavoro TongFlow creati dall'agente, generazione multimediale deterministica, tela incorporata.
dsh-image-gen
shanliuling/dsh-image-gen
Generazione di immagini conversazionale nativa per DeepSeek Harness: chiedi all'agente di creare un'immagine e si occupa della generazione e mantiene il risultato direttamente nella conversazione.
watch-skill
oxbshw/watch-skill
Le capacità di DeepWatch, installabili in un profilo DeepSeek Harness esistente
dsh-imagegen
dickpy/dsh-imagegen
Generazione di immagini basata su IA per la GUI web di DSH: da testo a immagine e da immagine a immagine tramite un endpoint configurabile compatibile con OpenAI (gpt-image-2 / gpt-image-1 / dall-e-3), con una scheda di impostazioni api_url/api_key e uno studio di generazione a riquadri divisi nella barra laterale.
dsh-comfyui
fandc520/dsh-comfyui
Guida un server ComfyUI locale o remoto da DeepSeek Harness: gli strumenti comfyui_run / comfyui_object_info / comfyui_workflow generano e modificano immagini e video, con una libreria di workflow (estrazione del grafo: per componente / flusso principale / tutto), un'area di caricamento con corrispondenza automatica della risoluzione, una coda in tempo reale, modelli SDXL e Wan 2.1, una skill complementare e un proxy multimediale della stessa origine.
dsh-omi-voice
polinnizhong/dsh-omi-voice
Lettura ad alta voce in chat per DeepSeek Harness: tocca per leggere, mettere in pausa e riprendere le risposte dell'IA con voci Doubao TTS naturali (BYOK); legge solo la risposta finale, con codice, tabelle e diagrammi filtrati; motore locale, il plugin non conserva alcuna chiave API.
deepseek-harness-video-director
chiphoton/deepseek-harness-video-director
🎬Regista basato sull'IA: plugin di generazione video MiniMax-H3 diretto da DeepSeek-Harness. 🤖Più che prompt. 🪄Interfaccia a canvas.
dsh-design-qa
sunxin-ai/dsh-design-qa
QA di fedeltà al design per modelli solo testuali: uno strumento `deepseek_vision` prende in prestito un occhio da qualsiasi percorso vision compatibile con OpenAI, così il modello può giudicare se un'implementazione corrisponde al mock — fornito con il benchmark alla base di quel giudizio (quattro fixture, 23 difetti iniettati, trascrizioni grezze) e la disciplina di interrogazione da cui dipende.
picturereader
jing-hy/picturereader
«Lettura» delle immagini per modelli solo testo: riduzione della scala + riduzione della profondità colore + impronte di struttura/colore convertite in griglie di testo restituite alla conversazione, permettendo al modello di ingrandire, campionare ed eseguire OCR in autonomia come un modello multimodale; completamente locale, senza alcuna dipendenza da modelli esterni, include una skill di metodologia di lettura delle immagini e PaddleOCR opzionale.
dsh-voice-scribe
pensivefei/dsh-voice-scribe
Input vocale per l'interfaccia web: premi Alt (o Alt+Space) per avviare/arrestare la dettatura, Web Speech del browser (zero-config) o ASR cloud compatibile con OpenAI, rifinitura opzionale tramite LLM configurato in DSH, interfaccia impostazioni.
dsh-vision
oil-oil/dsh-vision
Comprensione delle immagini quasi nativa per DeepSeek Harness.
dsh-web-ui (dsh-tool-describe-image)
damonkoy/dsh-web-ui
Fornisce comprensione delle immagini a un modello solo testo tramite un modello vision-language, esposto come strumento `describe_image`.
dsh-ears
wiziscool/dsh-ears
Plugin di input vocale per DeepSeek Harness (dsh): un pulsante microfono nel compositore converte il parlato in una bozza trascritta, con scelta di backend di riconoscimento vocale, rifinitura opzionale tramite i percorsi LLM propri di dsh e una pagina delle impostazioni nativa.
dsh-plugin-tts
1624318455/dsh-plugin-tts
Legge ad alta voce le risposte dell'assistente tramite Edge TTS gratuito o i tuoi modelli vocali RVC: pulsanti di lettura ad alta voce + lettura automatica, riproduzione progressiva a blocchi adattivi (letture lunghe senza interruzioni), installazione con un clic di pacchetti vocali da un registro e un runtime RVC portatile.
dsh-media-skills
mjorgin/dsh-media-skills
Ponte visivo gratuito e generazione di immagini per modelli solo testo: lettura di immagini incollate, failover tra i motori GLM-4V-Flash e Gemini, evidenze strutturate in stile ModLens e un percorso di modello visivo gratuito preconfigurato.
dsh-aigc-canvas
dsh-external/dsh-aigc-canvas
Plugin canvas AIGC (cordis).
dsh-talk
perrylink/dsh-talk
I/O vocale per DeepSeek Harness — speech-to-text e text-to-speech tramite microfono e uscita audio.
dsh-visual-plugin
jyh20030112/dsh-visual-plugin
Dona la vista ai modelli solo testuali: inoltra le immagini dell'utente a un modello di visione compatibile con OpenAI e mostra le descrizioni in un pannello destro dell'interfaccia web.
dsh-voice-mode (dsh-voice-mode)
qishuilalala/dsh-voice-mode
Modalità vocale full-duplex per la Web UI di DeepSeek Harness: toggle (invio automatico dopo pausa di 2s) o dettatura hold-to-talk in una bozza editabile con ASR streaming zipformer2, wake word opzionale; lettura ad alta voce Edge TTS frase per frase con sottotitoli live, e il parlato interrompe la riproduzione e il turno in corso (vero barge-in). ASR on-device, nessuna chiave API.