Vai al contenuto principale

Visione, voce e multimodale

I plugin Visione, voce e multimodale danno occhi, orecchie e voce ai modelli DeepSeek solo testo di DeepSeek-Harness (dsh). Trova strumenti di visione e route di provider che eseguono OCR e descrivono gli screenshot incollati tramite Zhipu GLM, Gemini, Doubao o Ollama in locale, input vocale dal microfono tramite la Web Speech API del browser o API compatibili con Whisper, lettura ad alta voce con Edge TTS o voci personalizzate, modalità vocali full-duplex, e generatori di immagini, video e musica.

312 plugin trovati

B

dsh-ocr-local

balcoz/dsh-ocr-local

OCR locale per DeepSeek Harness: incolla o allega un'immagine, ottieni il suo testo tramite PP-OCRv5 + ONNX Runtime, completamente offline. TUI (cc-tui) e Web.

52 mesi faVisione, voce e multimodale
S

dsh-vision-bridge

sfyyy/dsh-vision-bridge

Visione su richiesta per sessioni DSH solo testo: le immagini diventano marcatori e uno strumento vision_describe invia solo l'immagine e la domanda a un modello di visione compatibile con OpenAI

52 mesi faVisione, voce e multimodaleMIT
0

dsh-voice-input

0nt-one/dsh-voice-input

Pulsante microfono nella riga degli strumenti del composer: speech-to-text con Web Speech API (Chrome/Edge), cambio lingua e auto-invio opzionale, zero dipendenze.

52 mesi faVisione, voce e multimodaleMIT
T

dsh-plugin-appshot

tauruswood/dsh-plugin-appshot

Codex Appshots per DSH: cattura la finestra attiva in primo piano tramite scorciatoia globale e montala senza interruzioni nel composer per le query dell'agente.

55 giorni faVisione, voce e multimodaleMIT
P

dsh-screenshot

paicat1/dsh-screenshot

Cattura dello schermo senza dipendenze per DSH: Lightweight — zero dipendenze, zero binari; Stage & shoot — cattura a un clic di schermo intero, layout finestre e finestre occluse con hover-snap; self-service dell'agente — consegna solo tramite percorso; i percorsi sono universali, abbinalo a modlens (opzionale) per prove strutturate in una sola chiamata.

524 giorni faVisione, voce e multimodaleMIT
A

dsh-guide-dog

atropinoltt/dsh-guide-dog

Plugin multimodale alimentato da MiniMax: modalità chiamata vocale in tempo reale (conversazione in streaming, interfaccia dock flottante), modalità vocale e input vocale dal microfono, oltre a strumenti di generazione di immagini/video/musica/voce e di ispezione visiva.

52 mesi faVisione, voce e multimodaleMIT
E

canvas-workbench

elangan1997-cmyk/canvas-workbench

Workbench locale di generazione immagini, zero canoni di abbonamento: usa la tua API per generare immagini (qualsiasi interfaccia compatibile con OpenAI, zero abbonamenti), layout su telaio e ritocco/cancellatura/rimozione sfondo/OCR/vettorializzazione, consegna PSD/AI modificabili, bridge bidirezionale a livello di oggetti Photoshop/Illustrator.

43 giorni faVisione, voce e multimodaleMIT
Y

dsh-tts-bridge

yuuyuko-uu/dsh-tts-bridge

Legge ad alta voce le conversazioni DSH usando la lettura ad alta voce integrata della pagina web DeepSeek, gestita da una piccola estensione del browser.

43 giorni faVisione, voce e multimodale
C

dsh-cycle-image-gen

chengzzzi44/dsh-cycle-image-gen

Strumento di generazione di immagini per DeepSeek Harness su qualsiasi endpoint immagini compatibile con OpenAI, con una galleria integrata nell'interfaccia web.

422 giorni faVisione, voce e multimodaleMIT
V

tripo3d-plugin-dsh

vast-ai-research/tripo3d-plugin-dsh

Skill Tripo 3D per DeepSeek Harness: genera asset 3D pronti per il motore da un prompt testuale o un'immagine di riferimento tramite tripo-cli, con texturing, rigging, retopologia e conversione di formato in un'unica passata.

423 giorni faVisione, voce e multimodale
L

deepseek-vl-support

limccn/deepseek-vl-support

Conferisce visione ai modelli DeepSeek (solo testo) nei client Claude Code, Codex e Agent Plugins: descrive le immagini tramite qualsiasi endpoint visivo compatibile con OpenAI.

4mese scorsoVisione, voce e multimodaleMIT
L

screenshot-feedback-hook-mcp (dsh-plugin)

lkh081231/screenshot-feedback-hook-mcp

Aggiunge uno strumento per screenshot più due punti di cattura automatica opzionali, inserendo lo schermo nella conversazione come blocco immagine; richiede un modello con capacità immagine.

4mese scorsoVisione, voce e multimodaleMIT
A

dsh-pdf-reader

angeloszou/dsh-pdf-reader

Un plugin di lettura PDF consapevole del contenuto per modelli di visione: profila ogni pagina per figure (vettoriali e raster), tabelle, rischio formule e layout a doppia colonna, poi applica estrazione ibrida consapevole del contenuto, rendendo le pagine con figure/tabelle/formule come ritagli di regione ad alta DPI. Fornisce un'anteprima a bassa risoluzione per comprendere il layout della pagina e rende una regione specificata ad alta risoluzione. Impacchettato come più strumenti per agenti.

4mese scorsoVisione, voce e multimodaleMIT
N

dsh-hos-scrcpy

ns-zzj/dsh-hos-scrcpy

Controlla un telefono HarmonyOS dalla web UI di DSH con AI: mirroring live della schermata H.264, tocco del mouse e tasti di sistema, streaming di hilog e strumenti agentici che consentono al modello di leggere lo schermo, individuare i controlli UI, quindi toccare, premere a lungo, premere tasti o digitare.

4l’altro ieriVisione, voce e multimodaleMIT
X

dsh-vision-hub (tool-vision)

xing666173/dsh-vision-hub

Toolbox visione migliorato: 14 strumenti visione a livello di pixel (describe, ground, detect, crop, pixel-diff, OCR, long-screenshot OCR, vectorize, colors, cutout, screenshot, present, materialize, html-screenshot) guidati da un endpoint OpenAI-compatible, con marcatori bridge puliti [图片: path], classificazione content-safety e auto-retry del rate-limit.

4mese scorsoVisione, voce e multimodale
D

dsh-image-pathify

dami9527/dsh-image-pathify

Consente ai modelli solo testo di gestire le immagini incollate nella chat, con un'esperienza di visione nativa, visualizzazione delle immagini in batch e uno strumento analyze_image integrato compatibile con OpenAI; i modelli con capacità di visione non sono interessati.

48 giorni faVisione, voce e multimodaleMIT
S

dsh-voice

stardustlc666/dsh-voice

Strumenti vocali: sintesi vocale neurale gratuita con edge-tts, trascrizione ASR compatibile con OpenAI, elenco delle voci, anteprima batch delle voci e autodiagnosi dello stato.

49 ore faVisione, voce e multimodaleMIT
H

dsh-voice

haoku123/dsh-voice

Modalità vocale full-duplex per l'interfaccia web: dettatura con tocco per attivare/disattivare o pressione prolungata (tasto di invio o `Ctrl`) con sottotitoli in diretta, ASR SenseVoice lato host tramite sherpa-onnx, risposte parlate frase per frase, e parlare interrompe la riproduzione e il turno in corso (vera interruzione). Nessuna chiave API.

4mese scorsoVisione, voce e multimodaleMIT
F

dsh-chatvoice

fuzzysoul/dsh-chatvoice

Circuito vocale gratuito per la Web UI: input microfonico con SpeechRecognition del browser con risultati provvisori in tempo reale, più pulsanti altoparlante per la lettura ad alta voce e lettura automatica delle risposte dell'assistente, zero configurazione e nessuna chiave API.

42 mesi faVisione, voce e multimodaleMIT
X

dsh-draw-router

xiaozhe7772222/dsh-draw-router

Router unificato per la generazione di immagini per DeepSeek Harness (DSH): scopre automaticamente i modelli immagine da qualsiasi endpoint compatibile OpenAI, fornisce gli strumenti draw_image e draw_list_sources, supporta SenseNova, StepFun, Agnes, Qwen, Flux, SD, Imagen e altri.

4mese scorsoVisione, voce e multimodaleMIT
N

free-vision-skill

niyongsheng/free-vision-skill

Comprensione delle immagini e OCR completamente locali tramite il Vision Framework di macOS: `ocr_image` (testo, layout tabella + coordinate) e `view_image` (scena, volti, QR) — incolla più immagini nella casella di input web o passa percorso/URL/base64; le immagini non lasciano mai il tuo Mac.

4mese scorsoVisione, voce e multimodaleMIT
G

deepseek-vision (dsh-plugin-deepseek-vision)

gou-gee/deepseek-vision

Bundle Vision MCP e DSH per DeepSeek solo testo: strumenti analyze_image, analyze_clipboard, compare_images e vision_status, una pagina impostazioni visuale, GLM-4.6V-Flash gratuito di default, caching dei risultati e tolleranza al rate-limit; le chiavi restano fuori dai log.

426 giorni faVisione, voce e multimodaleMIT
F

dsh-plugin-deepeye

favio8/dsh-plugin-deepeye

Plugin di vision DeepEye per DeepSeek Harness (DSH): descrizione delle immagini, OCR, VQA, layout UI e analisi degli appunti.

42 mesi faVisione, voce e multimodale
H

dsh-her-eyes

huashenglian/dsh-her-eyes

Un plugin per dsh che permette all'AI di richiamare automaticamente VLM (modelli multimodali) per l'analisi visiva.

42 mesi faVisione, voce e multimodaleMIT