Visione, voce e multimodale
I plugin Visione, voce e multimodale danno occhi, orecchie e voce ai modelli DeepSeek solo testo di DeepSeek-Harness (dsh). Trova strumenti di visione e route di provider che eseguono OCR e descrivono gli screenshot incollati tramite Zhipu GLM, Gemini, Doubao o Ollama in locale, input vocale dal microfono tramite la Web Speech API del browser o API compatibili con Whisper, lettura ad alta voce con Edge TTS o voci personalizzate, modalità vocali full-duplex, e generatori di immagini, video e musica.
312 plugin trovati
dsh-ocr-local
balcoz/dsh-ocr-local
OCR locale per DeepSeek Harness: incolla o allega un'immagine, ottieni il suo testo tramite PP-OCRv5 + ONNX Runtime, completamente offline. TUI (cc-tui) e Web.
dsh-vision-bridge
sfyyy/dsh-vision-bridge
Visione su richiesta per sessioni DSH solo testo: le immagini diventano marcatori e uno strumento vision_describe invia solo l'immagine e la domanda a un modello di visione compatibile con OpenAI
dsh-voice-input
0nt-one/dsh-voice-input
Pulsante microfono nella riga degli strumenti del composer: speech-to-text con Web Speech API (Chrome/Edge), cambio lingua e auto-invio opzionale, zero dipendenze.
dsh-plugin-appshot
tauruswood/dsh-plugin-appshot
Codex Appshots per DSH: cattura la finestra attiva in primo piano tramite scorciatoia globale e montala senza interruzioni nel composer per le query dell'agente.
dsh-screenshot
paicat1/dsh-screenshot
Cattura dello schermo senza dipendenze per DSH: Lightweight — zero dipendenze, zero binari; Stage & shoot — cattura a un clic di schermo intero, layout finestre e finestre occluse con hover-snap; self-service dell'agente — consegna solo tramite percorso; i percorsi sono universali, abbinalo a modlens (opzionale) per prove strutturate in una sola chiamata.
dsh-guide-dog
atropinoltt/dsh-guide-dog
Plugin multimodale alimentato da MiniMax: modalità chiamata vocale in tempo reale (conversazione in streaming, interfaccia dock flottante), modalità vocale e input vocale dal microfono, oltre a strumenti di generazione di immagini/video/musica/voce e di ispezione visiva.
canvas-workbench
elangan1997-cmyk/canvas-workbench
Workbench locale di generazione immagini, zero canoni di abbonamento: usa la tua API per generare immagini (qualsiasi interfaccia compatibile con OpenAI, zero abbonamenti), layout su telaio e ritocco/cancellatura/rimozione sfondo/OCR/vettorializzazione, consegna PSD/AI modificabili, bridge bidirezionale a livello di oggetti Photoshop/Illustrator.
dsh-tts-bridge
yuuyuko-uu/dsh-tts-bridge
Legge ad alta voce le conversazioni DSH usando la lettura ad alta voce integrata della pagina web DeepSeek, gestita da una piccola estensione del browser.
dsh-cycle-image-gen
chengzzzi44/dsh-cycle-image-gen
Strumento di generazione di immagini per DeepSeek Harness su qualsiasi endpoint immagini compatibile con OpenAI, con una galleria integrata nell'interfaccia web.
tripo3d-plugin-dsh
vast-ai-research/tripo3d-plugin-dsh
Skill Tripo 3D per DeepSeek Harness: genera asset 3D pronti per il motore da un prompt testuale o un'immagine di riferimento tramite tripo-cli, con texturing, rigging, retopologia e conversione di formato in un'unica passata.
deepseek-vl-support
limccn/deepseek-vl-support
Conferisce visione ai modelli DeepSeek (solo testo) nei client Claude Code, Codex e Agent Plugins: descrive le immagini tramite qualsiasi endpoint visivo compatibile con OpenAI.
screenshot-feedback-hook-mcp (dsh-plugin)
lkh081231/screenshot-feedback-hook-mcp
Aggiunge uno strumento per screenshot più due punti di cattura automatica opzionali, inserendo lo schermo nella conversazione come blocco immagine; richiede un modello con capacità immagine.
dsh-pdf-reader
angeloszou/dsh-pdf-reader
Un plugin di lettura PDF consapevole del contenuto per modelli di visione: profila ogni pagina per figure (vettoriali e raster), tabelle, rischio formule e layout a doppia colonna, poi applica estrazione ibrida consapevole del contenuto, rendendo le pagine con figure/tabelle/formule come ritagli di regione ad alta DPI. Fornisce un'anteprima a bassa risoluzione per comprendere il layout della pagina e rende una regione specificata ad alta risoluzione. Impacchettato come più strumenti per agenti.
dsh-hos-scrcpy
ns-zzj/dsh-hos-scrcpy
Controlla un telefono HarmonyOS dalla web UI di DSH con AI: mirroring live della schermata H.264, tocco del mouse e tasti di sistema, streaming di hilog e strumenti agentici che consentono al modello di leggere lo schermo, individuare i controlli UI, quindi toccare, premere a lungo, premere tasti o digitare.
dsh-vision-hub (tool-vision)
xing666173/dsh-vision-hub
Toolbox visione migliorato: 14 strumenti visione a livello di pixel (describe, ground, detect, crop, pixel-diff, OCR, long-screenshot OCR, vectorize, colors, cutout, screenshot, present, materialize, html-screenshot) guidati da un endpoint OpenAI-compatible, con marcatori bridge puliti [图片: path], classificazione content-safety e auto-retry del rate-limit.
dsh-image-pathify
dami9527/dsh-image-pathify
Consente ai modelli solo testo di gestire le immagini incollate nella chat, con un'esperienza di visione nativa, visualizzazione delle immagini in batch e uno strumento analyze_image integrato compatibile con OpenAI; i modelli con capacità di visione non sono interessati.
dsh-voice
stardustlc666/dsh-voice
Strumenti vocali: sintesi vocale neurale gratuita con edge-tts, trascrizione ASR compatibile con OpenAI, elenco delle voci, anteprima batch delle voci e autodiagnosi dello stato.
dsh-voice
haoku123/dsh-voice
Modalità vocale full-duplex per l'interfaccia web: dettatura con tocco per attivare/disattivare o pressione prolungata (tasto di invio o `Ctrl`) con sottotitoli in diretta, ASR SenseVoice lato host tramite sherpa-onnx, risposte parlate frase per frase, e parlare interrompe la riproduzione e il turno in corso (vera interruzione). Nessuna chiave API.
dsh-chatvoice
fuzzysoul/dsh-chatvoice
Circuito vocale gratuito per la Web UI: input microfonico con SpeechRecognition del browser con risultati provvisori in tempo reale, più pulsanti altoparlante per la lettura ad alta voce e lettura automatica delle risposte dell'assistente, zero configurazione e nessuna chiave API.
dsh-draw-router
xiaozhe7772222/dsh-draw-router
Router unificato per la generazione di immagini per DeepSeek Harness (DSH): scopre automaticamente i modelli immagine da qualsiasi endpoint compatibile OpenAI, fornisce gli strumenti draw_image e draw_list_sources, supporta SenseNova, StepFun, Agnes, Qwen, Flux, SD, Imagen e altri.
free-vision-skill
niyongsheng/free-vision-skill
Comprensione delle immagini e OCR completamente locali tramite il Vision Framework di macOS: `ocr_image` (testo, layout tabella + coordinate) e `view_image` (scena, volti, QR) — incolla più immagini nella casella di input web o passa percorso/URL/base64; le immagini non lasciano mai il tuo Mac.
deepseek-vision (dsh-plugin-deepseek-vision)
gou-gee/deepseek-vision
Bundle Vision MCP e DSH per DeepSeek solo testo: strumenti analyze_image, analyze_clipboard, compare_images e vision_status, una pagina impostazioni visuale, GLM-4.6V-Flash gratuito di default, caching dei risultati e tolleranza al rate-limit; le chiavi restano fuori dai log.
dsh-plugin-deepeye
favio8/dsh-plugin-deepeye
Plugin di vision DeepEye per DeepSeek Harness (DSH): descrizione delle immagini, OCR, VQA, layout UI e analisi degli appunti.
dsh-her-eyes
huashenglian/dsh-her-eyes
Un plugin per dsh che permette all'AI di richiamare automaticamente VLM (modelli multimodali) per l'analisi visiva.