- Accueil
- Catégories
- Vision, voix et multimodal
Vision, voix et multimodal
Les plugins Vision, voix et multimodal donnent des yeux, des oreilles et une voix aux modèles DeepSeek texte seul de DeepSeek-Harness (dsh). Trouvez des outils de vision et des routes de fournisseur qui font l'OCR et décrivent les captures collées via Zhipu GLM, Gemini, Doubao ou Ollama en local, une saisie vocale au micro via la Web Speech API du navigateur ou des API compatibles Whisper, une lecture à voix haute avec Edge TTS ou des voix personnalisées, des modes vocaux full-duplex, et des générateurs d'images, de vidéos et de musique.
312 plugins trouvés
dsh-ocr-local
balcoz/dsh-ocr-local
OCR local pour DeepSeek Harness : collez ou joignez une image, obtenez son texte via PP-OCRv5 + ONNX Runtime, entièrement hors ligne. TUI (cc-tui) et Web.
dsh-vision-bridge
sfyyy/dsh-vision-bridge
Vision à la demande pour les sessions DSH texte uniquement : les images deviennent des marqueurs, et un outil vision_describe envoie uniquement l'image et la question à un modèle de vision compatible OpenAI
dsh-voice-input
0nt-one/dsh-voice-input
Bouton micro dans la rangée d'outils du composer : speech-to-text Web Speech API (Chrome/Edge), commutation de langue, et envoi automatique optionnel, zéro dépendance.
dsh-plugin-appshot
tauruswood/dsh-plugin-appshot
Codex Appshots pour DSH : capture la fenêtre active au premier plan via raccourci global et la monte de manière transparente dans le composer pour les requêtes d'agent.
dsh-screenshot
paicat1/dsh-screenshot
Capture d'écran sans dépendance pour DSH : Lightweight — zéro dépendance, zéro binaire ; Stage & shoot — capture en un clic plein écran, disposition des fenêtres et capture hover-snap des fenêtres occluses ; libre-service de l'agent — livraison par chemin uniquement ; les chemins sont universels, associez-le à modlens (optionnel) pour des preuves structurées en un appel.
dsh-guide-dog
atropinoltt/dsh-guide-dog
Plugin multimodal propulsé par MiniMax : mode d'appel vocal en temps réel (conversation en streaming, interface dock flottant), mode vocal et saisie vocale par micro, ainsi que des outils de génération d'images/vidéos/musique/parole et d'inspection visuelle.
canvas-workbench
elangan1997-cmyk/canvas-workbench
Atelier de génération d'images local, zéro abonnement : ouvrez votre propre API de génération (toute interface compatible OpenAI, zéro abonnement), mise en page sur canevas + retouche/effacement/suppression d'arrière-plan/OCR/vectorisation, livrables PSD/AI éditables, pont bidirectionnel au niveau des calques Photoshop/Illustrator.
dsh-tts-bridge
yuuyuko-uu/dsh-tts-bridge
Lit les conversations DSH à voix haute en utilisant la lecture vocale intégrée de la page web DeepSeek, pilotée par une petite extension de navigateur.
dsh-cycle-image-gen
chengzzzi44/dsh-cycle-image-gen
Outil de génération d'images pour DeepSeek Harness via tout point de terminaison d'images compatible OpenAI, avec une galerie intégrée dans l'interface web.
tripo3d-plugin-dsh
vast-ai-research/tripo3d-plugin-dsh
Compétences Tripo 3D pour DeepSeek Harness — générez des assets 3D prêts pour moteur à partir d'un prompt texte ou d'une image de référence via tripo-cli, avec texturing, rigging, retopologie et conversion de format en une seule passe.
deepseek-vl-support
limccn/deepseek-vl-support
Donne la vision aux modèles DeepSeek (texte uniquement) dans les clients Claude Code, Codex et Agent Plugins : décrit les images via tout endpoint de vision compatible OpenAI.
screenshot-feedback-hook-mcp (dsh-plugin)
lkh081231/screenshot-feedback-hook-mcp
Ajoute un outil de capture d'écran plus deux points de capture automatique optionnels, plaçant l'écran dans la conversation sous forme de bloc image ; nécessite un modèle capable de traiter les images.
dsh-pdf-reader
angeloszou/dsh-pdf-reader
Un plugin de lecture PDF sensible au contenu pour modèles de vision : profile chaque page pour les figures (vectorielles et matricielles), les tableaux, le risque de formules et la mise en page double colonne, puis applique une extraction hybride sensible au contenu, rendant les pages avec figures/tableaux/formules sous forme de recadrages de région haute DPI. Fournit un aperçu basse résolution pour comprendre la mise en page et restitue une région spécifiée en haute résolution. Conditionné comme outils multiples pour agents.
dsh-hos-scrcpy
ns-zzj/dsh-hos-scrcpy
Contrôlez un téléphone HarmonyOS depuis l’interface Web de DSH avec l’IA : miroir d’écran H.264 en direct, touché à la souris et touches système, flux hilog, et outils agentiques qui permettent au modèle de lire l’écran, localiser les contrôles d’interface, puis appuyer, maintenir, presser des touches ou saisir du texte.
dsh-vision-hub (tool-vision)
xing666173/dsh-vision-hub
Boîte à outils vision enrichie : 14 outils vision au niveau pixel (describe, ground, detect, crop, pixel-diff, OCR, long-screenshot OCR, vectorize, colors, cutout, screenshot, present, materialize, html-screenshot) pilotés par un endpoint compatible OpenAI, avec marqueurs [图片: path] propres, classification de sécurité du contenu et auto-retry sur rate-limit.
dsh-image-pathify
dami9527/dsh-image-pathify
Permet aux modèles textuels uniquement de gérer les images collées dans le chat, avec une expérience de vision native, la visualisation d'images par lot et un outil analyze_image intégré compatible OpenAI ; les modèles capables de vision ne sont pas affectés.
dsh-voice
stardustlc666/dsh-voice
Outils vocaux : synthèse vocale neuronale gratuite avec edge-tts, transcription ASR compatible OpenAI, liste des voix, aperçu des voix par lot et autodiagnostic de l'état.
dsh-voice
haoku123/dsh-voice
Mode vocal full-duplex pour l'interface web : dictée par pression pour basculer ou maintien (touche d'envoi ou `Ctrl`) avec sous-titres en direct, ASR SenseVoice côté hôte via sherpa-onnx, réponses parlées phrase par phrase, et parler interrompt la lecture et le tour en cours (vraie interruption). Aucune clé API.
dsh-chatvoice
fuzzysoul/dsh-chatvoice
Boucle vocale gratuite pour l'interface web : entrée micro via SpeechRecognition du navigateur avec résultats intermédiaires en direct, boutons haut-parleur de lecture à voix haute et lecture automatique des réponses de l'assistant, sans configuration et sans clé d'API.
dsh-draw-router
xiaozhe7772222/dsh-draw-router
Routeur unifié de génération d'images pour DeepSeek Harness (DSH) : détecte automatiquement les modèles d'images depuis n'importe quel point de terminaison compatible OpenAI, fournit les outils draw_image et draw_list_sources, et prend en charge SenseNova, StepFun, Agnes, Qwen, Flux, SD, Imagen et plus.
free-vision-skill
niyongsheng/free-vision-skill
Compréhension d'images et OCR entièrement locaux via le Vision Framework de macOS : `ocr_image` (texte, mise en page de tableau + coordonnées) et `view_image` (scène, visages, QR) — collez plusieurs images dans la zone de saisie web ou passez un chemin/URL/base64 ; les images ne quittent jamais votre Mac.
deepseek-vision (dsh-plugin-deepseek-vision)
gou-gee/deepseek-vision
Bundle Vision MCP et DSH pour DeepSeek textuel : outils analyze_image, analyze_clipboard, compare_images et vision_status, page de paramètres visuelle, GLM-4.6V-Flash gratuit par défaut, mise en cache de résultats et tolérance aux limites de débit ; les clés restent hors des logs.
dsh-plugin-deepeye
favio8/dsh-plugin-deepeye
Plugin de vision DeepEye pour DeepSeek Harness (DSH) : description d'image, OCR, VQA, mise en page d'UI et analyse du presse-papiers.
dsh-her-eyes
huashenglian/dsh-her-eyes
Un plugin dsh qui permet à l'IA d'invoquer automatiquement des VLM (modèles multimodaux) pour l'analyse visuelle.