Passer au contenu principal

Vision, voix et multimodal

Les plugins Vision, voix et multimodal donnent des yeux, des oreilles et une voix aux modèles DeepSeek texte seul de DeepSeek-Harness (dsh). Trouvez des outils de vision et des routes de fournisseur qui font l'OCR et décrivent les captures collées via Zhipu GLM, Gemini, Doubao ou Ollama en local, une saisie vocale au micro via la Web Speech API du navigateur ou des API compatibles Whisper, une lecture à voix haute avec Edge TTS ou des voix personnalisées, des modes vocaux full-duplex, et des générateurs d'images, de vidéos et de musique.

312 plugins trouvés

B

dsh-ocr-local

balcoz/dsh-ocr-local

OCR local pour DeepSeek Harness : collez ou joignez une image, obtenez son texte via PP-OCRv5 + ONNX Runtime, entièrement hors ligne. TUI (cc-tui) et Web.

5il y a 2 moisVision, voix et multimodal
S

dsh-vision-bridge

sfyyy/dsh-vision-bridge

Vision à la demande pour les sessions DSH texte uniquement : les images deviennent des marqueurs, et un outil vision_describe envoie uniquement l'image et la question à un modèle de vision compatible OpenAI

5il y a 2 moisVision, voix et multimodalMIT
0

dsh-voice-input

0nt-one/dsh-voice-input

Bouton micro dans la rangée d'outils du composer : speech-to-text Web Speech API (Chrome/Edge), commutation de langue, et envoi automatique optionnel, zéro dépendance.

5il y a 2 moisVision, voix et multimodalMIT
T

dsh-plugin-appshot

tauruswood/dsh-plugin-appshot

Codex Appshots pour DSH : capture la fenêtre active au premier plan via raccourci global et la monte de manière transparente dans le composer pour les requêtes d'agent.

5il y a 5 joursVision, voix et multimodalMIT
P

dsh-screenshot

paicat1/dsh-screenshot

Capture d'écran sans dépendance pour DSH : Lightweight — zéro dépendance, zéro binaire ; Stage & shoot — capture en un clic plein écran, disposition des fenêtres et capture hover-snap des fenêtres occluses ; libre-service de l'agent — livraison par chemin uniquement ; les chemins sont universels, associez-le à modlens (optionnel) pour des preuves structurées en un appel.

5il y a 24 joursVision, voix et multimodalMIT
A

dsh-guide-dog

atropinoltt/dsh-guide-dog

Plugin multimodal propulsé par MiniMax : mode d'appel vocal en temps réel (conversation en streaming, interface dock flottant), mode vocal et saisie vocale par micro, ainsi que des outils de génération d'images/vidéos/musique/parole et d'inspection visuelle.

5il y a 2 moisVision, voix et multimodalMIT
E

canvas-workbench

elangan1997-cmyk/canvas-workbench

Atelier de génération d'images local, zéro abonnement : ouvrez votre propre API de génération (toute interface compatible OpenAI, zéro abonnement), mise en page sur canevas + retouche/effacement/suppression d'arrière-plan/OCR/vectorisation, livrables PSD/AI éditables, pont bidirectionnel au niveau des calques Photoshop/Illustrator.

4il y a 3 joursVision, voix et multimodalMIT
Y

dsh-tts-bridge

yuuyuko-uu/dsh-tts-bridge

Lit les conversations DSH à voix haute en utilisant la lecture vocale intégrée de la page web DeepSeek, pilotée par une petite extension de navigateur.

4il y a 3 joursVision, voix et multimodal
C

dsh-cycle-image-gen

chengzzzi44/dsh-cycle-image-gen

Outil de génération d'images pour DeepSeek Harness via tout point de terminaison d'images compatible OpenAI, avec une galerie intégrée dans l'interface web.

4il y a 22 joursVision, voix et multimodalMIT
V

tripo3d-plugin-dsh

vast-ai-research/tripo3d-plugin-dsh

Compétences Tripo 3D pour DeepSeek Harness — générez des assets 3D prêts pour moteur à partir d'un prompt texte ou d'une image de référence via tripo-cli, avec texturing, rigging, retopologie et conversion de format en une seule passe.

4il y a 23 joursVision, voix et multimodal
L

deepseek-vl-support

limccn/deepseek-vl-support

Donne la vision aux modèles DeepSeek (texte uniquement) dans les clients Claude Code, Codex et Agent Plugins : décrit les images via tout endpoint de vision compatible OpenAI.

4le mois dernierVision, voix et multimodalMIT
L

screenshot-feedback-hook-mcp (dsh-plugin)

lkh081231/screenshot-feedback-hook-mcp

Ajoute un outil de capture d'écran plus deux points de capture automatique optionnels, plaçant l'écran dans la conversation sous forme de bloc image ; nécessite un modèle capable de traiter les images.

4le mois dernierVision, voix et multimodalMIT
A

dsh-pdf-reader

angeloszou/dsh-pdf-reader

Un plugin de lecture PDF sensible au contenu pour modèles de vision : profile chaque page pour les figures (vectorielles et matricielles), les tableaux, le risque de formules et la mise en page double colonne, puis applique une extraction hybride sensible au contenu, rendant les pages avec figures/tableaux/formules sous forme de recadrages de région haute DPI. Fournit un aperçu basse résolution pour comprendre la mise en page et restitue une région spécifiée en haute résolution. Conditionné comme outils multiples pour agents.

4le mois dernierVision, voix et multimodalMIT
N

dsh-hos-scrcpy

ns-zzj/dsh-hos-scrcpy

Contrôlez un téléphone HarmonyOS depuis l’interface Web de DSH avec l’IA : miroir d’écran H.264 en direct, touché à la souris et touches système, flux hilog, et outils agentiques qui permettent au modèle de lire l’écran, localiser les contrôles d’interface, puis appuyer, maintenir, presser des touches ou saisir du texte.

4avant-hierVision, voix et multimodalMIT
X

dsh-vision-hub (tool-vision)

xing666173/dsh-vision-hub

Boîte à outils vision enrichie : 14 outils vision au niveau pixel (describe, ground, detect, crop, pixel-diff, OCR, long-screenshot OCR, vectorize, colors, cutout, screenshot, present, materialize, html-screenshot) pilotés par un endpoint compatible OpenAI, avec marqueurs [图片: path] propres, classification de sécurité du contenu et auto-retry sur rate-limit.

4le mois dernierVision, voix et multimodal
D

dsh-image-pathify

dami9527/dsh-image-pathify

Permet aux modèles textuels uniquement de gérer les images collées dans le chat, avec une expérience de vision native, la visualisation d'images par lot et un outil analyze_image intégré compatible OpenAI ; les modèles capables de vision ne sont pas affectés.

4il y a 8 joursVision, voix et multimodalMIT
S

dsh-voice

stardustlc666/dsh-voice

Outils vocaux : synthèse vocale neuronale gratuite avec edge-tts, transcription ASR compatible OpenAI, liste des voix, aperçu des voix par lot et autodiagnostic de l'état.

4il y a 8 heuresVision, voix et multimodalMIT
H

dsh-voice

haoku123/dsh-voice

Mode vocal full-duplex pour l'interface web : dictée par pression pour basculer ou maintien (touche d'envoi ou `Ctrl`) avec sous-titres en direct, ASR SenseVoice côté hôte via sherpa-onnx, réponses parlées phrase par phrase, et parler interrompt la lecture et le tour en cours (vraie interruption). Aucune clé API.

4le mois dernierVision, voix et multimodalMIT
F

dsh-chatvoice

fuzzysoul/dsh-chatvoice

Boucle vocale gratuite pour l'interface web : entrée micro via SpeechRecognition du navigateur avec résultats intermédiaires en direct, boutons haut-parleur de lecture à voix haute et lecture automatique des réponses de l'assistant, sans configuration et sans clé d'API.

4il y a 2 moisVision, voix et multimodalMIT
X

dsh-draw-router

xiaozhe7772222/dsh-draw-router

Routeur unifié de génération d'images pour DeepSeek Harness (DSH) : détecte automatiquement les modèles d'images depuis n'importe quel point de terminaison compatible OpenAI, fournit les outils draw_image et draw_list_sources, et prend en charge SenseNova, StepFun, Agnes, Qwen, Flux, SD, Imagen et plus.

4le mois dernierVision, voix et multimodalMIT
N

free-vision-skill

niyongsheng/free-vision-skill

Compréhension d'images et OCR entièrement locaux via le Vision Framework de macOS : `ocr_image` (texte, mise en page de tableau + coordonnées) et `view_image` (scène, visages, QR) — collez plusieurs images dans la zone de saisie web ou passez un chemin/URL/base64 ; les images ne quittent jamais votre Mac.

4le mois dernierVision, voix et multimodalMIT
G

deepseek-vision (dsh-plugin-deepseek-vision)

gou-gee/deepseek-vision

Bundle Vision MCP et DSH pour DeepSeek textuel : outils analyze_image, analyze_clipboard, compare_images et vision_status, page de paramètres visuelle, GLM-4.6V-Flash gratuit par défaut, mise en cache de résultats et tolérance aux limites de débit ; les clés restent hors des logs.

4il y a 26 joursVision, voix et multimodalMIT
F

dsh-plugin-deepeye

favio8/dsh-plugin-deepeye

Plugin de vision DeepEye pour DeepSeek Harness (DSH) : description d'image, OCR, VQA, mise en page d'UI et analyse du presse-papiers.

4il y a 2 moisVision, voix et multimodal
H

dsh-her-eyes

huashenglian/dsh-her-eyes

Un plugin dsh qui permet à l'IA d'invoquer automatiquement des VLM (modèles multimodaux) pour l'analyse visuelle.

4il y a 2 moisVision, voix et multimodalMIT