- Accueil
- Catégories
- Vision, voix et multimodal
Vision, voix et multimodal
Les plugins Vision, voix et multimodal donnent des yeux, des oreilles et une voix aux modèles DeepSeek texte seul de DeepSeek-Harness (dsh). Trouvez des outils de vision et des routes de fournisseur qui font l'OCR et décrivent les captures collées via Zhipu GLM, Gemini, Doubao ou Ollama en local, une saisie vocale au micro via la Web Speech API du navigateur ou des API compatibles Whisper, une lecture à voix haute avec Edge TTS ou des voix personnalisées, des modes vocaux full-duplex, et des générateurs d'images, de vidéos et de musique.
312 plugins trouvés
dsh-web-ui (dsh-tool-describe-image)
zhu1090093659/dsh-web-ui
Un outil de vision `describe_image` pour les modèles texte uniquement : les images (chemin local, URL, pièce jointe) sont envoyées vers un point de terminaison de vision OpenAI-compatible configurable et seul le texte renvoyé entre dans la session.
ipollowork
devin-axis/ipollowork
iPolloWork HyperFrames Video Studio et 27 modèles de vidéo modifiables sous forme de vue de conversation native pour DeepSeek Harness.
modlens
liustack/modlens
Pont de vision pour les modèles texte seul : collez une image, obtenez des preuves JSON structurées (OCR, mise en page, sémantique).
dsh-vision-router
ysr666/dsh-vision-router
Vision gratuite pour les agents texte seul : chaîne de vision intégrée sans clé, plus des outils pixel (questions-réponses, ancrage, recadrage, diff pixel, couleurs, OCR, tracé SVG, détourage, captures d'écran) ; collez une image pour l'utiliser.
dsh-vision-toolkit
anionex/dsh-vision-toolkit
Vision pour les modèles texte uniquement : collez une image et le modèle bascule vers la variante Vision Toolkit pour les questions-réponses sur images, la comparaison multi-images, l'OCR de captures longues, la reproduction d'UI à partir de captures, l'ancrage d'éléments et les différences de pixels. Aucune clé API par défaut — les images sont traitées par le service gratuit hébergé par l'auteur, 100 par machine et par jour ; configurable vers votre propre fournisseur.
tongflow
tong-io/tongflow
Plugin studio TongFlow pour DeepSeek Harness (dsh) : modèle de projet façon équipe de tournage, workflows TongFlow rédigés par l'agent, génération multimédia déterministe, canevas intégré.
dsh-image-gen
shanliuling/dsh-image-gen
Génération d'images conversationnelle native pour DeepSeek Harness : demandez à l'agent de créer une image, et il gère la génération et conserve le résultat directement dans la conversation.
watch-skill
oxbshw/watch-skill
Les capacités de DeepWatch, installables dans un profil DeepSeek Harness existant
dsh-imagegen
dickpy/dsh-imagegen
Génération d'images par IA pour l'interface web de DSH : texte-vers-image et image-vers-image via un point de terminaison compatible OpenAI configurable (gpt-image-2 / gpt-image-1 / dall-e-3), avec une carte de configuration api_url/api_key et un studio de génération à volet divisé dans la barre latérale.
dsh-comfyui
fandc520/dsh-comfyui
Pilotez un serveur ComfyUI local ou distant depuis DeepSeek Harness : les outils comfyui_run / comfyui_object_info / comfyui_workflow génèrent et modifient des images et des vidéos, avec une bibliothèque de workflows (extraction de graphe : par composant / flux principal / tout), une zone de chargement avec correspondance automatique de résolution, une file d'attente en direct, des modèles SDXL et Wan 2.1, une compétence compagne et un proxy média de même origine.
dsh-omi-voice
polinnizhong/dsh-omi-voice
Lecture à voix haute dans le chat pour DeepSeek Harness : touchez pour lire, mettre en pause et reprendre les réponses de l'IA avec des voix Doubao TTS naturelles (BYOK) ; lit uniquement la réponse finale, code, tableaux et diagrammes filtrés ; moteur local, le plugin ne conserve aucune clé d'API.
deepseek-harness-video-director
chiphoton/deepseek-harness-video-director
🎬Réalisateur propulsé par l'IA : plugin de génération vidéo MiniMax-H3 dirigé par DeepSeek-Harness. 🤖Plus qu'un prompt. 🪄Interface en canevas.
dsh-design-qa
sunxin-ai/dsh-design-qa
QA de fidélité de conception pour les modèles texte uniquement : un outil `deepseek_vision` emprunte un œil à n’importe quelle route vision compatible OpenAI, afin que le modèle puisse juger si une implémentation correspond à sa maquette — livré avec le benchmark derrière ce jugement (quatre fixtures, 23 défauts injectés, transcriptions brutes) et la discipline de questionnement dont il dépend.
picturereader
jing-hy/picturereader
« Lecture » d'images pour les modèles texte uniquement : réduction d'échelle + réduction de la profondeur de couleur + empreintes de structure/couleur transformées en grilles de texte renvoyées dans la conversation, permettant au modèle de zoomer, d'échantillonner et de faire de l'OCR de manière autonome comme un modèle multimodal ; entièrement local, sans dépendance à un modèle externe, fournit une compétence de méthodologie de lecture d'image et PaddleOCR en option.
dsh-voice-scribe
pensivefei/dsh-voice-scribe
Saisie vocale pour l'interface web : appuyez sur Alt (ou Alt+Space) pour démarrer/arrêter la dictée, Web Speech du navigateur (zéro config) ou ASR cloud compatible OpenAI, polissage optionnel via le LLM configuré par DSH, interface de paramètres.
dsh-vision
oil-oil/dsh-vision
Compréhension d'image quasi native pour DeepSeek Harness
dsh-web-ui (dsh-tool-describe-image)
damonkoy/dsh-web-ui
Donne à un modèle textuel la compréhension d'image via un modèle vision-langage, exposé comme outil `describe_image`.
dsh-ears
wiziscool/dsh-ears
Plugin de saisie vocale pour DeepSeek Harness (dsh) : un bouton microphone dans le compositeur transforme la parole en brouillon transcrit, avec un choix de backends de reconnaissance vocale, un peaufinage optionnel via les propres routes LLM de dsh et une page de paramètres native.
dsh-plugin-tts
1624318455/dsh-plugin-tts
Lit à voix haute les réponses de l'assistant via Edge TTS gratuit ou vos propres modèles vocaux RVC : boutons de lecture à voix haute + lecture automatique, lecture progressive par blocs adaptatifs (lectures longues sans coupure), installation en un clic de packs vocaux depuis un registre, et un runtime RVC portable.
dsh-media-skills
mjorgin/dsh-media-skills
Pont de vision gratuit et génération d'images pour les modèles texte seul : lecture d'images collées, basculement entre les moteurs GLM-4V-Flash et Gemini, preuves structurées façon ModLens, et une route de modèle de vision gratuite préconfigurée.
dsh-aigc-canvas
dsh-external/dsh-aigc-canvas
Plugin de canevas AIGC (cordis).
dsh-talk
perrylink/dsh-talk
Entrée/sortie vocale pour DeepSeek Harness — reconnaissance vocale et synthèse vocale via le microphone et la sortie audio.
dsh-visual-plugin
jyh20030112/dsh-visual-plugin
Donne la vision aux modèles textuels uniquement : transmet les images de l'utilisateur à un modèle de vision compatible OpenAI et affiche les descriptions dans un panneau droit de l'interface web.
dsh-voice-mode (dsh-voice-mode)
qishuilalala/dsh-voice-mode
Mode voix duplex intégral pour l'interface Web DeepSeek Harness : bascule (envoi automatique après 2 s de pause) ou dictée push-to-talk dans un brouillon modifiable avec ASR streaming zipformer2, mot de réveil optionnel ; lecture phrase par phrase via Edge TTS avec sous-titres en direct, et la parole interrompt la lecture et le tour en cours (vrai barge-in). ASR sur appareil, aucune clé API requise.