Passer au contenu principal

Vision, voix et multimodal

Les plugins Vision, voix et multimodal donnent des yeux, des oreilles et une voix aux modèles DeepSeek texte seul de DeepSeek-Harness (dsh). Trouvez des outils de vision et des routes de fournisseur qui font l'OCR et décrivent les captures collées via Zhipu GLM, Gemini, Doubao ou Ollama en local, une saisie vocale au micro via la Web Speech API du navigateur ou des API compatibles Whisper, une lecture à voix haute avec Edge TTS ou des voix personnalisées, des modes vocaux full-duplex, et des générateurs d'images, de vidéos et de musique.

312 plugins trouvés

H

dsh-vision-mix

haiziyao/dsh-vision-mix

Combine les API texte, vision et génération d'images en un seul modèle Mix avec routage automatique : les requêtes textuelles vont au modèle de chat, les images utilisateur et captures d'écran de l'agent vont au modèle de vision, les suivis continuent d'utiliser la même image de session, et les agents peuvent générer ou modifier des images avec un historique d'appels limité à la session.

3il y a 24 joursVision, voix et multimodalMIT
O

dsh-ernie-image

omdsh-dev/dsh-ernie-image

3il y a 2 moisVision, voix et multimodalBSD-3-Clause
Z

openflowframes

zerohackz/openflowframes

3il y a 2 moisVision, voix et multimodalGPL-3.0
O

dsh-paddle-ocr

omdsh-dev/dsh-paddle-ocr

3il y a 2 moisVision, voix et multimodalBSD-3-Clause
H

dsh-plugin-aigc-canvas

huanlinoto/dsh-plugin-aigc-canvas

Pont HTTP AIGC agnostique du fournisseur + canevas infini + post-traitement ffmpeg ; 13 outils, dont liaison sur le canevas, relance (reroll) et édition média.

3il y a 2 moisVision, voix et multimodal
J

dsh-voice

jesse-njx/dsh-voice

Notes vocales en entrée, réponses parlées en sortie : dictez de l'audio qui devient des messages utilisateur (transcription), faites lire les réponses à voix haute par l'agent (synthèse vocale), local-first sous ~/.dsh/voice.

3il y a 2 moisVision, voix et multimodalMIT
E

dsh-llm-vision-bridge

einskyle/dsh-llm-vision-bridge

Passerelle de vision native au fournisseur LLM : les images collées dans le chat sont décrites par un modèle de vision (Qwen3-VL via pi-ai/llama.cpp), et la description textuelle est transmise à DeepSeek texte seul pour la réponse — l'admission, le routage et la compaction des images passent tous par les mécanismes natifs du harness, avec un cache de descriptions LRU et une reprise sur erreur 503.

3il y a 2 moisVision, voix et multimodalMIT
Q

dsh-mic-input

qt-chen/dsh-mic-input

Saisie vocale au micro pour le composeur : transcription en direct via la Web Speech API du navigateur, déduplication/poursuite automatique, ponctuation intelligente, réglages de langue et d'envoi automatique.

3il y a 2 moisVision, voix et multimodalMIT
H

dsh-open-eyes

hyper-dsh-plugins/dsh-open-eyes

Passerelle de vision pour les routes DeepSeek uniquement textuelles, qui analyse les images jointes et locales via des points de terminaison OpenAI Responses, Chat Completions ou Anthropic Messages configurables, tout en laissant les routes capables d'images en natif.

2il y a 27 joursVision, voix et multimodalMIT
C

dsh-gpt-image

cai-mh/dsh-gpt-image

Génère des images via une session web ChatGPT connectée et les télécharge dans un répertoire local.

2il y a 24 joursVision, voix et multimodalMIT
M

dsh-ui-mockup

mackwan84/dsh-ui-mockup

Consumer de l'outil ui_mockup : génère des wireframes et des maquettes haute fidélité d'UI en phase de discussion, enregistre le design sur disque, demande confirmation puis verrouille la spécification de design ; inclut des cartes client, le routage d'images et l'i18n.

2il y a 22 joursVision, voix et multimodalMIT
B

dsh-voice-call

biliye/dsh-voice-call

Assistant d'appel vocal pour l'interface web DSH : une boule d'appel flottante et déplaçable, un VAD côté navigateur qui envoie chaque prise de parole après une pause, la reconnaissance vocale FunASR HTTP ou en streaming, des réponses TTS MiniMax ou compatibles OpenAI, un mode optionnel à mot d'éveil avec mise en veille automatique, et la répartition de tâches vers des sessions de sous-agents séparées avec progression, arrêt et rapports de fin parlés.

2il y a 5 joursVision, voix et multimodalMIT
Y

dsh-tool-lipsync

yu-wenchao/dsh-tool-lipsync

Plugin gratuit de génération vidéo lip-sync pour DSH avec plus de 3000 voix et plus de 500 langues.

2il y a 28 joursVision, voix et multimodalMIT
B

dsh-vision-plugin

bug-huntter/dsh-vision-plugin

Reconnaissance d'images configurable pour les modèles DSH en texte seul : les messages image sont d'abord transcrits par un modèle de vision compatible OpenAI (URL de base, ID de modèle et clé API définis dans une section Paramètres) puis transmis au modèle principal sous forme de texte, tandis que la prise en charge des entrées d'image est annoncée. Le schéma d'authentification par clé API est sélectionnable (en-têtes de requête de style OpenAI, Anthropic, Gemini ou Azure) et l'absence de clé est signalée avant tout envoi de requête.

2il y a 5 joursVision, voix et multimodalMIT
B

dseyesopen

balue8246-maker/dseyesopen

Pont de vision pour DeepSeek en mode texte uniquement : envoyez des images (seules ou mêlées à du texte) et un petit modèle de vision rapide les décrit en coulisses ; la conversation conserve l'image, DeepSeek ne voit que du texte. Extension pure : la désinstallation rétablit tout.

2le mois dernierVision, voix et multimodal
L

dsh-visibridge

lhbsaa/dsh-visibridge

Preuve visuelle structurée (OCR/mise en page/sémantique) plus un outil de capture par caméra USB pour une boucle de débogage « tirer-regarder-ajuster » ; backends : Ollama, DeepSeek, Xiaomi.

2le mois dernierVision, voix et multimodalMIT
F

dsh-short-video-studio

fengyungithub/dsh-short-video-studio

Atelier de création vidéo par IA de type MiniMax-Design, basé sur deepseek harness.

2le mois dernierVision, voix et multimodalApache-2.0
Z

dsh-watch-video

zeshuochen/dsh-watch-video

Transcription vidéo privilégiant les sous-titres, avec export SRT, contrôles de tâche annulables et un repli sur faster-whisper large-v3 lorsque les sous-titres sont indisponibles.

2le mois dernierVision, voix et multimodal
W

dsh-voice-agent (voice-app)

wayneyu430/dsh-voice-agent

Un agent frontal vocal conversationnel pour dsh : parlez naturellement via ByteDance Duplex, déléguez les requêtes à des tâches d'arrière-plan et écoutez leurs résultats asynchrones rapportés par la voix.

2le mois dernierVision, voix et multimodal
M

dsh-voice-chat

maoyuching/dsh-voice-chat

Chat vocal façon Doubao pour DSH : maintenir le micro du composeur convertit la parole en texte et l'envoie automatiquement, et les réponses de l'IA sont lues à voix haute. Condensation optionnelle par LLM (les longues réponses sont résumées en courtes phrases parlées, en suivant le modèle de la conversation en cours), nettoyage du texte adapté au TTS, voix Edge TTS sélectionnables, arrêt automatique au silence réglable et réglages intégrés à la boîte de dialogue des paramètres de DSH.

2il y a 8 joursVision, voix et multimodalMIT
Y

phone-lens (phone-lens)

yxqfg/phone-lens

Transforme la caméra d'un téléphone en viseur en direct et en entrée photo pour votre session dsh, via LAN ou USB.

2il y a 3 joursVision, voix et multimodalMIT
M

dsh-capture

max-null/dsh-capture

Capture d'écran à double moteur pour DSH : dans le shell de bureau SSiD, un raccourci global ou la barre des tâches ouvre une superposition de sélection par cadre en plein écran (tous les moniteurs, cadres au pixel près par écran) avec annotation par cadre rouge sur place et une barre d'outils façon WeChat ; dans DSH simple (navigateur), le bouton caméra du composeur capture l'écran via getDisplayMedia et réutilise dans la page la même superposition de sélection par cadre + annotation en une seule phase. L'image rognée arrive dans le composeur de la conversation en cours via le circuit officiel des pièces jointes.

2il y a 4 joursVision, voix et multimodalMIT
Y

phone-lens (lens-mate)

yxqfg/phone-lens

Transforme l'appareil photo d'un téléphone en viseur en direct et entrée photo pour votre session dsh, via LAN ou USB.

2le mois dernierVision, voix et multimodalMIT
E

dsh-labnana

exoticknight/dsh-labnana

Génération d'images Labnana pour DeepSeek Harness : texte en image / image en image / édition précise avec estimation des crédits, solde d'abonnement et interface de paramètres web.

2il y a 9 joursVision, voix et multimodalApache-2.0