- Accueil
- Catégories
- Vision, voix et multimodal
Vision, voix et multimodal
Les plugins Vision, voix et multimodal donnent des yeux, des oreilles et une voix aux modèles DeepSeek texte seul de DeepSeek-Harness (dsh). Trouvez des outils de vision et des routes de fournisseur qui font l'OCR et décrivent les captures collées via Zhipu GLM, Gemini, Doubao ou Ollama en local, une saisie vocale au micro via la Web Speech API du navigateur ou des API compatibles Whisper, une lecture à voix haute avec Edge TTS ou des voix personnalisées, des modes vocaux full-duplex, et des générateurs d'images, de vidéos et de musique.
312 plugins trouvés
dsh-vision-sidecar
121103qwq/dsh-vision-sidecar
Sidecar de vision hébergé et gratuit pour DeepSeek Harness, avec des preuves de session durables
dsh-image-subagent
yuqingsh/dsh-image-subagent
dsh-vision-bridge
gxx182/dsh-vision-bridge
Relie les images de session à des fournisseurs de vision configurables et renvoie une analyse texte uniquement aux routes de modèles DeepSeek Harness éligibles.
dsh-omni-workstation
huashenglian/dsh-omni-workstation
Station de travail omni-modale pour DSH : analyze_image sur une chaîne de basculement VLM ordonnée à plusieurs cartes, une boîte à outils de vision à six outils (zoom, échantillonnage de couleurs, diff de pixels, OCR, détection d'éléments, affichage en ligne) partageant le même résolveur d'images, generate_image via les protocoles OpenAI/DashScope/ComfyUI, generate_video asynchrone multi-cartes avec un constructeur /build-video-tool, et TTS speak/clone_voice sur sept fournisseurs, le tout piloté par une seule page de paramètres à enregistrement automatique.
dsh-hold-to-talk
wangzhanchao883/dsh-hold-to-talk
Saisie à une main, sans clavier, pour la zone de rédaction : maintenez le bouton de la souris enfoncé sur la zone de saisie, parlez, relâchez — le texte atterrit dans le brouillon, et glisser vers le haut annule sans laisser une phrase à moitié écrite. Pas de bouton micro à viser ni de raccourci à mémoriser ; la main n'a jamais à quitter la zone de saisie, ce qui est tout l'intérêt quand l'autre main est occupée. La reconnaissance fonctionne entièrement hors ligne (SenseVoice via sherpa-onnx, aucune clé API, l'audio ne quitte jamais la machine).
dsh-plugin-speech
nakamuraia/dsh-plugin-speech
Lit à voix haute les réponses de l'assistant dans DeepSeek Harness : fournisseurs de synthèse texte-vers-parole avec lecture en streaming.
dsh-voice-assistant
supersyh-sss/dsh-voice-assistant
Assistant vocal pour dsh web : prononcez la phrase de réveil (par ex. « 小鲸 ») pour activer la dictée mains libres — ce que vous dites est transcrit et saisi automatiquement dans la zone de chat. Prend en charge les commandes d'édition vocales (envoyer, effacer, nouvelle ligne, arrêter la lecture) et lit à voix haute les réponses de l'assistant en chinois. La reconnaissance vocale s'exécute localement dans le navigateur via sherpa-onnx WASM, elle fonctionne donc hors ligne sans clé API.
dsh-audiogen
shimingming520/dsh-audiogen
Génération audio IA pour l'interface web DeepSeek Harness — TTS multi-fournisseurs, musique, effets sonores et conception vocale avec panneau latéral, comparaison de modèles, bibliothèque de ressources et outils Agent.
dsh-voco
lgquan/dsh-voco
Conversations vocales continues pour DSH avec écoute mains libres, push-to-talk, reconnaissance vocale, réponses TTS et délégation d'Agent en arrière-plan.
dsh-gsv
taoruiliu19/dsh-gsv
TTS local en temps réel pour DeepSeek Harness : préréglages vocaux, lecture automatique, assistant de configuration du moteur, bouton de lecture à voix haute et panneau de réglages pour le moteur GSV-TTS-Lite.
dsh-ximalaya
jerryqx/dsh-ximalaya
Écoutez les podcasts et livres audio Ximalaya dans l'interface web DSH : recherchez des albums, parcourez les pistes paginées et lisez via une barre de lecture en cours (précédent/lecture/suivant, position, volume, vitesse). Après connexion par QR code, la page « Mine » liste vos pistes aimées (cliquez pour lire), les albums abonnés avec des indices sur le dernier épisode, et les animateurs suivis avec leurs albums publics ; l'hôte relaie les flux audio avec prise en charge de Range et enregistre un outil `ximalaya_play` afin que l'agent puisse rechercher et lire à la demande.
phone-eye
boheastill/phone-eye
Permet à votre agent IA de voir et de piloter un vrai téléphone Android : phone_look (fusion vision + arbre d'interface), tap/swipe/type, capture d'écran — via adb, pour tout client MCP.
dsh-image-vision
xiaoyuink/dsh-image-vision
Compréhension d'images pour tout modèle DSH : outils de vision, OCR, grounding et recadrage avec presets de domaine pour l'histopathologie, la biologie cellulaire, l'anatomie, les images cliniques et les figures scientifiques.
Deepseek-Continuity
linxuhao/deepseek-continuity
Génération locale d'images, de voix, de musique et d'effets sonores, plus transcription, avec identité épinglée : les personnages, animaux, objets et voix d'acteurs sont définis une fois et réutilisés à chaque appel ultérieur ; les sorties dégénérées (image presque plate, audio silencieux) sont rejetées au lieu d'être renvoyées comme succès, et une ligne générée peut être relue comme texte, ce qui rend visible un clone qui aurait avalé sa fin. Les moteurs se déchargent en veille, et la génération d'images et la transcription peuvent chacune être dirigées vers une API de type OpenAI au lieu du backend Vulkan local.
dsh-ui-spec
yumimanji/dsh-ui-spec
Plugin DeepSeek Harness qui transforme des captures d'écran UI en spécifications web de niveau implémentation à l'aide d'OCR, de géométrie déterministe, de graphes de scène, d'assets et de comparaison de rendu.
deepseekeyes
dttxorg/deepseekeyes
Runtime de vision et Computer Use multiplateforme auditable pour DeepSeek Harness avec des preuves préservant la source.
voco-input-sh
nothree-code/voco-input-sh
Saisie vocale pour l'interface Web : un bouton micro qui lance la reconnaissance vocale hors ligne locale VocoType et insère automatiquement le texte reconnu dans le compositeur (déploiement automatique, déduplication, dictée continue).
dsh-stt-input
baisama-cloud/dsh-stt-input
Saisie vocale de reconnaissance vocale pour l'interface Web : un bouton micro dans le compositeur transcrit la parole en brouillon via l'API Web Speech du navigateur (sans configuration) ou une API Whisper compatible OpenAI (OpenAI / Groq), avec modèle et langue sélectionnables dans Paramètres.
visual-review
wang-bool/visual-review
Affiche en ligne dans le chat DSH Web les images collées ou importées et donne la vision aux modèles texte seuls : l’outil visual_review, invocable par le modèle, appelle d’abord une API multimodale compatible OpenAI, puis bascule sur un worker local Qwen3-VL en cas d’échec.
dsh-plugins (dsh-vision)
tzhr-invest/dsh-plugins
Outil de vision appelable par l’agent qui décrit les images locales via n’importe quel endpoint de vision compatible OpenAI que vous configurez, avec une vérification croisée multi-modèle optionnelle et sans clé intégrée.
dsh-plugin-multimodal
shinjiyu/dsh-plugin-multimodal
Annonce le collage d'image sur les routes DeepSeek en texte seul, décrit les pièces jointes avec un sidecar de vision et laisse les modèles de vision natifs intacts.
dsh-vision-tools
moon09300731/dsh-vision-tools
Offre complète de capacités de vision pour DeepSeek Harness : un outil vision_understand (API de vision compatibles OpenAI, Zhipu GLM-4V-Flash gratuit par défaut) ainsi que des points d'entrée coller/glisser-déposer/bouton pour la reconnaissance d'images.
dsh-plugin-grok2api-media-tool
lsjspl/dsh-plugin-grok2api-media-tool
Donne à dsh la capacité de générer des images et des vidéos via l’API grok2api.
dsh-image-gen
leemancheung/dsh-image-gen
`image_gen` de GPT Image 2 avec OAuth d’abonnement Codex par défaut ou mode explicite clé API : carte en développement, jusqu’à trois partiels API en direct, relecture durable des pièces jointes / lightbox / téléchargement, sortie de modèle texte seul et requêtes bornées sûres pour les identifiants.