Passer au contenu principal

Vision, voix et multimodal

Les plugins Vision, voix et multimodal donnent des yeux, des oreilles et une voix aux modèles DeepSeek texte seul de DeepSeek-Harness (dsh). Trouvez des outils de vision et des routes de fournisseur qui font l'OCR et décrivent les captures collées via Zhipu GLM, Gemini, Doubao ou Ollama en local, une saisie vocale au micro via la Web Speech API du navigateur ou des API compatibles Whisper, une lecture à voix haute avec Edge TTS ou des voix personnalisées, des modes vocaux full-duplex, et des générateurs d'images, de vidéos et de musique.

312 plugins trouvés

1

dsh-vision-sidecar

121103qwq/dsh-vision-sidecar

Sidecar de vision hébergé et gratuit pour DeepSeek Harness, avec des preuves de session durables

4il y a 2 moisVision, voix et multimodalMIT
Y

dsh-image-subagent

yuqingsh/dsh-image-subagent

4il y a 2 moisVision, voix et multimodalMIT
G

dsh-vision-bridge

gxx182/dsh-vision-bridge

Relie les images de session à des fournisseurs de vision configurables et renvoie une analyse texte uniquement aux routes de modèles DeepSeek Harness éligibles.

4il y a 2 moisVision, voix et multimodalMIT
H

dsh-omni-workstation

huashenglian/dsh-omni-workstation

Station de travail omni-modale pour DSH : analyze_image sur une chaîne de basculement VLM ordonnée à plusieurs cartes, une boîte à outils de vision à six outils (zoom, échantillonnage de couleurs, diff de pixels, OCR, détection d'éléments, affichage en ligne) partageant le même résolveur d'images, generate_image via les protocoles OpenAI/DashScope/ComfyUI, generate_video asynchrone multi-cartes avec un constructeur /build-video-tool, et TTS speak/clone_voice sur sept fournisseurs, le tout piloté par une seule page de paramètres à enregistrement automatique.

3il y a 14 joursVision, voix et multimodalMIT
W

dsh-hold-to-talk

wangzhanchao883/dsh-hold-to-talk

Saisie à une main, sans clavier, pour la zone de rédaction : maintenez le bouton de la souris enfoncé sur la zone de saisie, parlez, relâchez — le texte atterrit dans le brouillon, et glisser vers le haut annule sans laisser une phrase à moitié écrite. Pas de bouton micro à viser ni de raccourci à mémoriser ; la main n'a jamais à quitter la zone de saisie, ce qui est tout l'intérêt quand l'autre main est occupée. La reconnaissance fonctionne entièrement hors ligne (SenseVoice via sherpa-onnx, aucune clé API, l'audio ne quitte jamais la machine).

3il y a 22 heuresVision, voix et multimodalMIT
N

dsh-plugin-speech

nakamuraia/dsh-plugin-speech

Lit à voix haute les réponses de l'assistant dans DeepSeek Harness : fournisseurs de synthèse texte-vers-parole avec lecture en streaming.

3il y a 18 joursVision, voix et multimodalMIT
S

dsh-voice-assistant

supersyh-sss/dsh-voice-assistant

Assistant vocal pour dsh web : prononcez la phrase de réveil (par ex. « 小鲸 ») pour activer la dictée mains libres — ce que vous dites est transcrit et saisi automatiquement dans la zone de chat. Prend en charge les commandes d'édition vocales (envoyer, effacer, nouvelle ligne, arrêter la lecture) et lit à voix haute les réponses de l'assistant en chinois. La reconnaissance vocale s'exécute localement dans le navigateur via sherpa-onnx WASM, elle fonctionne donc hors ligne sans clé API.

3le mois dernierVision, voix et multimodalMIT
S

dsh-audiogen

shimingming520/dsh-audiogen

Génération audio IA pour l'interface web DeepSeek Harness — TTS multi-fournisseurs, musique, effets sonores et conception vocale avec panneau latéral, comparaison de modèles, bibliothèque de ressources et outils Agent.

3il y a 24 joursVision, voix et multimodalApache-2.0
L

dsh-voco

lgquan/dsh-voco

Conversations vocales continues pour DSH avec écoute mains libres, push-to-talk, reconnaissance vocale, réponses TTS et délégation d'Agent en arrière-plan.

3le mois dernierVision, voix et multimodalMIT
T

dsh-gsv

taoruiliu19/dsh-gsv

TTS local en temps réel pour DeepSeek Harness : préréglages vocaux, lecture automatique, assistant de configuration du moteur, bouton de lecture à voix haute et panneau de réglages pour le moteur GSV-TTS-Lite.

3le mois dernierVision, voix et multimodalMIT
J

dsh-ximalaya

jerryqx/dsh-ximalaya

Écoutez les podcasts et livres audio Ximalaya dans l'interface web DSH : recherchez des albums, parcourez les pistes paginées et lisez via une barre de lecture en cours (précédent/lecture/suivant, position, volume, vitesse). Après connexion par QR code, la page « Mine » liste vos pistes aimées (cliquez pour lire), les albums abonnés avec des indices sur le dernier épisode, et les animateurs suivis avec leurs albums publics ; l'hôte relaie les flux audio avec prise en charge de Range et enregistre un outil `ximalaya_play` afin que l'agent puisse rechercher et lire à la demande.

3le mois dernierVision, voix et multimodalMIT
B

phone-eye

boheastill/phone-eye

Permet à votre agent IA de voir et de piloter un vrai téléphone Android : phone_look (fusion vision + arbre d'interface), tap/swipe/type, capture d'écran — via adb, pour tout client MCP.

3le mois dernierVision, voix et multimodalMIT
X

dsh-image-vision

xiaoyuink/dsh-image-vision

Compréhension d'images pour tout modèle DSH : outils de vision, OCR, grounding et recadrage avec presets de domaine pour l'histopathologie, la biologie cellulaire, l'anatomie, les images cliniques et les figures scientifiques.

3il y a 29 joursVision, voix et multimodal
L

Deepseek-Continuity

linxuhao/deepseek-continuity

Génération locale d'images, de voix, de musique et d'effets sonores, plus transcription, avec identité épinglée : les personnages, animaux, objets et voix d'acteurs sont définis une fois et réutilisés à chaque appel ultérieur ; les sorties dégénérées (image presque plate, audio silencieux) sont rejetées au lieu d'être renvoyées comme succès, et une ligne générée peut être relue comme texte, ce qui rend visible un clone qui aurait avalé sa fin. Les moteurs se déchargent en veille, et la génération d'images et la transcription peuvent chacune être dirigées vers une API de type OpenAI au lieu du backend Vulkan local.

3il y a 12 joursVision, voix et multimodalMIT
Y

dsh-ui-spec

yumimanji/dsh-ui-spec

Plugin DeepSeek Harness qui transforme des captures d'écran UI en spécifications web de niveau implémentation à l'aide d'OCR, de géométrie déterministe, de graphes de scène, d'assets et de comparaison de rendu.

3il y a 2 moisVision, voix et multimodalMIT
D

deepseekeyes

dttxorg/deepseekeyes

Runtime de vision et Computer Use multiplateforme auditable pour DeepSeek Harness avec des preuves préservant la source.

3il y a 2 moisVision, voix et multimodalMIT
N

voco-input-sh

nothree-code/voco-input-sh

Saisie vocale pour l'interface Web : un bouton micro qui lance la reconnaissance vocale hors ligne locale VocoType et insère automatiquement le texte reconnu dans le compositeur (déploiement automatique, déduplication, dictée continue).

3il y a 19 joursVision, voix et multimodalMIT
B

dsh-stt-input

baisama-cloud/dsh-stt-input

Saisie vocale de reconnaissance vocale pour l'interface Web : un bouton micro dans le compositeur transcrit la parole en brouillon via l'API Web Speech du navigateur (sans configuration) ou une API Whisper compatible OpenAI (OpenAI / Groq), avec modèle et langue sélectionnables dans Paramètres.

3le mois dernierVision, voix et multimodalMIT
W

visual-review

wang-bool/visual-review

Affiche en ligne dans le chat DSH Web les images collées ou importées et donne la vision aux modèles texte seuls : l’outil visual_review, invocable par le modèle, appelle d’abord une API multimodale compatible OpenAI, puis bascule sur un worker local Qwen3-VL en cas d’échec.

3il y a 2 moisVision, voix et multimodalMIT
T

dsh-plugins (dsh-vision)

tzhr-invest/dsh-plugins

Outil de vision appelable par l’agent qui décrit les images locales via n’importe quel endpoint de vision compatible OpenAI que vous configurez, avec une vérification croisée multi-modèle optionnelle et sans clé intégrée.

3il y a 5 joursVision, voix et multimodalMIT
S

dsh-plugin-multimodal

shinjiyu/dsh-plugin-multimodal

Annonce le collage d'image sur les routes DeepSeek en texte seul, décrit les pièces jointes avec un sidecar de vision et laisse les modèles de vision natifs intacts.

3il y a 2 moisVision, voix et multimodalMIT
M

dsh-vision-tools

moon09300731/dsh-vision-tools

Offre complète de capacités de vision pour DeepSeek Harness : un outil vision_understand (API de vision compatibles OpenAI, Zhipu GLM-4V-Flash gratuit par défaut) ainsi que des points d'entrée coller/glisser-déposer/bouton pour la reconnaissance d'images.

3il y a 2 moisVision, voix et multimodalMIT
L

dsh-plugin-grok2api-media-tool

lsjspl/dsh-plugin-grok2api-media-tool

Donne à dsh la capacité de générer des images et des vidéos via l’API grok2api.

3le mois dernierVision, voix et multimodal
L

dsh-image-gen

leemancheung/dsh-image-gen

`image_gen` de GPT Image 2 avec OAuth d’abonnement Codex par défaut ou mode explicite clé API : carte en développement, jusqu’à trois partiels API en direct, relecture durable des pièces jointes / lightbox / téléchargement, sortie de modèle texte seul et requêtes bornées sûres pour les identifiants.

3il y a 5 joursVision, voix et multimodalMIT