Passer au contenu principal

Vision, voix et multimodal

Les plugins Vision, voix et multimodal donnent des yeux, des oreilles et une voix aux modèles DeepSeek texte seul de DeepSeek-Harness (dsh). Trouvez des outils de vision et des routes de fournisseur qui font l'OCR et décrivent les captures collées via Zhipu GLM, Gemini, Doubao ou Ollama en local, une saisie vocale au micro via la Web Speech API du navigateur ou des API compatibles Whisper, une lecture à voix haute avec Edge TTS ou des voix personnalisées, des modes vocaux full-duplex, et des générateurs d'images, de vidéos et de musique.

312 plugins trouvés

A

dsh-voice-kit

aaaadrop/dsh-voice-kit

Saisie vocale (Web Speech API) et lecture à voix haute (speechSynthesis) pour l'interface Web de DeepSeek Harness — kit de saisie vocale DSH + lecture des réponses

1le mois dernierVision, voix et multimodalMIT
E

dsh-sight

ericfetch/dsh-sight

Plugin DeepSeek Harness : déclarations directes de transfert d'images multimodales + effacement des images par session (remplacement de surface), avec une page de paramètres et des contrôles du composeur.

1le mois dernierVision, voix et multimodalMIT
H

dsh-open-file

hyper-dsh-plugins/dsh-open-file

Téléversement de fichiers arbitraires lié à l'espace de travail, lecture, OCR et rendu pour DeepSeek Harness.

1le mois dernierVision, voix et multimodalMIT
Y

dsh-multimodal

yauntyour/dsh-multimodal

Chaînes multimodales par type de fichier : des modèles de traitement prédéfinis par joker convertissent les fichiers image, vidéo et audio en tokens de prompt avant qu'ils n'atteignent le modèle de session texte uniquement, avec des chaînes de repli par préréglage et une page de réglages Multimodal.

1il y a 2 moisVision, voix et multimodalMIT
L

dsh-voice-input

lhenlihai-hub/dsh-voice-input

1il y a 2 moisVision, voix et multimodalMIT
A

dsh-vision-bridge

acc1143/dsh-vision-bridge

Plugin de routage à deux modèles pour DSH : la conversation principale reste sur DeepSeek, les tâches d'image sont automatiquement dirigées vers le modèle de vision explicitement configuré, puis le résultat de l'analyse revient à DeepSeek pour continuer.

1il y a 2 moisVision, voix et multimodalMIT
3

dsh-vision

314857493/dsh-vision

Plugin DeepSeek Harness : une route `deepseek-vision` qui déclare l'entrée d'images et transcrit les images collées via les modèles de vision gratuits Zhipu GLM avant de déléguer à l'adaptateur DeepSeek.

1il y a 2 moisVision, voix et multimodalMIT
A

dsh-image-plugins

alanzhao0128/dsh-image-plugins

Plugin multimodal pour DeepSeek Harness : comprendre des images et générer des images via des points de terminaison compatibles OpenAI ou DashScope configurables.

1il y a 2 moisVision, voix et multimodalMIT
Z

dsh-plugins

zjcdkj/dsh-plugins

Plugin out-of-tree DeepSeek Harness : donne des yeux à un modèle de codage textuel en routant les images vers une route Qwen-VL (DashScope) via ctx.llm et en retournant du texte.

1il y a 2 moisVision, voix et multimodalMIT
H

dsh-open-file

hyp6666/dsh-open-file

Upload, lecture, OCR et rendu de fichiers arbitraires liés au workspace pour DeepSeek Harness.

1il y a 2 moisVision, voix et multimodalMIT
X

dsh-image-vision

xsoc1/dsh-image-vision

Pont de pièces jointes d'images dans le chat avec un outil view_image pour tout VLM compatible OpenAI (Ollama local ou cloud) : les images collées/déposées deviennent des marqueurs de chemin view_image avant d'atteindre les modèles DeepSeek texte uniquement.

1il y a 2 moisVision, voix et multimodal
W

mimo-vision

wulusai2333/mimo-vision

Outil `describe_image` : un pont de vision qui envoie les images à mimo-v2.5 via l'API opencode Zen (identifiant `OPENCODE_GO_API_KEY`, route gratuite d'abord avec repli payant) et renvoie des descriptions texte aux modèles texte seul, avec passe-plat natif et transcodage ImageMagick des formats SVG/TIFF/HEIC.

1il y a 2 moisVision, voix et multimodalMIT
W

dsh-tool-vision

wanshichenguang/dsh-tool-vision

Outil image_describe (识图) côté modèle sur l'API compatible OpenAI de DashScope (qwen3.7-flash), plus un pont de collage : sur les sessions texte uniquement, les images collées se convertissent automatiquement en chemins de fichiers à l'envoi et se réaffichent dans la transcription, sans jamais déclencher l'admission d'images. Apportez votre propre DASHSCOPE_API_KEY ; endpoint/modèle/budgets configurables, client HTTP anti-redirection, fonctionne dans tous les agent presets.

1il y a 2 moisVision, voix et multimodalMIT
R

dsh-vision-subagent

ruby1304/dsh-vision-subagent

La vision pour n'importe quelle route DSH : collez des images dans le composeur web avec analyse automatique selon l'intention, déléguez la lecture des images de l'espace de travail à un sous-agent de vision Kimi/MiniMax, et matérialisez les originaux collés pour les modifier.

1il y a 23 joursVision, voix et multimodalMIT
N

dsh-auto-vision

normanfxxkingrockwell/dsh-auto-vision

Pont de vision à découverte automatique pour les agents DeepSeek Harness texte seul : trouve automatiquement un modèle capable de traiter les images parmi vos fournisseurs configurés et renvoie les descriptions en texte brut via un outil de vision.

1il y a 18 joursVision, voix et multimodalMIT
N

dsh-llm-deepseek-vision

nagasakisoyo-ui/dsh-llm-deepseek-vision

Adaptateur DeepSeek augmenté par la vision : un modèle capable de vision décrit l'image en entrée, puis un modèle DeepSeek texte seul raisonne sur cette description.

1il y a 2 moisVision, voix et multimodalMIT
L

dsh-eyes

leeminjing/dsh-eyes

Vision à la demande pour les modèles DeepSeek texte seul : envoyez des images et le modèle appelle un outil view_image adossé à n'importe quel endpoint de vision compatible OpenAI (Qwen/DashScope par défaut).

1il y a 2 moisVision, voix et multimodalMIT
K

dsh-mindseye

kanchengw/dsh-mindseye

Vision en plugin pour les modèles texte seul sur DSH, avec interaction native pour la compréhension et la génération d'images, l'automatisation d'interface, une mémoire de preuves en couches et un cache.

1le mois dernierVision, voix et multimodalMIT
G

dsh-tool-vision

gloryxpnv/dsh-tool-vision

Vision structurée local-first pour agents texte seul : les images partent vers un VLM local compatible OpenAI et reviennent en preuves JSON (résumé, OCR littéral, régions de mise en page, entités/relations, couleurs, incertitude explicite), avec repli anti-hallucination et pont facultatif de collage/envoi ; coût cloud nul, les images ne quittent jamais la machine.

1il y a 2 moisVision, voix et multimodalMIT
E

dsh-plugin-mm-vision

elohia/dsh-plugin-mm-vision

Encodeur de synesthésie pour DSH : un modèle de vision traduit les images en un texte spatial structuré et compact (canevas/éléments/coordonnées en pourcentage), offrant aux LLM texte seul une compréhension d'image au niveau du pixel via l'outil `mm_vision`.

1il y a 2 moisVision, voix et multimodalMIT
C

dsh-deepseek-vision

cheng-cheng9669/dsh-deepseek-vision

Récupère le mode vision intégré de DeepSeek web pour les modèles texte seul : l'outil deepseek_vision pilote l'automatisation de navigateur locale deepseek-vision-cli (aide à la connexion manuelle, deep-think activé, fermeture automatique du navigateur) et renvoie les descriptions d'images sous forme de texte.

1il y a 2 moisVision, voix et multimodalMIT
1

dsh-vision-fallback

1helloman1/dsh-vision-fallback

Route les images du chat vers un modèle de vision fixe compatible OpenAI, renvoie des observations factuelles au modèle principal sélectionné et réutilise les observations par session à travers les rejeux, la compaction et les redémarrages.

1le mois dernierVision, voix et multimodalMIT
Z

dsh-voice

zhuiyueya/dsh-voice

Voix pour DeepSeek Harness (dsh) — saisie par reconnaissance vocale + lecture à voix haute (TTS) pour DeepSeek texte seul, sans clé API.

1il y a 2 moisVision, voix et multimodalMIT
S

multimodal-bridge

spirit4471/multimodal-bridge

Bundle de plugins DeepSeek Harness : outils qwen_vision (compréhension d'image Qwen-VL) et qwen_generate (texte-image Qwen-Image) pour les modèles texte seul.

1il y a 2 moisVision, voix et multimodalMIT