- Accueil
- Catégories
- Vision, voix et multimodal
Vision, voix et multimodal
Les plugins Vision, voix et multimodal donnent des yeux, des oreilles et une voix aux modèles DeepSeek texte seul de DeepSeek-Harness (dsh). Trouvez des outils de vision et des routes de fournisseur qui font l'OCR et décrivent les captures collées via Zhipu GLM, Gemini, Doubao ou Ollama en local, une saisie vocale au micro via la Web Speech API du navigateur ou des API compatibles Whisper, une lecture à voix haute avec Edge TTS ou des voix personnalisées, des modes vocaux full-duplex, et des générateurs d'images, de vidéos et de musique.
312 plugins trouvés
dsh-voice-kit
aaaadrop/dsh-voice-kit
Saisie vocale (Web Speech API) et lecture à voix haute (speechSynthesis) pour l'interface Web de DeepSeek Harness — kit de saisie vocale DSH + lecture des réponses
dsh-sight
ericfetch/dsh-sight
Plugin DeepSeek Harness : déclarations directes de transfert d'images multimodales + effacement des images par session (remplacement de surface), avec une page de paramètres et des contrôles du composeur.
dsh-open-file
hyper-dsh-plugins/dsh-open-file
Téléversement de fichiers arbitraires lié à l'espace de travail, lecture, OCR et rendu pour DeepSeek Harness.
dsh-multimodal
yauntyour/dsh-multimodal
Chaînes multimodales par type de fichier : des modèles de traitement prédéfinis par joker convertissent les fichiers image, vidéo et audio en tokens de prompt avant qu'ils n'atteignent le modèle de session texte uniquement, avec des chaînes de repli par préréglage et une page de réglages Multimodal.
dsh-voice-input
lhenlihai-hub/dsh-voice-input
dsh-vision-bridge
acc1143/dsh-vision-bridge
Plugin de routage à deux modèles pour DSH : la conversation principale reste sur DeepSeek, les tâches d'image sont automatiquement dirigées vers le modèle de vision explicitement configuré, puis le résultat de l'analyse revient à DeepSeek pour continuer.
dsh-vision
314857493/dsh-vision
Plugin DeepSeek Harness : une route `deepseek-vision` qui déclare l'entrée d'images et transcrit les images collées via les modèles de vision gratuits Zhipu GLM avant de déléguer à l'adaptateur DeepSeek.
dsh-image-plugins
alanzhao0128/dsh-image-plugins
Plugin multimodal pour DeepSeek Harness : comprendre des images et générer des images via des points de terminaison compatibles OpenAI ou DashScope configurables.
dsh-plugins
zjcdkj/dsh-plugins
Plugin out-of-tree DeepSeek Harness : donne des yeux à un modèle de codage textuel en routant les images vers une route Qwen-VL (DashScope) via ctx.llm et en retournant du texte.
dsh-open-file
hyp6666/dsh-open-file
Upload, lecture, OCR et rendu de fichiers arbitraires liés au workspace pour DeepSeek Harness.
dsh-image-vision
xsoc1/dsh-image-vision
Pont de pièces jointes d'images dans le chat avec un outil view_image pour tout VLM compatible OpenAI (Ollama local ou cloud) : les images collées/déposées deviennent des marqueurs de chemin view_image avant d'atteindre les modèles DeepSeek texte uniquement.
mimo-vision
wulusai2333/mimo-vision
Outil `describe_image` : un pont de vision qui envoie les images à mimo-v2.5 via l'API opencode Zen (identifiant `OPENCODE_GO_API_KEY`, route gratuite d'abord avec repli payant) et renvoie des descriptions texte aux modèles texte seul, avec passe-plat natif et transcodage ImageMagick des formats SVG/TIFF/HEIC.
dsh-tool-vision
wanshichenguang/dsh-tool-vision
Outil image_describe (识图) côté modèle sur l'API compatible OpenAI de DashScope (qwen3.7-flash), plus un pont de collage : sur les sessions texte uniquement, les images collées se convertissent automatiquement en chemins de fichiers à l'envoi et se réaffichent dans la transcription, sans jamais déclencher l'admission d'images. Apportez votre propre DASHSCOPE_API_KEY ; endpoint/modèle/budgets configurables, client HTTP anti-redirection, fonctionne dans tous les agent presets.
dsh-vision-subagent
ruby1304/dsh-vision-subagent
La vision pour n'importe quelle route DSH : collez des images dans le composeur web avec analyse automatique selon l'intention, déléguez la lecture des images de l'espace de travail à un sous-agent de vision Kimi/MiniMax, et matérialisez les originaux collés pour les modifier.
dsh-auto-vision
normanfxxkingrockwell/dsh-auto-vision
Pont de vision à découverte automatique pour les agents DeepSeek Harness texte seul : trouve automatiquement un modèle capable de traiter les images parmi vos fournisseurs configurés et renvoie les descriptions en texte brut via un outil de vision.
dsh-llm-deepseek-vision
nagasakisoyo-ui/dsh-llm-deepseek-vision
Adaptateur DeepSeek augmenté par la vision : un modèle capable de vision décrit l'image en entrée, puis un modèle DeepSeek texte seul raisonne sur cette description.
dsh-eyes
leeminjing/dsh-eyes
Vision à la demande pour les modèles DeepSeek texte seul : envoyez des images et le modèle appelle un outil view_image adossé à n'importe quel endpoint de vision compatible OpenAI (Qwen/DashScope par défaut).
dsh-mindseye
kanchengw/dsh-mindseye
Vision en plugin pour les modèles texte seul sur DSH, avec interaction native pour la compréhension et la génération d'images, l'automatisation d'interface, une mémoire de preuves en couches et un cache.
dsh-tool-vision
gloryxpnv/dsh-tool-vision
Vision structurée local-first pour agents texte seul : les images partent vers un VLM local compatible OpenAI et reviennent en preuves JSON (résumé, OCR littéral, régions de mise en page, entités/relations, couleurs, incertitude explicite), avec repli anti-hallucination et pont facultatif de collage/envoi ; coût cloud nul, les images ne quittent jamais la machine.
dsh-plugin-mm-vision
elohia/dsh-plugin-mm-vision
Encodeur de synesthésie pour DSH : un modèle de vision traduit les images en un texte spatial structuré et compact (canevas/éléments/coordonnées en pourcentage), offrant aux LLM texte seul une compréhension d'image au niveau du pixel via l'outil `mm_vision`.
dsh-deepseek-vision
cheng-cheng9669/dsh-deepseek-vision
Récupère le mode vision intégré de DeepSeek web pour les modèles texte seul : l'outil deepseek_vision pilote l'automatisation de navigateur locale deepseek-vision-cli (aide à la connexion manuelle, deep-think activé, fermeture automatique du navigateur) et renvoie les descriptions d'images sous forme de texte.
dsh-vision-fallback
1helloman1/dsh-vision-fallback
Route les images du chat vers un modèle de vision fixe compatible OpenAI, renvoie des observations factuelles au modèle principal sélectionné et réutilise les observations par session à travers les rejeux, la compaction et les redémarrages.
dsh-voice
zhuiyueya/dsh-voice
Voix pour DeepSeek Harness (dsh) — saisie par reconnaissance vocale + lecture à voix haute (TTS) pour DeepSeek texte seul, sans clé API.
multimodal-bridge
spirit4471/multimodal-bridge
Bundle de plugins DeepSeek Harness : outils qwen_vision (compréhension d'image Qwen-VL) et qwen_generate (texte-image Qwen-Image) pour les modèles texte seul.