Passer au contenu principal

Vision, voix et multimodal

Les plugins Vision, voix et multimodal donnent des yeux, des oreilles et une voix aux modèles DeepSeek texte seul de DeepSeek-Harness (dsh). Trouvez des outils de vision et des routes de fournisseur qui font l'OCR et décrivent les captures collées via Zhipu GLM, Gemini, Doubao ou Ollama en local, une saisie vocale au micro via la Web Speech API du navigateur ou des API compatibles Whisper, une lecture à voix haute avec Edge TTS ou des voix personnalisées, des modes vocaux full-duplex, et des générateurs d'images, de vidéos et de musique.

312 plugins trouvés

F

dsh-vision-proxy

flyvhidbwo/dsh-vision-proxy

Cerveau DeepSeek + transcription automatique d'images : attachez des images dans la GUI et chacune est transcrite par le modèle officiel deepseek-v4-flash-vision-exp par défaut (un cerveau V4-Pro en texte pur peut voir les images), avec n'importe quelle VLM compatible OpenAI ou Ollama local comme alternatives.

15le mois dernierVision, voix et multimodalMIT
D

dsh-video-lens

dundunhan/dsh-video-lens

Donne aux agents DeepSeek Harness textuels la compréhension vidéo : échantillonnage de trames contextuel + VLM + transcription ASR optionnelle fusionnés en preuves de timeline. / Plugin de compréhension vidéo pour modèles texte uniquement (échantillonnage de trames contextuel + VLM + transcription vocale optionnelle).

13le mois dernierVision, voix et multimodalMIT
P

dsh-vision-opencode

poiuyjie/dsh-vision-opencode

Ajoute un modèle de vision configurable aux modèles principaux textuels uniquement : un outil vision_read_image, un sélecteur de modèle de vision dans la barre de composition, et une conversion automatique image-texte pour les routes textuelles uniquement.

13il y a 23 joursVision, voix et multimodalMIT
Z

dsh-agnes-studio

zmm863-commits/dsh-agnes-studio

Studio d'images et de vidéos par IA sous forme de panneau DSH flottant, pour créer sans interrompre la conversation : texte-vers-image, image-vers-image et composition multi-images en 1K-4K sur huit formats ; texte-vers-vidéo et image-vers-vidéo avec contrôle de la première image de 4 à 12 secondes ; mode court-métrage qui importe un scénario (.txt/.md/.json), le découpe en plans de storyboard pour la prévisualisation et la génération par lots ; et un espace de travail d'expert en prompts. Zéro dépendance d'exécution.

12il y a 3 joursVision, voix et multimodal
B

dsh-voice-ai-girlfriend-plugin

beiyege-01/dsh-voice-ai-girlfriend-plugin

Petite amie IA vocale pour l’interface Web : entrée micro FunASR, réponses parlées Qwen3-TTS, fenêtre d’animation compagnon et chat QQ bidirectionnel (texte/voix/image push) via NapCat.

12il y a 19 joursVision, voix et multimodal
P

dsh-plugin-xiaomi-mimo-tts

ppy-web/dsh-plugin-xiaomi-mimo-tts

Ajoute la synthèse vocale Xiaomi MiMo à DSH Web avec la lecture à voix haute des messages de l'assistant, la diffusion PCM, des voix prédéfinies et la conception de voix personnalisées, un repli sur la synthèse vocale du navigateur, des commandes de lecture et des sons d'interface en option.

11il y a 3 joursVision, voix et multimodalMIT
A

dsh-speak

alan2z/dsh-speak

Plugin d'annonce vocale sans dépendance, piloté par les événements : pas de modèle supplémentaire, pas de coût en jetons. Parle avec la voix naturelle intégrée du système, prenant en charge Windows et macOS ; annonces de réponse finale, alertes d'approbation et de question, annonces d'événements facultatives (fin de tour, commande terminée, changement d'objectif, erreurs d'outils, mises à jour de tâches), réponses finales rejouables et une page de paramètres visuelle bilingue.

11il y a 7 joursVision, voix et multimodalMIT
C

Gemini-Eyes

consolesun/gemini-eyes

Pont MCP vers gemini.google.com : analyse visuelle d'images et de vidéos, génération d'images Imagen et de vidéos Veo, et gestion des conversations via la session de navigateur déjà connectée, sans clé API.

11le mois dernierVision, voix et multimodal
P

dsh-draw

perrylink/dsh-draw

Génération texte-vers-image multi-moteur (préréglages OpenAI Images et Zhipu CogView) avec suivi des quotas par session, basculement de moteur, configuration sécurisée pour les identifiants, et une carte de résultat avec régénération.

9il y a 8 joursVision, voix et multimodalApache-2.0
S

dsh-deepseek-vision

siegfly/dsh-deepseek-vision

Une route de fournisseur passerelle vision-langage : les images collées sont décrites par un modèle VL configurable (Qwen-VL par défaut) avant d'être transmises à DeepSeek.

9il y a 21 joursVision, voix et multimodalMIT
L

dsh-vision

linenxi-ctrl/dsh-vision

Plugin de vision externe pour DeepSeek Harness : panneau de configuration via le bouton baleine, reconnaissance d'image avec réponse automatique, et outils de capture d'écran/reconnaissance pour l'agent.

9il y a 2 moisVision, voix et multimodalMIT
A

dsh-highres-vision

azwosile/dsh-highres-vision

Pour le modèle de vision natif de DeepSeek Harness deepseek-v4-flash-vision-exp, relève les limites d'admission des images à 32 MiB / 8192 px / 600 images et ajoute un outil highres_read qui découpe les grandes images en tuiles, puis renvoie l'image entière plus des tuiles de 800x800 via l'outil read_image de l'hôte.

8il y a 22 joursVision, voix et multimodalMIT
G

dsh-voice

goodandready/dsh-voice

Entrée vocale pour la Web UI : dictée segmentée par pauses et messages vocaux, chacun avec sa propre chaîne de repli de fournisseurs (Deepgram, Groq, HuggingFace, whisper.cpp local ou point de terminaison compatible OpenAI).

8hierVision, voix et multimodalMIT
3

dsh-voice

3274375092/dsh-voice

Saisie vocale pour DeepSeek Harness : parlez dans le microphone et le texte reconnu est soumis comme un message de chat normal, via la reconnaissance vocale locale ou du navigateur.

8avant-hierVision, voix et multimodalMIT
F

dsh-free-vision

fuzzysoul/dsh-free-vision

Pont de vision gratuit pour les modèles texte uniquement : compréhension d'images, OCR, analyse d'interface et de débogage via des fournisseurs de niveau gratuit (Qwen3-VL-Flash, Doubao, DeepSeek-OCR) avec une interface graphique de paramètres.

8le mois dernierVision, voix et multimodalMIT
C

dsh-chat-imagine

corrinehu/dsh-chat-imagine

Génère et affiche automatiquement des images dans le chat DSH via des canaux API ou des CLIs locales (mmx / codex / agy), et peut également reconnaître des images à l'aide de la CLI correspondante.

8le mois dernierVision, voix et multimodalMIT
S

dsh-tool-vision

scorp1o117/dsh-tool-vision

Envoie des images locales ou des URL d’images HTTP(S) à un point de terminaison vision compatible OpenAI configuré avec l’outil inspect_image et renvoie sa réponse textuelle à la conversation.

8il y a 3 joursVision, voix et multimodal
W

dsh-appshots

wongyuye/dsh-appshots

Capture de fenêtre façon Codex pour DSH Desktop sur macOS et Windows : appuyez sur les deux touches Command (macOS) ou les deux touches Ctrl (Windows), ou sur le bouton caméra, pour capturer la fenêtre au premier plan, la joindre au chat en cours et injecter un arbre d'accessibilité de style VoiceOver comme contexte masqué.

7il y a 15 joursVision, voix et multimodalMIT
5

dsh-vision

54xkeee/dsh-vision

Vision pour DeepSeek en mode texte seul via Doubao Web par défaut (gratuit, sans clé API — pilote votre Chrome connecté via un pont CDP Windows), avec quota Antigravity IDE (flash/pro) ou repli sur Gemini ; escalade automatique du niveau de détail, mémoire de preuves visuelles avec réhydratation après compaction, cache par hachage de contenu, et un panneau client bilingue.

7il y a 2 moisVision, voix et multimodalMIT
Y

dsh-duet

yums/dsh-duet

Interaction vocale en chinois full-duplex pour DSH Web : dictez et modifiez des tâches, soumettez des demandes, gérez les sessions, répondez aux questions DSH et écoutez des annonces concises de fin de tâche.

6il y a 3 joursVision, voix et multimodalApache-2.0
Y

deepseek-harness-plugins (vision-bridge)

yinxe/deepseek-harness-plugins

Permet aux modèles texte seul de voir les images : lorsqu'une image arrive avec un texte de remplacement comme \[image omitted because this model accepts text only], le modèle appelle l'outil vision_describe et le plugin transmet la référence de l'image et la question à un modèle multimodal, en réessayant avec un modèle de secours en cas d'échec. Configuré dans la page de paramètres et conservé via l'API officielle de paramètres.

6hierVision, voix et multimodalMIT
Z

dsh-voice-input-plugin

zhangbo-cn/dsh-voice-input-plugin

Micro du compositeur pour l'interface web : appuyez pour surveiller la transcription en direct et maintenez pour parler, avec une lecture de réponse par Edge TTS de l'hôte diffusée pendant que le modèle génère, une pause d'écho pendant la lecture, et un appui pour arrêter.

6le mois dernierVision, voix et multimodalMIT
G

dsh-ocr-local

grelvan/dsh-ocr-local

Fallback OCR local pour les routes en texte seul : lorsque le modèle de session déclare qu'il ne peut pas accepter d'images, l'image jointe est mise en cache localement et son chemin est injecté pour que le modèle puisse appeler ocr_image — PP-OCRv5 + ONNX Runtime sur CPU, sans clé API, les images ne quittent jamais la machine. Silencieux lorsque le modèle peut voir les images.

5il y a 5 joursVision, voix et multimodal
N

vision-exp-tile

nicholas023/vision-exp-tile

Reconnaissance d'images volumineuses pour les modèles vision-exp : reconnaissance par tuiles 800×800 sans perte (smart/pipeline/full), OCR local avec prétraitement et routage d'écriture manuscrite, GPU multi-fournisseur en option (DirectML/CUDA/OpenVINO) avec repli CPU automatique.

5le mois dernierVision, voix et multimodalMIT