Passer au contenu principal

Vision, voix et multimodal

Les plugins Vision, voix et multimodal donnent des yeux, des oreilles et une voix aux modèles DeepSeek texte seul de DeepSeek-Harness (dsh). Trouvez des outils de vision et des routes de fournisseur qui font l'OCR et décrivent les captures collées via Zhipu GLM, Gemini, Doubao ou Ollama en local, une saisie vocale au micro via la Web Speech API du navigateur ou des API compatibles Whisper, une lecture à voix haute avec Edge TTS ou des voix personnalisées, des modes vocaux full-duplex, et des générateurs d'images, de vidéos et de musique.

312 plugins trouvés

Z

dsh-web-ui (dsh-tool-describe-image)

zhu1090093659/dsh-web-ui

Un outil de vision `describe_image` pour les modèles texte uniquement : les images (chemin local, URL, pièce jointe) sont envoyées vers un point de terminaison de vision OpenAI-compatible configurable et seul le texte renvoyé entre dans la session.

8kil y a 6 joursVision, voix et multimodalApache-2.0
D

ipollowork

devin-axis/ipollowork

iPolloWork HyperFrames Video Studio et 27 modèles de vidéo modifiables sous forme de vue de conversation native pour DeepSeek Harness.

4.2kle mois dernierVision, voix et multimodal
L

modlens

liustack/modlens

Pont de vision pour les modèles texte seul : collez une image, obtenez des preuves JSON structurées (OCR, mise en page, sémantique).

4.1kil y a 5 joursVision, voix et multimodalMIT
Y

dsh-vision-router

ysr666/dsh-vision-router

Vision gratuite pour les agents texte seul : chaîne de vision intégrée sans clé, plus des outils pixel (questions-réponses, ancrage, recadrage, diff pixel, couleurs, OCR, tracé SVG, détourage, captures d'écran) ; collez une image pour l'utiliser.

1.1khierVision, voix et multimodalMIT
A

dsh-vision-toolkit

anionex/dsh-vision-toolkit

Vision pour les modèles texte uniquement : collez une image et le modèle bascule vers la variante Vision Toolkit pour les questions-réponses sur images, la comparaison multi-images, l'OCR de captures longues, la reproduction d'UI à partir de captures, l'ancrage d'éléments et les différences de pixels. Aucune clé API par défaut — les images sont traitées par le service gratuit hébergé par l'auteur, 100 par machine et par jour ; configurable vers votre propre fournisseur.

887avant-hierVision, voix et multimodalMIT
T

tongflow

tong-io/tongflow

Plugin studio TongFlow pour DeepSeek Harness (dsh) : modèle de projet façon équipe de tournage, workflows TongFlow rédigés par l'agent, génération multimédia déterministe, canevas intégré.

870le mois dernierVision, voix et multimodalAGPL-3.0
S

dsh-image-gen

shanliuling/dsh-image-gen

Génération d'images conversationnelle native pour DeepSeek Harness : demandez à l'agent de créer une image, et il gère la génération et conserve le résultat directement dans la conversation.

564il y a 3 joursVision, voix et multimodalApache-2.0
O

watch-skill

oxbshw/watch-skill

Les capacités de DeepWatch, installables dans un profil DeepSeek Harness existant

378il y a 18 joursVision, voix et multimodalMIT
D

dsh-imagegen

dickpy/dsh-imagegen

Génération d'images par IA pour l'interface web de DSH : texte-vers-image et image-vers-image via un point de terminaison compatible OpenAI configurable (gpt-image-2 / gpt-image-1 / dall-e-3), avec une carte de configuration api_url/api_key et un studio de génération à volet divisé dans la barre latérale.

99avant-hierVision, voix et multimodalApache-2.0
F

dsh-comfyui

fandc520/dsh-comfyui

Pilotez un serveur ComfyUI local ou distant depuis DeepSeek Harness : les outils comfyui_run / comfyui_object_info / comfyui_workflow génèrent et modifient des images et des vidéos, avec une bibliothèque de workflows (extraction de graphe : par composant / flux principal / tout), une zone de chargement avec correspondance automatique de résolution, une file d'attente en direct, des modèles SDXL et Wan 2.1, une compétence compagne et un proxy média de même origine.

93il y a 6 joursVision, voix et multimodalMIT
P

dsh-omi-voice

polinnizhong/dsh-omi-voice

Lecture à voix haute dans le chat pour DeepSeek Harness : touchez pour lire, mettre en pause et reprendre les réponses de l'IA avec des voix Doubao TTS naturelles (BYOK) ; lit uniquement la réponse finale, code, tableaux et diagrammes filtrés ; moteur local, le plugin ne conserve aucune clé d'API.

74le mois dernierVision, voix et multimodalMIT
C

deepseek-harness-video-director

chiphoton/deepseek-harness-video-director

🎬Réalisateur propulsé par l'IA : plugin de génération vidéo MiniMax-H3 dirigé par DeepSeek-Harness. 🤖Plus qu'un prompt. 🪄Interface en canevas.

69il y a 4 joursVision, voix et multimodalMIT
S

dsh-design-qa

sunxin-ai/dsh-design-qa

QA de fidélité de conception pour les modèles texte uniquement : un outil `deepseek_vision` emprunte un œil à n’importe quelle route vision compatible OpenAI, afin que le modèle puisse juger si une implémentation correspond à sa maquette — livré avec le benchmark derrière ce jugement (quatre fixtures, 23 défauts injectés, transcriptions brutes) et la discipline de questionnement dont il dépend.

44il y a 26 joursVision, voix et multimodalMIT
J

picturereader

jing-hy/picturereader

« Lecture » d'images pour les modèles texte uniquement : réduction d'échelle + réduction de la profondeur de couleur + empreintes de structure/couleur transformées en grilles de texte renvoyées dans la conversation, permettant au modèle de zoomer, d'échantillonner et de faire de l'OCR de manière autonome comme un modèle multimodal ; entièrement local, sans dépendance à un modèle externe, fournit une compétence de méthodologie de lecture d'image et PaddleOCR en option.

37avant-hierVision, voix et multimodalMIT
P

dsh-voice-scribe

pensivefei/dsh-voice-scribe

Saisie vocale pour l'interface web : appuyez sur Alt (ou Alt+Space) pour démarrer/arrêter la dictée, Web Speech du navigateur (zéro config) ou ASR cloud compatible OpenAI, polissage optionnel via le LLM configuré par DSH, interface de paramètres.

34il y a 3 joursVision, voix et multimodalMIT
O

dsh-vision

oil-oil/dsh-vision

Compréhension d'image quasi native pour DeepSeek Harness

24il y a 2 moisVision, voix et multimodalMIT
D

dsh-web-ui (dsh-tool-describe-image)

damonkoy/dsh-web-ui

Donne à un modèle textuel la compréhension d'image via un modèle vision-langage, exposé comme outil `describe_image`.

22il y a 2 moisVision, voix et multimodalApache-2.0
W

dsh-ears

wiziscool/dsh-ears

Plugin de saisie vocale pour DeepSeek Harness (dsh) : un bouton microphone dans le compositeur transforme la parole en brouillon transcrit, avec un choix de backends de reconnaissance vocale, un peaufinage optionnel via les propres routes LLM de dsh et une page de paramètres native.

21il y a 21 heuresVision, voix et multimodalMIT
1

dsh-plugin-tts

1624318455/dsh-plugin-tts

Lit à voix haute les réponses de l'assistant via Edge TTS gratuit ou vos propres modèles vocaux RVC : boutons de lecture à voix haute + lecture automatique, lecture progressive par blocs adaptatifs (lectures longues sans coupure), installation en un clic de packs vocaux depuis un registre, et un runtime RVC portable.

21il y a 6 joursVision, voix et multimodalMIT
M

dsh-media-skills

mjorgin/dsh-media-skills

Pont de vision gratuit et génération d'images pour les modèles texte seul : lecture d'images collées, basculement entre les moteurs GLM-4V-Flash et Gemini, preuves structurées façon ModLens, et une route de modèle de vision gratuite préconfigurée.

19il y a 12 joursVision, voix et multimodalMIT
D

dsh-aigc-canvas

dsh-external/dsh-aigc-canvas

Plugin de canevas AIGC (cordis).

17il y a 21 joursVision, voix et multimodal
P

dsh-talk

perrylink/dsh-talk

Entrée/sortie vocale pour DeepSeek Harness — reconnaissance vocale et synthèse vocale via le microphone et la sortie audio.

16il y a 8 joursVision, voix et multimodalApache-2.0
J

dsh-visual-plugin

jyh20030112/dsh-visual-plugin

Donne la vision aux modèles textuels uniquement : transmet les images de l'utilisateur à un modèle de vision compatible OpenAI et affiche les descriptions dans un panneau droit de l'interface web.

16il y a 3 joursVision, voix et multimodalMIT
Q

dsh-voice-mode (dsh-voice-mode)

qishuilalala/dsh-voice-mode

Mode voix duplex intégral pour l'interface Web DeepSeek Harness : bascule (envoi automatique après 2 s de pause) ou dictée push-to-talk dans un brouillon modifiable avec ASR streaming zipformer2, mot de réveil optionnel ; lecture phrase par phrase via Edge TTS avec sous-titres en direct, et la parole interrompt la lecture et le tour en cours (vrai barge-in). ASR sur appareil, aucune clé API requise.

15il y a 6 heuresVision, voix et multimodalMIT