Passer au contenu principal

Vision, voix et multimodal

Les plugins Vision, voix et multimodal donnent des yeux, des oreilles et une voix aux modèles DeepSeek texte seul de DeepSeek-Harness (dsh). Trouvez des outils de vision et des routes de fournisseur qui font l'OCR et décrivent les captures collées via Zhipu GLM, Gemini, Doubao ou Ollama en local, une saisie vocale au micro via la Web Speech API du navigateur ou des API compatibles Whisper, une lecture à voix haute avec Edge TTS ou des voix personnalisées, des modes vocaux full-duplex, et des générateurs d'images, de vidéos et de musique.

312 plugins trouvés

G

dsh-tts

goodandready/dsh-tts

Lit les réponses de l'agent dans l'interface web de DeepSeek Harness via une chaîne de secours de fournisseurs (OpenAI, ElevenLabs, Google, Azure, Groq, Deepgram, OpenRouter, Edge, Piper, eSpeak), de sorte qu'un fournisseur en échec ou limité en débit bascule vers le suivant au lieu de rester silencieux.

2il y a 6 joursVision, voix et multimodalMIT
O

DSH-dseyes

okkay712/dsh-dseyes

Pièces jointes d'image natives pour DeepSeek en mode texte seul dans la Web GUI : les images collées ou déposées apparaissent sous forme de vignettes dans la session, et avant l'envoi l'hôte les lit avec l'API de vision gratuite Zhipu GLM-4V-Flash (chaîne de repli glm-4v-flash) et substitue la description, de sorte que DeepSeek répond sur l'image tandis que l'original est conservé dans l'historique.

2le mois dernierVision, voix et multimodalMIT
W

dsh-wm

waynejin0918/dsh-wm

Boîte à outils de recherche sur les modèles du monde : inspecte les images, nomme les routes 3D/pixel/latentes, note pred vs GT, et compétences RSI / wm.yaml.

2il y a 2 moisVision, voix et multimodalMIT
I

dsh-tool-visual-primitives

inkshadewoods/dsh-tool-visual-primitives

Analyse les images de conversation via des invites spécifiques au mode (caption, UI, document, grounding, topologie, etc.) et injecte des preuves structurées avec des primitives de coordonnées (boîtes, points, références) sous forme de texte, avec mise en cache au niveau de la session pour réutilisation lors du replay et de la compaction.

2il y a 3 joursVision, voix et multimodalMIT
V

dsh-smart-input

v-quest123456/dsh-smart-input

Plugin d'entrée intelligente pour DeepSeek Harness — saisie vocale + optimisation des invites

2il y a 2 moisVision, voix et multimodalMIT
G

dsh-vision-bridge

goodandready/dsh-vision-bridge

Achemine les images vers le modèle de vision de votre choix — réécriture automatique, outils explicites ou hybride — pour qu'un modèle de chat uniquement textuel n'échoue pas sur un tour contenant une image.

2il y a 6 joursVision, voix et multimodalMIT
P

muxiva-dsh-voice

piyotahu/muxiva-dsh-voice

Voix full-duplex privilégiant le local pour DeepSeek Harness, orchestrée par Muxiva

2il y a 2 moisVision, voix et multimodalApache-2.0
P

dsh-voice-call

pandapolo/dsh-voice-call

Appels vocaux initiés par l’agent : `offer_call` fait sonner l’humain (接听/拒接/稍后再说) ; les appels acceptés sont synthétisés et lus localement via CrispASR + Qwen3-TTS (9 voix, 2 dialectes chinois), et les appels refusés renvoient la décision à l’agent.

2il y a 3 joursVision, voix et multimodalMIT
M

dsh-fish-tts

mari23333/dsh-fish-tts

Lit à voix haute les réponses de l’assistant uniquement via l’API Fish Audio (clé à fournir soi-même) : lecture par message, bascule de lecture automatique et page de réglages pour le modèle, le reference_id de la voix, la clé API chiffrée et le proxy.

2avant-hierVision, voix et multimodalMIT
X

dsh-vision

xiaoshihou514/dsh-vision

Extension native de capacité de vision, utilisant soit Zhipu (gratuit) soit Qwen-VL (local).

2le mois dernierVision, voix et multimodalMIT
K

dsh-vision-recognizer

kaixinbaba/dsh-vision-recognizer

Route de fournisseur de vision qui transcrit les images jointes en texte via un modèle configurable (plus de 15 fournisseurs compatibles OpenAI et Anthropic) tandis que DeepSeek continue de répondre.

2le mois dernierVision, voix et multimodalMIT
H

dsh-open-eyes

hyp6666/dsh-open-eyes

Pont de vision pour les routes DeepSeek texte seul qui analyse les images jointes et locales via des endpoints configurables OpenAI Responses, Chat Completions ou Anthropic Messages, tout en laissant natives les routes capables d’image.

2il y a 27 joursVision, voix et multimodalMIT
5

dsh-youreyes

54xkeee/dsh-youreyes

Boîte à outils de vision pour DeepSeek texte seul : outil `vision` appelable par le modèle, adaptateurs wrappers pour deepseek/opencode-go (v4 flash/pro), quota Antigravity IDE (default, flash/pro) / tout VLM compatible OpenAI / Gemini / canaux Ollama locaux, mémoire de preuves avec réhydratation par compactage, cache de hachage de contenu et panneau client bilingue.

2il y a 2 moisVision, voix et multimodalMIT
3

dsh-vision (vision-tool)

314857493/dsh-vision

Outil `vision` appelable par le modèle pour DeepSeek Harness : décrit et applique l’OCR aux fichiers image en appelant directement l’API de vision Zhipu GLM gratuite (chaîne de repli glm-4v-flash), sans CLI externe requis.

2il y a 28 joursVision, voix et multimodalMIT
3

dsh-vision (vision-route)

314857493/dsh-vision

Enregistre une route de fournisseur `deepseek-vision` : l’interface web accepte les images collées et les transcrit en texte via l’API de vision Zhipu GLM gratuite avant de passer à l’adaptateur DeepSeek.

2il y a 28 joursVision, voix et multimodalMIT
X

dsh-vision-bridge

ximengxiaolan/dsh-vision-bridge

Les images jointes au composeur sont transcrites en texte par un modèle de vision compatible OpenAI avant d'atteindre les modèles DeepSeek texte seul.

2il y a 2 moisVision, voix et multimodalMIT
J

dsh-live2d-voice

john-walks-slow/dsh-live2d-voice

Live2D session view with realtime voice: continuous voice input, streaming TTS, subtitle translation, multi-model catalog, standalone entry / Live2D 实时语音会话视图:连续语音输入、流式 TTS、字幕翻译、多模型目录、独立入口

1il y a 4 joursVision, voix et multimodalMIT
W

dsh-multi-tts

wyr-233/dsh-multi-tts

Per-reply read-aloud with a multi-provider settings page — MiniMax or any OpenAI-compatible /audio/speech endpoint, with voice, emotion, speed and model selection plus an auto-read toggle.

1il y a 21 joursVision, voix et multimodal
V

dsh-live-voice

victorwads/dsh-live-voice

Local-first voice conversations for DSH, with local speech recognition and synthesis and optional external providers.

1il y a 18 joursVision, voix et multimodalGPL-3.0
C

dsh-vision-autoswitch

cultofluna/dsh-vision-autoswitch

DeepSeek Harness plugin: auto-route image-bearing requests to deepseek-v4-flash-vision-exp, then fall back to the original model.

1le mois dernierVision, voix et multimodalMIT
N

dsh-dictate

navneetset/dsh-dictate

Live speech-to-text dictation into the dsh web composer via OpenRouter STT

1il y a 27 joursVision, voix et multimodalMIT
M

dsh-minimax-asr

moluyao/dsh-minimax-asr

MiniMax 语音识别(asr-1.0)+ 语音合成(speech-2.8-hd)的 DeepSeek Harness 全局插件:转写工具、任务结束后用喇叭念一句的播报、实时免手对话、303 个音色可选

1il y a 19 joursVision, voix et multimodalMIT
N

dsh-imgdraw

ninjasln-labs/dsh-imgdraw

Text-to-image for DeepSeek Harness: a `draw_image` model tool, an input-bar 生图 button with a prompt popup (async generation, 4-grid results, download / keep / delete), an /imgdraw image route, and persisted history. Backends: DashScope wan2.7-image (free

1il y a 28 joursVision, voix et multimodalMIT
D

dsh-voice-talk

duoduoqian708/dsh-voice-talk

Voice conversation mode for the DSH Web GUI: tap the mic to start a full-screen call, talk hands-free, and hear each reply read aloud as it streams. Bilingual (Chinese/English) UI, light and dark themes, adjustable speech rate, and switchable voices.

1il y a 20 joursVision, voix et multimodalMIT