- Accueil
- Catégories
- Vision, voix et multimodal
Vision, voix et multimodal
Les plugins Vision, voix et multimodal donnent des yeux, des oreilles et une voix aux modèles DeepSeek texte seul de DeepSeek-Harness (dsh). Trouvez des outils de vision et des routes de fournisseur qui font l'OCR et décrivent les captures collées via Zhipu GLM, Gemini, Doubao ou Ollama en local, une saisie vocale au micro via la Web Speech API du navigateur ou des API compatibles Whisper, une lecture à voix haute avec Edge TTS ou des voix personnalisées, des modes vocaux full-duplex, et des générateurs d'images, de vidéos et de musique.
312 plugins trouvés
dsh-tts
goodandready/dsh-tts
Lit les réponses de l'agent dans l'interface web de DeepSeek Harness via une chaîne de secours de fournisseurs (OpenAI, ElevenLabs, Google, Azure, Groq, Deepgram, OpenRouter, Edge, Piper, eSpeak), de sorte qu'un fournisseur en échec ou limité en débit bascule vers le suivant au lieu de rester silencieux.
DSH-dseyes
okkay712/dsh-dseyes
Pièces jointes d'image natives pour DeepSeek en mode texte seul dans la Web GUI : les images collées ou déposées apparaissent sous forme de vignettes dans la session, et avant l'envoi l'hôte les lit avec l'API de vision gratuite Zhipu GLM-4V-Flash (chaîne de repli glm-4v-flash) et substitue la description, de sorte que DeepSeek répond sur l'image tandis que l'original est conservé dans l'historique.
dsh-wm
waynejin0918/dsh-wm
Boîte à outils de recherche sur les modèles du monde : inspecte les images, nomme les routes 3D/pixel/latentes, note pred vs GT, et compétences RSI / wm.yaml.
dsh-tool-visual-primitives
inkshadewoods/dsh-tool-visual-primitives
Analyse les images de conversation via des invites spécifiques au mode (caption, UI, document, grounding, topologie, etc.) et injecte des preuves structurées avec des primitives de coordonnées (boîtes, points, références) sous forme de texte, avec mise en cache au niveau de la session pour réutilisation lors du replay et de la compaction.
dsh-smart-input
v-quest123456/dsh-smart-input
Plugin d'entrée intelligente pour DeepSeek Harness — saisie vocale + optimisation des invites
dsh-vision-bridge
goodandready/dsh-vision-bridge
Achemine les images vers le modèle de vision de votre choix — réécriture automatique, outils explicites ou hybride — pour qu'un modèle de chat uniquement textuel n'échoue pas sur un tour contenant une image.
muxiva-dsh-voice
piyotahu/muxiva-dsh-voice
Voix full-duplex privilégiant le local pour DeepSeek Harness, orchestrée par Muxiva
dsh-voice-call
pandapolo/dsh-voice-call
Appels vocaux initiés par l’agent : `offer_call` fait sonner l’humain (接听/拒接/稍后再说) ; les appels acceptés sont synthétisés et lus localement via CrispASR + Qwen3-TTS (9 voix, 2 dialectes chinois), et les appels refusés renvoient la décision à l’agent.
dsh-fish-tts
mari23333/dsh-fish-tts
Lit à voix haute les réponses de l’assistant uniquement via l’API Fish Audio (clé à fournir soi-même) : lecture par message, bascule de lecture automatique et page de réglages pour le modèle, le reference_id de la voix, la clé API chiffrée et le proxy.
dsh-vision
xiaoshihou514/dsh-vision
Extension native de capacité de vision, utilisant soit Zhipu (gratuit) soit Qwen-VL (local).
dsh-vision-recognizer
kaixinbaba/dsh-vision-recognizer
Route de fournisseur de vision qui transcrit les images jointes en texte via un modèle configurable (plus de 15 fournisseurs compatibles OpenAI et Anthropic) tandis que DeepSeek continue de répondre.
dsh-open-eyes
hyp6666/dsh-open-eyes
Pont de vision pour les routes DeepSeek texte seul qui analyse les images jointes et locales via des endpoints configurables OpenAI Responses, Chat Completions ou Anthropic Messages, tout en laissant natives les routes capables d’image.
dsh-youreyes
54xkeee/dsh-youreyes
Boîte à outils de vision pour DeepSeek texte seul : outil `vision` appelable par le modèle, adaptateurs wrappers pour deepseek/opencode-go (v4 flash/pro), quota Antigravity IDE (default, flash/pro) / tout VLM compatible OpenAI / Gemini / canaux Ollama locaux, mémoire de preuves avec réhydratation par compactage, cache de hachage de contenu et panneau client bilingue.
dsh-vision (vision-tool)
314857493/dsh-vision
Outil `vision` appelable par le modèle pour DeepSeek Harness : décrit et applique l’OCR aux fichiers image en appelant directement l’API de vision Zhipu GLM gratuite (chaîne de repli glm-4v-flash), sans CLI externe requis.
dsh-vision (vision-route)
314857493/dsh-vision
Enregistre une route de fournisseur `deepseek-vision` : l’interface web accepte les images collées et les transcrit en texte via l’API de vision Zhipu GLM gratuite avant de passer à l’adaptateur DeepSeek.
dsh-vision-bridge
ximengxiaolan/dsh-vision-bridge
Les images jointes au composeur sont transcrites en texte par un modèle de vision compatible OpenAI avant d'atteindre les modèles DeepSeek texte seul.
dsh-live2d-voice
john-walks-slow/dsh-live2d-voice
Live2D session view with realtime voice: continuous voice input, streaming TTS, subtitle translation, multi-model catalog, standalone entry / Live2D 实时语音会话视图:连续语音输入、流式 TTS、字幕翻译、多模型目录、独立入口
dsh-multi-tts
wyr-233/dsh-multi-tts
Per-reply read-aloud with a multi-provider settings page — MiniMax or any OpenAI-compatible /audio/speech endpoint, with voice, emotion, speed and model selection plus an auto-read toggle.
dsh-live-voice
victorwads/dsh-live-voice
Local-first voice conversations for DSH, with local speech recognition and synthesis and optional external providers.
dsh-vision-autoswitch
cultofluna/dsh-vision-autoswitch
DeepSeek Harness plugin: auto-route image-bearing requests to deepseek-v4-flash-vision-exp, then fall back to the original model.
dsh-dictate
navneetset/dsh-dictate
Live speech-to-text dictation into the dsh web composer via OpenRouter STT
dsh-minimax-asr
moluyao/dsh-minimax-asr
MiniMax 语音识别(asr-1.0)+ 语音合成(speech-2.8-hd)的 DeepSeek Harness 全局插件:转写工具、任务结束后用喇叭念一句的播报、实时免手对话、303 个音色可选
dsh-imgdraw
ninjasln-labs/dsh-imgdraw
Text-to-image for DeepSeek Harness: a `draw_image` model tool, an input-bar 生图 button with a prompt popup (async generation, 4-grid results, download / keep / delete), an /imgdraw image route, and persisted history. Backends: DashScope wan2.7-image (free
dsh-voice-talk
duoduoqian708/dsh-voice-talk
Voice conversation mode for the DSH Web GUI: tap the mic to start a full-screen call, talk hands-free, and hear each reply read aloud as it streams. Bilingual (Chinese/English) UI, light and dark themes, adjustable speech rate, and switchable voices.