Зрение, голос и мультимодальность
Плагины «Зрение, голос и мультимодальность» дают текстовым моделям DeepSeek в DeepSeek-Harness (dsh) глаза, уши и голос. Здесь есть инструменты зрения и провайдерские маршруты, которые распознают и описывают вставленные скриншоты через Zhipu GLM, Gemini, Doubao или локальный Ollama, голосовой ввод с микрофона через браузерный Web Speech API или Whisper-совместимые API, озвучивание ответов с помощью Edge TTS или собственных голосов, полнодуплексные голосовые режимы, а также генераторы изображений, видео и музыки.
Найдено плагинов: 312
dsh-tts
goodandready/dsh-tts
Озвучивает ответы агента в веб-интерфейсе DeepSeek Harness через цепочку отката между провайдерами (OpenAI, ElevenLabs, Google, Azure, Groq, Deepgram, OpenRouter, Edge, Piper, eSpeak), так что сбойный или ограниченный по частоте провайдер передаёт эстафету следующему, а не замолкает.
DSH-dseyes
okkay712/dsh-dseyes
Нативные прикреплённые изображения для текстового DeepSeek в Web GUI: вставленные или перетащенные изображения отображаются в виде миниатюр в сессии, и перед отправкой хост считывает их с помощью бесплатного API визуального распознавания Zhipu GLM-4V-Flash (цепочка отката glm-4v-flash) и подставляет описание, благодаря чему DeepSeek отвечает об изображении, а оригинал сохраняется в истории.
dsh-wm
waynejin0918/dsh-wm
Инструментарий для исследования мировых моделей: инспектирует кадры, именует 3D/пиксельные/латентные маршруты, оценивает pred против GT, навыки RSI / wm.yaml.
dsh-tool-visual-primitives
inkshadewoods/dsh-tool-visual-primitives
Анализирует изображения из диалогов с помощью мод-специфичных промптов (caption, UI, document, grounding, topology и т.д.) и внедряет структурированные доказательства с примитивами координат (боксы, точки, ссылки) в виде текста, с кэшированием на уровне сессии для повторного использования при replay и compaction.
dsh-smart-input
v-quest123456/dsh-smart-input
Плагин умного ввода для DeepSeek Harness — голосовой ввод + оптимизация промптов
dsh-vision-bridge
goodandready/dsh-vision-bridge
Направляет изображения в выбранную вами модель компьютерного зрения — авто-перезапись, явные инструменты или гибридный режим — чтобы текстовый чат-модель не срывала ход, в котором есть картинка.
muxiva-dsh-voice
piyotahu/muxiva-dsh-voice
Локально-ориентированная полнодуплексная голосовая связь для DeepSeek Harness, оркестрируемая Muxiva
dsh-voice-call
pandapolo/dsh-voice-call
Голосовые звонки, инициируемые агентом: `offer_call` звонит человеку (接听/拒接/稍后再说); принятые звонки синтезируются и воспроизводятся локально через CrispASR + Qwen3-TTS (9 голосов, 2 китайских диалекта), а отклонённые возвращают решение агенту.
dsh-fish-tts
mari23333/dsh-fish-tts
Озвучивает ответы ассистента только через Fish Audio API (ключ нужен свой): чтение по каждому сообщению, переключатель автопрочтения и страница настроек для модели, voice reference_id, зашифрованного API-ключа и прокси.
dsh-vision
xiaoshihou514/dsh-vision
Нативное расширение возможностей зрения, использующее либо Zhipu (бесплатно), либо Qwen-VL (локально).
dsh-vision-recognizer
kaixinbaba/dsh-vision-recognizer
Маршрут визуального поставщика, который преобразует прикреплённые изображения в текст через настраиваемую модель (более 15 совместимых с OpenAI и Anthropic поставщиков), пока DeepSeek продолжает отвечать.
dsh-open-eyes
hyp6666/dsh-open-eyes
Визуальный мост для текстовых маршрутов DeepSeek, который анализирует прикреплённые и локальные изображения через настраиваемые endpoints OpenAI Responses, Chat Completions или Anthropic Messages, оставляя image-capable маршруты нативными.
dsh-youreyes
54xkeee/dsh-youreyes
Набор инструментов vision для текстового DeepSeek: вызываемый моделью инструмент `vision`, обёртки-адаптеры для deepseek/opencode-go (v4 flash/pro), квота Antigravity IDE (default, flash/pro) / любой совместимый с OpenAI VLM / Gemini / локальные каналы Ollama, память доказательств с ре-гидратацией после компактации, кеш хеша содержимого и двуязычная клиентская панель.
dsh-vision (vision-tool)
314857493/dsh-vision
Вызываемый моделью инструмент `vision` для DeepSeek Harness: описывает и распознаёт текст на файлах изображений, напрямую вызывая бесплатный Zhipu GLM vision API (цепочка fallback glm-4v-flash), без внешнего CLI.
dsh-vision (vision-route)
314857493/dsh-vision
Регистрирует маршрут провайдера `deepseek-vision`: веб-интерфейс принимает вставленные изображения и преобразует их в текст через бесплатный Zhipu GLM vision API, после чего передаёт в адаптер DeepSeek.
dsh-vision-bridge
ximengxiaolan/dsh-vision-bridge
Изображения, прикреплённые в composer, распознаются в текст vision-моделью, совместимой с OpenAI, прежде чем попасть к текстовым моделям DeepSeek.
dsh-live2d-voice
john-walks-slow/dsh-live2d-voice
Live2D session view with realtime voice: continuous voice input, streaming TTS, subtitle translation, multi-model catalog, standalone entry / Live2D 实时语音会话视图:连续语音输入、流式 TTS、字幕翻译、多模型目录、独立入口
dsh-multi-tts
wyr-233/dsh-multi-tts
Per-reply read-aloud with a multi-provider settings page — MiniMax or any OpenAI-compatible /audio/speech endpoint, with voice, emotion, speed and model selection plus an auto-read toggle.
dsh-live-voice
victorwads/dsh-live-voice
Local-first voice conversations for DSH, with local speech recognition and synthesis and optional external providers.
dsh-vision-autoswitch
cultofluna/dsh-vision-autoswitch
DeepSeek Harness plugin: auto-route image-bearing requests to deepseek-v4-flash-vision-exp, then fall back to the original model.
dsh-dictate
navneetset/dsh-dictate
Live speech-to-text dictation into the dsh web composer via OpenRouter STT
dsh-minimax-asr
moluyao/dsh-minimax-asr
MiniMax 语音识别(asr-1.0)+ 语音合成(speech-2.8-hd)的 DeepSeek Harness 全局插件:转写工具、任务结束后用喇叭念一句的播报、实时免手对话、303 个音色可选
dsh-imgdraw
ninjasln-labs/dsh-imgdraw
Text-to-image for DeepSeek Harness: a `draw_image` model tool, an input-bar 生图 button with a prompt popup (async generation, 4-grid results, download / keep / delete), an /imgdraw image route, and persisted history. Backends: DashScope wan2.7-image (free
dsh-voice-talk
duoduoqian708/dsh-voice-talk
Voice conversation mode for the DSH Web GUI: tap the mic to start a full-screen call, talk hands-free, and hear each reply read aloud as it streams. Bilingual (Chinese/English) UI, light and dark themes, adjustable speech rate, and switchable voices.