Зрение, голос и мультимодальность
Плагины «Зрение, голос и мультимодальность» дают текстовым моделям DeepSeek в DeepSeek-Harness (dsh) глаза, уши и голос. Здесь есть инструменты зрения и провайдерские маршруты, которые распознают и описывают вставленные скриншоты через Zhipu GLM, Gemini, Doubao или локальный Ollama, голосовой ввод с микрофона через браузерный Web Speech API или Whisper-совместимые API, озвучивание ответов с помощью Edge TTS или собственных голосов, полнодуплексные голосовые режимы, а также генераторы изображений, видео и музыки.
Найдено плагинов: 312
dsh-voice-kit
aaaadrop/dsh-voice-kit
Голосовой ввод (Web Speech API) и озвучивание ответов (speechSynthesis) для веб-интерфейса DeepSeek Harness — DSH набор голосового ввода + озвучивания ответов.
dsh-sight
ericfetch/dsh-sight
Плагин для DeepSeek Harness: прямые декларации передачи мультимодальных изображений + очистка изображений по сессии (surface replace), со страницей настроек и элементами управления в поле ввода.
dsh-open-file
hyper-dsh-plugins/dsh-open-file
Привязанная к рабочей области произвольная загрузка файлов, чтение, OCR и отрисовка для DeepSeek Harness.
dsh-multimodal
yauntyour/dsh-multimodal
Мультимодальные цепочки по типу файла: предустановленные модели обработки для каждого шаблона преобразуют изображения, видео и аудио в токены промпта до того, как они попадут в текстовую модель сессии, с цепочками отказов для каждого пресета и страницей настроек Multimodal.
dsh-voice-input
lhenlihai-hub/dsh-voice-input
dsh-vision-bridge
acc1143/dsh-vision-bridge
Плагин двухмодельной маршрутизации для DSH: основной диалог остаётся в DeepSeek, задачи с изображениями автоматически уходят в явно заданную визуальную модель, а результат анализа возвращается в DeepSeek для продолжения.
dsh-vision
314857493/dsh-vision
Плагин DeepSeek Harness: маршрут `deepseek-vision`, который объявляет ввод изображений и распознаёт вставленные изображения через бесплатные модели зрения Zhipu GLM, прежде чем передать управление адаптеру DeepSeek.
dsh-image-plugins
alanzhao0128/dsh-image-plugins
Мультимодальный плагин для DeepSeek Harness: понимает изображения и генерирует изображения через настраиваемые OpenAI-совместимые или DashScope эндпоинты.
dsh-plugins
zjcdkj/dsh-plugins
Внешний плагин DeepSeek Harness: даёт текстовой модели кодинга зрение, маршрутизируя изображения в маршрут Qwen-VL (DashScope) через ctx.llm и возвращая текст.
dsh-open-file
hyp6666/dsh-open-file
Привязанная к рабочему пространству произвольная загрузка, чтение, OCR и рендеринг файлов для DeepSeek Harness.
dsh-image-vision
xsoc1/dsh-image-vision
Мост вложений-изображений в чате с инструментом view_image для любой OpenAI-совместимой VLM (локальная Ollama или облако): вставленные/перетащенные изображения становятся маркерами путей view_image, прежде чем достичь текстовых моделей DeepSeek.
mimo-vision
wulusai2333/mimo-vision
Инструмент `describe_image`: мост зрения, отправляющий изображения в mimo-v2.5 через API opencode Zen (учётные данные `OPENCODE_GO_API_KEY`, сначала бесплатный маршрут с платным запасным) и возвращающий текстовые описания для текстовых моделей, с нативным пробросом и перекодированием SVG/TIFF/HEIC через ImageMagick.
dsh-tool-vision
wanshichenguang/dsh-tool-vision
Инструмент image_describe (识图) для модели поверх OpenAI-совместимого API DashScope (qwen3.7-flash) плюс мост вставки: в текстовых сессиях вставленные изображения автоматически превращаются в пути к файлам при отправке и отрисовываются обратно в транскрипте, так что никогда не спотыкаются о допуск изображений. Свой DASHSCOPE_API_KEY; эндпоинт/модель/бюджеты настраиваются, HTTP-клиент устойчив к редиректам, работает во всех agent preset.
dsh-vision-subagent
ruby1304/dsh-vision-subagent
Зрение для любого маршрута DSH: вставляйте изображения в веб-композер с автоанализом по намерению, делегируйте чтение изображений рабочего пространства субагенту зрения Kimi/MiniMax и материализуйте вставленные оригиналы для правки.
dsh-auto-vision
normanfxxkingrockwell/dsh-auto-vision
Мост зрения с автообнаружением для текстовых агентов DeepSeek Harness: автоматически находит модель, умеющую работать с изображениями, среди ваших настроенных провайдеров и возвращает описания картинок обычным текстом через инструмент зрения.
dsh-llm-deepseek-vision
nagasakisoyo-ui/dsh-llm-deepseek-vision
Адаптер DeepSeek с поддержкой зрения: модель со зрением описывает входное изображение, а затем текстовая модель DeepSeek рассуждает по этому описанию.
dsh-eyes
leeminjing/dsh-eyes
Зрение по требованию для текстовых моделей DeepSeek: загрузите изображения, и модель вызовет инструмент view_image, опирающийся на любой OpenAI-совместимый endpoint зрения (по умолчанию Qwen/DashScope).
dsh-mindseye
kanchengw/dsh-mindseye
Плагинное зрение для текстовых моделей в DSH: нативное взаимодействие для понимания и генерации изображений, автоматизация GUI, многоуровневая память доказательств и кэш.
dsh-tool-vision
gloryxpnv/dsh-tool-vision
Локальное структурированное зрение для текстовых агентов: изображения уходят в локальный OpenAI-совместимый VLM и возвращаются как JSON-доказательства (сводка, дословный OCR, области вёрстки, сущности и связи, цвета, явная неуверенность), с защитой от галлюцинаций и необязательным мостом вставки и загрузки; без облачных затрат, изображения не покидают машину.
dsh-plugin-mm-vision
elohia/dsh-plugin-mm-vision
Кодировщик синестезии для DSH: модель зрения переводит изображения в компактный структурированный пространственный текст (холст/элементы/координаты в процентах), давая текстовым LLM понимание изображений на уровне пикселей через инструмент `mm_vision`.
dsh-deepseek-vision
cheng-cheng9669/dsh-deepseek-vision
Переиспользует встроенный режим зрения DeepSeek web для текстовых моделей: инструмент deepseek_vision управляет локальной браузерной автоматизацией deepseek-vision-cli (помощник ручного входа, включённый deep-think, автозакрытие браузера) и возвращает описания изображений текстом.
dsh-vision-fallback
1helloman1/dsh-vision-fallback
Направляет изображения из чата в фиксированную OpenAI-совместимую модель зрения, возвращает фактические наблюдения выбранной основной модели и переиспользует наблюдения в рамках сессии при повторах, сжатии и перезапусках.
dsh-voice
zhuiyueya/dsh-voice
Голос для DeepSeek Harness (dsh) — ввод речи в текст + озвучивание через TTS для текстовых моделей DeepSeek, без API-ключа.
multimodal-bridge
spirit4471/multimodal-bridge
Набор плагинов DeepSeek Harness: инструменты qwen_vision (понимание изображений через Qwen-VL) и qwen_generate (text-to-image через Qwen-Image) для текстовых моделей