Перейти к основному содержимому

Зрение, голос и мультимодальность

Плагины «Зрение, голос и мультимодальность» дают текстовым моделям DeepSeek в DeepSeek-Harness (dsh) глаза, уши и голос. Здесь есть инструменты зрения и провайдерские маршруты, которые распознают и описывают вставленные скриншоты через Zhipu GLM, Gemini, Doubao или локальный Ollama, голосовой ввод с микрофона через браузерный Web Speech API или Whisper-совместимые API, озвучивание ответов с помощью Edge TTS или собственных голосов, полнодуплексные голосовые режимы, а также генераторы изображений, видео и музыки.

Найдено плагинов: 312

A

dsh-voice-kit

aaaadrop/dsh-voice-kit

Голосовой ввод (Web Speech API) и озвучивание ответов (speechSynthesis) для веб-интерфейса DeepSeek Harness — DSH набор голосового ввода + озвучивания ответов.

1в прошлом месяцеЗрение, голос и мультимодальностьMIT
E

dsh-sight

ericfetch/dsh-sight

Плагин для DeepSeek Harness: прямые декларации передачи мультимодальных изображений + очистка изображений по сессии (surface replace), со страницей настроек и элементами управления в поле ввода.

1в прошлом месяцеЗрение, голос и мультимодальностьMIT
H

dsh-open-file

hyper-dsh-plugins/dsh-open-file

Привязанная к рабочей области произвольная загрузка файлов, чтение, OCR и отрисовка для DeepSeek Harness.

1в прошлом месяцеЗрение, голос и мультимодальностьMIT
Y

dsh-multimodal

yauntyour/dsh-multimodal

Мультимодальные цепочки по типу файла: предустановленные модели обработки для каждого шаблона преобразуют изображения, видео и аудио в токены промпта до того, как они попадут в текстовую модель сессии, с цепочками отказов для каждого пресета и страницей настроек Multimodal.

12 месяца назадЗрение, голос и мультимодальностьMIT
L

dsh-voice-input

lhenlihai-hub/dsh-voice-input

12 месяца назадЗрение, голос и мультимодальностьMIT
A

dsh-vision-bridge

acc1143/dsh-vision-bridge

Плагин двухмодельной маршрутизации для DSH: основной диалог остаётся в DeepSeek, задачи с изображениями автоматически уходят в явно заданную визуальную модель, а результат анализа возвращается в DeepSeek для продолжения.

12 месяца назадЗрение, голос и мультимодальностьMIT
3

dsh-vision

314857493/dsh-vision

Плагин DeepSeek Harness: маршрут `deepseek-vision`, который объявляет ввод изображений и распознаёт вставленные изображения через бесплатные модели зрения Zhipu GLM, прежде чем передать управление адаптеру DeepSeek.

12 месяца назадЗрение, голос и мультимодальностьMIT
A

dsh-image-plugins

alanzhao0128/dsh-image-plugins

Мультимодальный плагин для DeepSeek Harness: понимает изображения и генерирует изображения через настраиваемые OpenAI-совместимые или DashScope эндпоинты.

12 месяца назадЗрение, голос и мультимодальностьMIT
Z

dsh-plugins

zjcdkj/dsh-plugins

Внешний плагин DeepSeek Harness: даёт текстовой модели кодинга зрение, маршрутизируя изображения в маршрут Qwen-VL (DashScope) через ctx.llm и возвращая текст.

12 месяца назадЗрение, голос и мультимодальностьMIT
H

dsh-open-file

hyp6666/dsh-open-file

Привязанная к рабочему пространству произвольная загрузка, чтение, OCR и рендеринг файлов для DeepSeek Harness.

12 месяца назадЗрение, голос и мультимодальностьMIT
X

dsh-image-vision

xsoc1/dsh-image-vision

Мост вложений-изображений в чате с инструментом view_image для любой OpenAI-совместимой VLM (локальная Ollama или облако): вставленные/перетащенные изображения становятся маркерами путей view_image, прежде чем достичь текстовых моделей DeepSeek.

12 месяца назадЗрение, голос и мультимодальность
W

mimo-vision

wulusai2333/mimo-vision

Инструмент `describe_image`: мост зрения, отправляющий изображения в mimo-v2.5 через API opencode Zen (учётные данные `OPENCODE_GO_API_KEY`, сначала бесплатный маршрут с платным запасным) и возвращающий текстовые описания для текстовых моделей, с нативным пробросом и перекодированием SVG/TIFF/HEIC через ImageMagick.

12 месяца назадЗрение, голос и мультимодальностьMIT
W

dsh-tool-vision

wanshichenguang/dsh-tool-vision

Инструмент image_describe (识图) для модели поверх OpenAI-совместимого API DashScope (qwen3.7-flash) плюс мост вставки: в текстовых сессиях вставленные изображения автоматически превращаются в пути к файлам при отправке и отрисовываются обратно в транскрипте, так что никогда не спотыкаются о допуск изображений. Свой DASHSCOPE_API_KEY; эндпоинт/модель/бюджеты настраиваются, HTTP-клиент устойчив к редиректам, работает во всех agent preset.

12 месяца назадЗрение, голос и мультимодальностьMIT
R

dsh-vision-subagent

ruby1304/dsh-vision-subagent

Зрение для любого маршрута DSH: вставляйте изображения в веб-композер с автоанализом по намерению, делегируйте чтение изображений рабочего пространства субагенту зрения Kimi/MiniMax и материализуйте вставленные оригиналы для правки.

123 дня назадЗрение, голос и мультимодальностьMIT
N

dsh-auto-vision

normanfxxkingrockwell/dsh-auto-vision

Мост зрения с автообнаружением для текстовых агентов DeepSeek Harness: автоматически находит модель, умеющую работать с изображениями, среди ваших настроенных провайдеров и возвращает описания картинок обычным текстом через инструмент зрения.

118 дней назадЗрение, голос и мультимодальностьMIT
N

dsh-llm-deepseek-vision

nagasakisoyo-ui/dsh-llm-deepseek-vision

Адаптер DeepSeek с поддержкой зрения: модель со зрением описывает входное изображение, а затем текстовая модель DeepSeek рассуждает по этому описанию.

12 месяца назадЗрение, голос и мультимодальностьMIT
L

dsh-eyes

leeminjing/dsh-eyes

Зрение по требованию для текстовых моделей DeepSeek: загрузите изображения, и модель вызовет инструмент view_image, опирающийся на любой OpenAI-совместимый endpoint зрения (по умолчанию Qwen/DashScope).

12 месяца назадЗрение, голос и мультимодальностьMIT
K

dsh-mindseye

kanchengw/dsh-mindseye

Плагинное зрение для текстовых моделей в DSH: нативное взаимодействие для понимания и генерации изображений, автоматизация GUI, многоуровневая память доказательств и кэш.

1в прошлом месяцеЗрение, голос и мультимодальностьMIT
G

dsh-tool-vision

gloryxpnv/dsh-tool-vision

Локальное структурированное зрение для текстовых агентов: изображения уходят в локальный OpenAI-совместимый VLM и возвращаются как JSON-доказательства (сводка, дословный OCR, области вёрстки, сущности и связи, цвета, явная неуверенность), с защитой от галлюцинаций и необязательным мостом вставки и загрузки; без облачных затрат, изображения не покидают машину.

12 месяца назадЗрение, голос и мультимодальностьMIT
E

dsh-plugin-mm-vision

elohia/dsh-plugin-mm-vision

Кодировщик синестезии для DSH: модель зрения переводит изображения в компактный структурированный пространственный текст (холст/элементы/координаты в процентах), давая текстовым LLM понимание изображений на уровне пикселей через инструмент `mm_vision`.

12 месяца назадЗрение, голос и мультимодальностьMIT
C

dsh-deepseek-vision

cheng-cheng9669/dsh-deepseek-vision

Переиспользует встроенный режим зрения DeepSeek web для текстовых моделей: инструмент deepseek_vision управляет локальной браузерной автоматизацией deepseek-vision-cli (помощник ручного входа, включённый deep-think, автозакрытие браузера) и возвращает описания изображений текстом.

12 месяца назадЗрение, голос и мультимодальностьMIT
1

dsh-vision-fallback

1helloman1/dsh-vision-fallback

Направляет изображения из чата в фиксированную OpenAI-совместимую модель зрения, возвращает фактические наблюдения выбранной основной модели и переиспользует наблюдения в рамках сессии при повторах, сжатии и перезапусках.

1в прошлом месяцеЗрение, голос и мультимодальностьMIT
Z

dsh-voice

zhuiyueya/dsh-voice

Голос для DeepSeek Harness (dsh) — ввод речи в текст + озвучивание через TTS для текстовых моделей DeepSeek, без API-ключа.

12 месяца назадЗрение, голос и мультимодальностьMIT
S

multimodal-bridge

spirit4471/multimodal-bridge

Набор плагинов DeepSeek Harness: инструменты qwen_vision (понимание изображений через Qwen-VL) и qwen_generate (text-to-image через Qwen-Image) для текстовых моделей

12 месяца назадЗрение, голос и мультимодальностьMIT