Перейти к основному содержимому

Зрение, голос и мультимодальность

Плагины «Зрение, голос и мультимодальность» дают текстовым моделям DeepSeek в DeepSeek-Harness (dsh) глаза, уши и голос. Здесь есть инструменты зрения и провайдерские маршруты, которые распознают и описывают вставленные скриншоты через Zhipu GLM, Gemini, Doubao или локальный Ollama, голосовой ввод с микрофона через браузерный Web Speech API или Whisper-совместимые API, озвучивание ответов с помощью Edge TTS или собственных голосов, полнодуплексные голосовые режимы, а также генераторы изображений, видео и музыки.

Найдено плагинов: 312

H

dsh-vision-mix

haiziyao/dsh-vision-mix

Объединяет текстовые, зрительные и генеративные API изображений в одну Mix-модель с автоматической маршрутизацией: текстовые запросы идут в чат-модель, изображения пользователя и скриншоты агента — в зрительную модель, продолжения используют то же изображение сессии, а агенты могут генерировать или редактировать изображения с историей вызовов в рамках сессии.

324 дня назадЗрение, голос и мультимодальностьMIT
O

dsh-ernie-image

omdsh-dev/dsh-ernie-image

32 месяца назадЗрение, голос и мультимодальностьBSD-3-Clause
Z

openflowframes

zerohackz/openflowframes

32 месяца назадЗрение, голос и мультимодальностьGPL-3.0
O

dsh-paddle-ocr

omdsh-dev/dsh-paddle-ocr

32 месяца назадЗрение, голос и мультимодальностьBSD-3-Clause
H

dsh-plugin-aigc-canvas

huanlinoto/dsh-plugin-aigc-canvas

Независимый от провайдера HTTP-мост AIGC + бесконечный холст + постобработка через ffmpeg; 13 инструментов, включая связи на холсте/reroll/редактирование медиа.

32 месяца назадЗрение, голос и мультимодальность
J

dsh-voice

jesse-njx/dsh-voice

Голосовые заметки на входе, озвученные ответы на выходе: надиктуйте аудио, которое становится сообщением пользователя (транскрипция), пусть агент читает ответы вслух (озвучивание), локально в ~/.dsh/voice.

32 месяца назадЗрение, голос и мультимодальностьMIT
E

dsh-llm-vision-bridge

einskyle/dsh-llm-vision-bridge

Нативный vision-мост провайдера LLM: изображения, вставленные в чат, описываются vision-моделью (Qwen3-VL через pi-ai/llama.cpp), а текстовое описание передаётся текстовой модели DeepSeek для ответа — приём изображений, маршрутизация и сжатие идут через нативные механизмы harness, с LRU-кэшем описаний и повтором при 503.

32 месяца назадЗрение, голос и мультимодальностьMIT
Q

dsh-mic-input

qt-chen/dsh-mic-input

Голосовой ввод с микрофона для composer: транскрипция в реальном времени через Web Speech API браузера, дедупликация/автопродолжение, умная пунктуация, настройки языка и автоотправки.

32 месяца назадЗрение, голос и мультимодальностьMIT
H

dsh-open-eyes

hyper-dsh-plugins/dsh-open-eyes

Мост компьютерного зрения для текстовых маршрутов DeepSeek, который анализирует прикреплённые и локальные изображения через настраиваемые эндпоинты OpenAI Responses, Chat Completions или Anthropic Messages, оставляя маршруты с поддержкой изображений нативными.

227 дней назадЗрение, голос и мультимодальностьMIT
C

dsh-gpt-image

cai-mh/dsh-gpt-image

Генерирует изображения через веб-сессию ChatGPT с выполненным входом и скачивает их в локальный каталог.

224 дня назадЗрение, голос и мультимодальностьMIT
M

dsh-ui-mockup

mackwan84/dsh-ui-mockup

Consumer инструмента ui_mockup: на этапе обсуждения создаёт вайрфреймы и высокодетальные наброски UI, сохраняет дизайн на диск, запрашивает подтверждение и после него фиксирует спецификацию дизайна; включает клиентские карточки, маршрутизацию изображений и i18n.

222 дня назадЗрение, голос и мультимодальностьMIT
B

dsh-voice-call

biliye/dsh-voice-call

Голосовой ассистент звонков для веб-GUI DSH: перетаскиваемый плавающий шар звонка, VAD на стороне браузера, отправляющий каждую фразу после паузы, распознавание речи FunASR по HTTP или потоково, ответы TTS от MiniMax или совместимые с OpenAI, необязательный режим слова-активатора с автосном и отправка задач в отдельные сессии субагентов с прогрессом, остановкой и озвученными отчётами о завершении.

25 дней назадЗрение, голос и мультимодальностьMIT
Y

dsh-tool-lipsync

yu-wenchao/dsh-tool-lipsync

Бесплатный плагин генерации видео с липсинком для DSH с 3000+ голосами и 500+ языками.

228 дней назадЗрение, голос и мультимодальностьMIT
B

dsh-vision-plugin

bug-huntter/dsh-vision-plugin

Настраиваемое распознавание изображений для текстовых моделей DSH: изображения сначала транскрибируются моделью vision, совместимой с OpenAI (базовый URL, идентификатор модели и API-ключ задаются в разделе настроек), а затем передаются основной модели в виде текста, при этом заявляется поддержка ввода изображений. Схема аутентификации по API-ключу выбирается (заголовки запросов в стиле OpenAI, Anthropic, Gemini или Azure), а отсутствие ключа сообщается до отправки любого запроса.

25 дней назадЗрение, голос и мультимодальностьMIT
B

dseyesopen

balue8246-maker/dseyesopen

Мост vision для текстового DeepSeek: отправляйте изображения (отдельно или вместе с текстом), и быстрая маленькая модель vision описывает их за кулисами; чат сохраняет картинку, а DeepSeek видит только текст. Чистый плагин: удаление восстанавливает всё как было.

2в прошлом месяцеЗрение, голос и мультимодальность
L

dsh-visibridge

lhbsaa/dsh-visibridge

Структурированные визуальные доказательства (OCR/разметка/семантика), а также инструмент захвата с USB-камеры для цикла отладки «снимок-анализ-корректировка»; бэкенды: Ollama, DeepSeek, Xiaomi.

2в прошлом месяцеЗрение, голос и мультимодальностьMIT
F

dsh-short-video-studio

fengyungithub/dsh-short-video-studio

Рабочая станция для создания ИИ-видео в стиле MiniMax-Design на базе DeepSeek Harness.

2в прошлом месяцеЗрение, голос и мультимодальностьApache-2.0
Z

dsh-watch-video

zeshuochen/dsh-watch-video

Транскрипция видео с приоритетом субтитров и экспортом в SRT, управлением задачами с возможностью отмены и резервным вариантом faster-whisper large-v3, когда субтитры недоступны.

2в прошлом месяцеЗрение, голос и мультимодальность
W

dsh-voice-agent (voice-app)

wayneyu430/dsh-voice-agent

Разговорный голосовой фронтенд-агент для dsh: говорите естественно через ByteDance Duplex, делегируйте запросы фоновым задачам и слышите их асинхронные результаты, сообщаемые голосом.

2в прошлом месяцеЗрение, голос и мультимодальность
M

dsh-voice-chat

maoyuching/dsh-voice-chat

Голосовой чат в стиле Doubao для DSH: удержание микрофона в поле ввода преобразует речь в текст и отправляет автоматически, а ответы ИИ озвучиваются. Необязательное сжатие с помощью LLM (длинные ответы сводятся к коротким озвучиваемым репликам в соответствии с моделью текущего диалога), очистка текста для TTS, выбираемые голоса Edge TTS, настраиваемая автоостановка по тишине, а настройки встроены в диалог настроек DSH.

28 дней назадЗрение, голос и мультимодальностьMIT
Y

phone-lens (phone-lens)

yxqfg/phone-lens

Превращает камеру телефона в живой видоискатель и фотоввод для вашей сессии dsh, по LAN или USB.

23 дня назадЗрение, голос и мультимодальностьMIT
M

dsh-capture

max-null/dsh-capture

Захват экрана на двух движках для DSH: внутри настольной оболочки SSiD глобальная горячая клавиша или значок в трее открывает полноэкранное оверлейное выделение рамкой (все мониторы, попиксельно точные кадры для каждого экрана) с аннотированием красной рамкой прямо на месте и панелью инструментов в стиле WeChat; в обычном DSH (браузер) кнопка камеры в поле ввода захватывает экран через getDisplayMedia и повторно использует в странице то же однофазное оверлейное выделение рамкой + аннотирование. Обрезанное изображение попадает в поле ввода текущего диалога через официальный канал приёма вложений.

24 дня назадЗрение, голос и мультимодальностьMIT
Y

phone-lens (lens-mate)

yxqfg/phone-lens

Превращает камеру телефона в видоискатель реального времени и источник фото для вашей сессии dsh по LAN или USB.

2в прошлом месяцеЗрение, голос и мультимодальностьMIT
E

dsh-labnana

exoticknight/dsh-labnana

Генерация изображений Labnana для DeepSeek Harness: текст-в-картинку / картинка-в-картинку / точное редактирование с оценкой кредитов, балансом подписки и веб-интерфейсом настроек.

29 дней назадЗрение, голос и мультимодальностьApache-2.0