Зрение, голос и мультимодальность
Плагины «Зрение, голос и мультимодальность» дают текстовым моделям DeepSeek в DeepSeek-Harness (dsh) глаза, уши и голос. Здесь есть инструменты зрения и провайдерские маршруты, которые распознают и описывают вставленные скриншоты через Zhipu GLM, Gemini, Doubao или локальный Ollama, голосовой ввод с микрофона через браузерный Web Speech API или Whisper-совместимые API, озвучивание ответов с помощью Edge TTS или собственных голосов, полнодуплексные голосовые режимы, а также генераторы изображений, видео и музыки.
Найдено плагинов: 312
dsh-vision-mix
haiziyao/dsh-vision-mix
Объединяет текстовые, зрительные и генеративные API изображений в одну Mix-модель с автоматической маршрутизацией: текстовые запросы идут в чат-модель, изображения пользователя и скриншоты агента — в зрительную модель, продолжения используют то же изображение сессии, а агенты могут генерировать или редактировать изображения с историей вызовов в рамках сессии.
dsh-ernie-image
omdsh-dev/dsh-ernie-image
openflowframes
zerohackz/openflowframes
dsh-paddle-ocr
omdsh-dev/dsh-paddle-ocr
dsh-plugin-aigc-canvas
huanlinoto/dsh-plugin-aigc-canvas
Независимый от провайдера HTTP-мост AIGC + бесконечный холст + постобработка через ffmpeg; 13 инструментов, включая связи на холсте/reroll/редактирование медиа.
dsh-voice
jesse-njx/dsh-voice
Голосовые заметки на входе, озвученные ответы на выходе: надиктуйте аудио, которое становится сообщением пользователя (транскрипция), пусть агент читает ответы вслух (озвучивание), локально в ~/.dsh/voice.
dsh-llm-vision-bridge
einskyle/dsh-llm-vision-bridge
Нативный vision-мост провайдера LLM: изображения, вставленные в чат, описываются vision-моделью (Qwen3-VL через pi-ai/llama.cpp), а текстовое описание передаётся текстовой модели DeepSeek для ответа — приём изображений, маршрутизация и сжатие идут через нативные механизмы harness, с LRU-кэшем описаний и повтором при 503.
dsh-mic-input
qt-chen/dsh-mic-input
Голосовой ввод с микрофона для composer: транскрипция в реальном времени через Web Speech API браузера, дедупликация/автопродолжение, умная пунктуация, настройки языка и автоотправки.
dsh-open-eyes
hyper-dsh-plugins/dsh-open-eyes
Мост компьютерного зрения для текстовых маршрутов DeepSeek, который анализирует прикреплённые и локальные изображения через настраиваемые эндпоинты OpenAI Responses, Chat Completions или Anthropic Messages, оставляя маршруты с поддержкой изображений нативными.
dsh-gpt-image
cai-mh/dsh-gpt-image
Генерирует изображения через веб-сессию ChatGPT с выполненным входом и скачивает их в локальный каталог.
dsh-ui-mockup
mackwan84/dsh-ui-mockup
Consumer инструмента ui_mockup: на этапе обсуждения создаёт вайрфреймы и высокодетальные наброски UI, сохраняет дизайн на диск, запрашивает подтверждение и после него фиксирует спецификацию дизайна; включает клиентские карточки, маршрутизацию изображений и i18n.
dsh-voice-call
biliye/dsh-voice-call
Голосовой ассистент звонков для веб-GUI DSH: перетаскиваемый плавающий шар звонка, VAD на стороне браузера, отправляющий каждую фразу после паузы, распознавание речи FunASR по HTTP или потоково, ответы TTS от MiniMax или совместимые с OpenAI, необязательный режим слова-активатора с автосном и отправка задач в отдельные сессии субагентов с прогрессом, остановкой и озвученными отчётами о завершении.
dsh-tool-lipsync
yu-wenchao/dsh-tool-lipsync
Бесплатный плагин генерации видео с липсинком для DSH с 3000+ голосами и 500+ языками.
dsh-vision-plugin
bug-huntter/dsh-vision-plugin
Настраиваемое распознавание изображений для текстовых моделей DSH: изображения сначала транскрибируются моделью vision, совместимой с OpenAI (базовый URL, идентификатор модели и API-ключ задаются в разделе настроек), а затем передаются основной модели в виде текста, при этом заявляется поддержка ввода изображений. Схема аутентификации по API-ключу выбирается (заголовки запросов в стиле OpenAI, Anthropic, Gemini или Azure), а отсутствие ключа сообщается до отправки любого запроса.
dseyesopen
balue8246-maker/dseyesopen
Мост vision для текстового DeepSeek: отправляйте изображения (отдельно или вместе с текстом), и быстрая маленькая модель vision описывает их за кулисами; чат сохраняет картинку, а DeepSeek видит только текст. Чистый плагин: удаление восстанавливает всё как было.
dsh-visibridge
lhbsaa/dsh-visibridge
Структурированные визуальные доказательства (OCR/разметка/семантика), а также инструмент захвата с USB-камеры для цикла отладки «снимок-анализ-корректировка»; бэкенды: Ollama, DeepSeek, Xiaomi.
dsh-short-video-studio
fengyungithub/dsh-short-video-studio
Рабочая станция для создания ИИ-видео в стиле MiniMax-Design на базе DeepSeek Harness.
dsh-watch-video
zeshuochen/dsh-watch-video
Транскрипция видео с приоритетом субтитров и экспортом в SRT, управлением задачами с возможностью отмены и резервным вариантом faster-whisper large-v3, когда субтитры недоступны.
dsh-voice-agent (voice-app)
wayneyu430/dsh-voice-agent
Разговорный голосовой фронтенд-агент для dsh: говорите естественно через ByteDance Duplex, делегируйте запросы фоновым задачам и слышите их асинхронные результаты, сообщаемые голосом.
dsh-voice-chat
maoyuching/dsh-voice-chat
Голосовой чат в стиле Doubao для DSH: удержание микрофона в поле ввода преобразует речь в текст и отправляет автоматически, а ответы ИИ озвучиваются. Необязательное сжатие с помощью LLM (длинные ответы сводятся к коротким озвучиваемым репликам в соответствии с моделью текущего диалога), очистка текста для TTS, выбираемые голоса Edge TTS, настраиваемая автоостановка по тишине, а настройки встроены в диалог настроек DSH.
phone-lens (phone-lens)
yxqfg/phone-lens
Превращает камеру телефона в живой видоискатель и фотоввод для вашей сессии dsh, по LAN или USB.
dsh-capture
max-null/dsh-capture
Захват экрана на двух движках для DSH: внутри настольной оболочки SSiD глобальная горячая клавиша или значок в трее открывает полноэкранное оверлейное выделение рамкой (все мониторы, попиксельно точные кадры для каждого экрана) с аннотированием красной рамкой прямо на месте и панелью инструментов в стиле WeChat; в обычном DSH (браузер) кнопка камеры в поле ввода захватывает экран через getDisplayMedia и повторно использует в странице то же однофазное оверлейное выделение рамкой + аннотирование. Обрезанное изображение попадает в поле ввода текущего диалога через официальный канал приёма вложений.
phone-lens (lens-mate)
yxqfg/phone-lens
Превращает камеру телефона в видоискатель реального времени и источник фото для вашей сессии dsh по LAN или USB.
dsh-labnana
exoticknight/dsh-labnana
Генерация изображений Labnana для DeepSeek Harness: текст-в-картинку / картинка-в-картинку / точное редактирование с оценкой кредитов, балансом подписки и веб-интерфейсом настроек.