Перейти к основному содержимому

Зрение, голос и мультимодальность

Плагины «Зрение, голос и мультимодальность» дают текстовым моделям DeepSeek в DeepSeek-Harness (dsh) глаза, уши и голос. Здесь есть инструменты зрения и провайдерские маршруты, которые распознают и описывают вставленные скриншоты через Zhipu GLM, Gemini, Doubao или локальный Ollama, голосовой ввод с микрофона через браузерный Web Speech API или Whisper-совместимые API, озвучивание ответов с помощью Edge TTS или собственных голосов, полнодуплексные голосовые режимы, а также генераторы изображений, видео и музыки.

Найдено плагинов: 312

1

dsh-vision-sidecar

121103qwq/dsh-vision-sidecar

Размещённый бесплатный vision-компаньон для DeepSeek Harness с устойчивым хранением доказательств по сессии

42 месяца назадЗрение, голос и мультимодальностьMIT
Y

dsh-image-subagent

yuqingsh/dsh-image-subagent

42 месяца назадЗрение, голос и мультимодальностьMIT
G

dsh-vision-bridge

gxx182/dsh-vision-bridge

Связывает изображения сеанса с настраиваемыми провайдерами визуального анализа и возвращает только текстовый анализ подходящим маршрутам моделей DeepSeek Harness.

42 месяца назадЗрение, голос и мультимодальностьMIT
H

dsh-omni-workstation

huashenglian/dsh-omni-workstation

Мультимодальная рабочая станция для DSH: analyze_image по упорядоченной цепочке переключения из нескольких карт VLM, набор из шести инструментов зрения (масштабирование, выбор цвета, попиксельное сравнение, OCR, обнаружение элементов, встроенный показ) с общим распознавателем изображений, generate_image по протоколам OpenAI/DashScope/ComfyUI, асинхронный generate_video с несколькими картами и конструктором /build-video-tool, а также TTS speak/clone_voice по семи провайдерам — всё управляется одной автосохраняемой страницей настроек.

314 дней назадЗрение, голос и мультимодальностьMIT
W

dsh-hold-to-talk

wangzhanchao883/dsh-hold-to-talk

Ввод одной рукой и без клавиатуры для поля ввода: зажмите кнопку мыши на поле ввода, говорите, отпустите — текст попадает в черновик, а сдвиг вверх отменяет ввод, не оставляя недописанной фразы. Не нужно целиться в кнопку микрофона и запоминать горячую клавишу; рука никогда не покидает область ввода, что важно, когда вторая рука занята. Распознавание работает полностью офлайн (SenseVoice через sherpa-onnx, без API-ключа, звук не покидает машину).

322 часа назадЗрение, голос и мультимодальностьMIT
N

dsh-plugin-speech

nakamuraia/dsh-plugin-speech

Озвучивает ответы ассистента в DeepSeek Harness: провайдеры преобразования текста в речь с потоковым воспроизведением.

318 дней назадЗрение, голос и мультимодальностьMIT
S

dsh-voice-assistant

supersyh-sss/dsh-voice-assistant

Голосовой ассистент для dsh web: произнесите фразу активации (например, «小鲸»), чтобы включить диктовку без рук — сказанное распознаётся и автоматически вводится в поле чата. Поддерживает голосовые команды редактирования (отправить, очистить, новая строка, остановить чтение) и читает ответы ассистента вслух на китайском. Распознавание речи выполняется локально в браузере через sherpa-onnx WASM, поэтому работает офлайн без API-ключа.

3в прошлом месяцеЗрение, голос и мультимодальностьMIT
S

dsh-audiogen

shimingming520/dsh-audiogen

ИИ-генерация аудио для веб-интерфейса DeepSeek Harness — мультивендорный TTS, музыка, звуковые эффекты и дизайн голоса с боковой панелью, сравнением моделей, библиотекой ресурсов и инструментами Agent.

324 дня назадЗрение, голос и мультимодальностьApache-2.0
L

dsh-voco

lgquan/dsh-voco

Непрерывные голосовые разговоры для DSH с прослушиванием без рук, push-to-talk, распознаванием речи, ответами TTS и делегированием Agent в фоне.

3в прошлом месяцеЗрение, голос и мультимодальностьMIT
T

dsh-gsv

taoruiliu19/dsh-gsv

Локальный TTS в реальном времени для DeepSeek Harness: голосовые пресеты, автоматическое чтение, ассистент настройки движка, кнопка озвучивания и панель настроек для движка GSV-TTS-Lite.

3в прошлом месяцеЗрение, голос и мультимодальностьMIT
J

dsh-ximalaya

jerryqx/dsh-ximalaya

Слушайте подкасты и аудиокниги Ximalaya прямо в веб-интерфейсе DSH: поиск альбомов, просмотр треков по страницам и воспроизведение через панель «сейчас играет» (назад/играть/вперёд, перемотка, громкость, скорость). После входа по QR-коду страница «Моё» показывает понравившиеся треки (нажмите, чтобы включить), подписки на альбомы с подсказками о последних выпусках и отслеживаемых авторов с их публичными альбомами; хост ретранслирует аудиопотоки с поддержкой Range и регистрирует инструмент `ximalaya_play`, чтобы агент мог искать и включать по запросу.

3в прошлом месяцеЗрение, голос и мультимодальностьMIT
B

phone-eye

boheastill/phone-eye

Позволяет вашему ИИ-агенту видеть реальный телефон Android и управлять им: phone_look (объединение зрения и дерева UI), нажатие/свайп/ввод текста, снимок экрана — через adb, для любого клиента MCP.

3в прошлом месяцеЗрение, голос и мультимодальностьMIT
X

dsh-image-vision

xiaoyuink/dsh-image-vision

Понимание изображений для любой модели DSH: инструменты зрения, OCR, grounding и кадрирования с доменными пресетами для гистопатологии, клеточной биологии, анатомии, клинических изображений и научных иллюстраций.

329 дней назадЗрение, голос и мультимодальность
L

Deepseek-Continuity

linxuhao/deepseek-continuity

Локальная генерация изображений, голоса, музыки и звуковых эффектов, а также транскрипция с закреплённой идентичностью: персонажи, животные, объекты и голоса актёров определяются один раз и повторно используются при каждом последующем вызове; вырожденный вывод (почти плоское изображение, беззвучное аудио) отклоняется, а не возвращается как успешный, а сгенерированную строку можно прочитать обратно как текст, чтобы клон, проглотивший свою концовку, стал виден. Движки выгружаются в простое, а генерация изображений и транскрипция могут каждая указывать на API в форме OpenAI вместо локального Vulkan-бэкенда.

312 дней назадЗрение, голос и мультимодальностьMIT
Y

dsh-ui-spec

yumimanji/dsh-ui-spec

Плагин DeepSeek Harness, который превращает скриншоты UI в веб-спецификации уровня реализации с помощью OCR, детерминированной геометрии, графов сцены, ассетов и сравнения рендеринга.

32 месяца назадЗрение, голос и мультимодальностьMIT
D

deepseekeyes

dttxorg/deepseekeyes

Проверяемая среда исполнения для зрения и кросс-платформенного Computer Use для DeepSeek Harness с сохраняющими источник доказательствами.

32 месяца назадЗрение, голос и мультимодальностьMIT
N

voco-input-sh

nothree-code/voco-input-sh

Голосовой ввод для Web UI: кнопка микрофона, которая запускает локальное офлайн-распознавание речи VocoType и автоматически вставляет распознанный текст в composer (авторазвертывание, дедупликация, непрерывная диктовка).

319 дней назадЗрение, голос и мультимодальностьMIT
B

dsh-stt-input

baisama-cloud/dsh-stt-input

Голосовой ввод с распознаванием речи для Web UI: кнопка микрофона в композиторе транскрибирует речь в черновик через Web Speech API браузера (без настройки) или совместимый с OpenAI Whisper API (OpenAI / Groq), с выбором модели и языка в Настройках.

3в прошлом месяцеЗрение, голос и мультимодальностьMIT
W

visual-review

wang-bool/visual-review

Показывает вставленные или загруженные изображения прямо в чате DSH Web и даёт зрение моделям только с текстом: вызываемый моделью инструмент visual_review сначала обращается к любой совместимой с OpenAI мультимодальной API, а при сбое переходит на локальный воркер Qwen3-VL.

32 месяца назадЗрение, голос и мультимодальностьMIT
T

dsh-plugins (dsh-vision)

tzhr-invest/dsh-plugins

Вызываемый агентом vision-инструмент, который описывает локальные изображения через любой настраиваемый OpenAI-совместимый vision endpoint, с опциональной перекрёстной проверкой несколькими моделями и без встроенных ключей.

35 дней назадЗрение, голос и мультимодальностьMIT
S

dsh-plugin-multimodal

shinjiyu/dsh-plugin-multimodal

Объявляет вставку изображений на текстовых маршрутах DeepSeek, описывает вложения с помощью визуального сайдкара и оставляет нативные модели зрения нетронутыми.

32 месяца назадЗрение, голос и мультимодальностьMIT
M

dsh-vision-tools

moon09300731/dsh-vision-tools

Полный пакет возможностей компьютерного зрения для DeepSeek Harness: инструмент vision_understand (API зрения, совместимые с OpenAI, по умолчанию бесплатный Zhipu GLM-4V-Flash), а также точки входа вставки/перетаскивания/кнопки для распознавания изображений.

32 месяца назадЗрение, голос и мультимодальностьMIT
L

dsh-plugin-grok2api-media-tool

lsjspl/dsh-plugin-grok2api-media-tool

Даёт dsh возможность генерировать изображения и видео через API grok2api.

3в прошлом месяцеЗрение, голос и мультимодальность
L

dsh-image-gen

leemancheung/dsh-image-gen

`image_gen` GPT Image 2 с OAuth подписки Codex по умолчанию или явным режимом API-ключа: карточка в разработке, до трёх live API partials, устойчивое воспроизведение вложений / lightbox / загрузка, вывод модели только текстом и ограниченные безопасные для учётных данных запросы.

35 дней назадЗрение, голос и мультимодальностьMIT