Перейти к основному содержимому

Зрение, голос и мультимодальность

Плагины «Зрение, голос и мультимодальность» дают текстовым моделям DeepSeek в DeepSeek-Harness (dsh) глаза, уши и голос. Здесь есть инструменты зрения и провайдерские маршруты, которые распознают и описывают вставленные скриншоты через Zhipu GLM, Gemini, Doubao или локальный Ollama, голосовой ввод с микрофона через браузерный Web Speech API или Whisper-совместимые API, озвучивание ответов с помощью Edge TTS или собственных голосов, полнодуплексные голосовые режимы, а также генераторы изображений, видео и музыки.

Найдено плагинов: 312

F

dsh-vision-proxy

flyvhidbwo/dsh-vision-proxy

Мозг DeepSeek + автоматическая транскрипция изображений: прикрепляйте изображения в GUI, и каждое по умолчанию транскрибируется через официальную модель deepseek-v4-flash-vision-exp (чисто текстовый мозг V4-Pro тоже может видеть изображения), в качестве альтернатив — любая VLM, совместимая с OpenAI, или локальный Ollama.

15в прошлом месяцеЗрение, голос и мультимодальностьMIT
D

dsh-video-lens

dundunhan/dsh-video-lens

Наделяет текстовых агентов DeepSeek Harness пониманием видео: семплирование кадров с учётом сцен + VLM + необязательная ASR-транскрипция, объединённые в доказательства на временной шкале. / Плагин понимания видео для чисто текстовых моделей (семплирование кадров по сценам + VLM + необязательная расшифровка речи).

13в прошлом месяцеЗрение, голос и мультимодальностьMIT
P

dsh-vision-opencode

poiuyjie/dsh-vision-opencode

Добавляет настраиваемую модель зрения к текстовым основным моделям: инструмент vision_read_image, селектор модели зрения на панели композитора и автоматическое преобразование изображения в текст для текстовых маршрутов.

1323 дня назадЗрение, голос и мультимодальностьMIT
Z

dsh-agnes-studio

zmm863-commits/dsh-agnes-studio

Студия изображений и видео на базе ИИ в виде плавающей панели DSH, чтобы творчество шло рядом с беседой, а не вместо неё: текст-в-изображение, изображение-в-изображение и композиция из нескольких изображений в 1K–4K при восьми соотношениях сторон; текст-в-видео и изображение-в-видео с управлением по первому кадру, 4–12 секунд; режим коротких драм, который импортирует сценарий (.txt/.md/.json), разбивает его на раскадровку для предпросмотра и пакетной генерации; рабочее пространство эксперта по промптам. Без зависимостей во время выполнения.

123 дня назадЗрение, голос и мультимодальность
B

dsh-voice-ai-girlfriend-plugin

beiyege-01/dsh-voice-ai-girlfriend-plugin

Голосовая AI-девушка для Web UI: микрофонный ввод через FunASR, голосовые ответы Qwen3-TTS, окно анимации компаньона и двусторонний QQ-чат (текст/голос/изображение push) через NapCat.

1219 дней назадЗрение, голос и мультимодальность
P

dsh-plugin-xiaomi-mimo-tts

ppy-web/dsh-plugin-xiaomi-mimo-tts

Добавляет синтез речи Xiaomi MiMo в DSH Web: чтение вслух сообщений ассистента, потоковая передача PCM, готовые и пользовательские голоса, резервный синтез речи браузера, элементы управления воспроизведением и необязательные звуки интерфейса.

113 дня назадЗрение, голос и мультимодальностьMIT
A

dsh-speak

alan2z/dsh-speak

Плагин голосовых объявлений без зависимостей, управляемый событиями: без дополнительной модели, без затрат токенов. Озвучивает встроенным естественным голосом системы, поддерживает Windows и macOS; объявления финальных ответов, оповещения об одобрении и вопросах, необязательные уведомления о событиях (конец хода, завершение команды, изменение цели, ошибки инструментов, обновления задач), воспроизводимые финальные ответы и двуязычная визуальная страница настроек.

117 дней назадЗрение, голос и мультимодальностьMIT
C

Gemini-Eyes

consolesun/gemini-eyes

MCP-мост к gemini.google.com: анализ изображений и видео с помощью компьютерного зрения, генерация изображений Imagen и видео Veo, а также управление диалогами через уже авторизованную сессию браузера без API-ключа.

11в прошлом месяцеЗрение, голос и мультимодальность
P

dsh-draw

perrylink/dsh-draw

Мультидвижковая генерация текста в изображение (OpenAI Images и пресеты Zhipu CogView) с отслеживанием квот на сессию, failover движка, безопасной конфигурацией учётных данных и карточкой результата с regenerate.

98 дней назадЗрение, голос и мультимодальностьApache-2.0
S

dsh-deepseek-vision

siegfly/dsh-deepseek-vision

Маршрут провайдера шлюза «зрение-язык»: вставленные изображения описываются настраиваемой VL-моделью (по умолчанию Qwen-VL) перед отправкой в DeepSeek.

921 день назадЗрение, голос и мультимодальностьMIT
L

dsh-vision

linenxi-ctrl/dsh-vision

Внешний плагин зрения для DeepSeek Harness: панель настроек с кнопкой-китом, распознавание изображений с авто-ответом и инструменты агента для скриншотов/распознавания.

92 месяца назадЗрение, голос и мультимодальностьMIT
A

dsh-highres-vision

azwosile/dsh-highres-vision

Для нативной визуальной модели DeepSeek Harness deepseek-v4-flash-vision-exp повышает лимиты приёма изображений до 32 MiB / 8192 px / 600 изображений и добавляет инструмент highres_read, который разбивает большие изображения на фрагменты, а затем возвращает полное изображение плюс фрагменты 800x800 через инструмент read_image хоста.

822 дня назадЗрение, голос и мультимодальностьMIT
G

dsh-voice

goodandready/dsh-voice

Голосовой ввод для web UI: диктовка, разбитая по паузам, и голосовые сообщения — для каждого предусмотрена собственная цепочка резервных провайдеров (Deepgram, Groq, HuggingFace, локальный whisper.cpp или OpenAI-совместимый endpoint).

8вчераЗрение, голос и мультимодальностьMIT
3

dsh-voice

3274375092/dsh-voice

Голосовой ввод для DeepSeek Harness: говорите в микрофон, и распознанный текст отправляется как обычное сообщение чата, через локальное или браузерное распознавание речи.

8позавчераЗрение, голос и мультимодальностьMIT
F

dsh-free-vision

fuzzysoul/dsh-free-vision

Бесплатный мост зрения для текстовых моделей: понимание изображений, OCR, анализ интерфейса и отладка через бесплатных провайдеров (Qwen3-VL-Flash, Doubao, DeepSeek-OCR) с графическим интерфейсом настроек.

8в прошлом месяцеЗрение, голос и мультимодальностьMIT
C

dsh-chat-imagine

corrinehu/dsh-chat-imagine

Автоматически генерирует и отображает изображения в чате DSH через API-каналы или локальные CLI (mmx / codex / agy), а также распознаёт изображения с помощью соответствующего CLI.

8в прошлом месяцеЗрение, голос и мультимодальностьMIT
S

dsh-tool-vision

scorp1o117/dsh-tool-vision

Отправляет локальные изображения или HTTP(S) URL изображений в настроенную OpenAI-compatible vision endpoint через инструмент inspect_image и возвращает его текстовый ответ в беседу.

83 дня назадЗрение, голос и мультимодальность
W

dsh-appshots

wongyuye/dsh-appshots

Захват окна в стиле Codex для DSH Desktop на macOS и Windows: нажмите обе клавиши Command (macOS) или обе клавиши Ctrl (Windows) либо кнопку камеры, чтобы снять переднее окно, прикрепить его к текущему чату и внедрить дерево доступности в стиле VoiceOver как скрытый контекст.

715 дней назадЗрение, голос и мультимодальностьMIT
5

dsh-vision

54xkeee/dsh-vision

Зрение для текстового DeepSeek по умолчанию через Doubao Web (бесплатно, без API-ключа — управляет вашим авторизованным Chrome через мост Windows CDP), с квотой Antigravity IDE (flash/pro) или резервным вариантом Gemini; автоматическое повышение уровня детализации, память визуальных доказательств с регидратацией после сжатия, кеш по хешу контента и двуязычная клиентская панель.

72 месяца назадЗрение, голос и мультимодальностьMIT
Y

dsh-duet

yums/dsh-duet

Полнодуплексное голосовое взаимодействие на китайском языке для DSH Web: диктуйте и редактируйте задачи, отправляйте запросы, управляйте сессиями, отвечайте на вопросы DSH и слушайте краткие объявления о завершении задач.

63 дня назадЗрение, голос и мультимодальностьApache-2.0
Y

deepseek-harness-plugins (vision-bridge)

yinxe/deepseek-harness-plugins

Позволяет текстовым моделям видеть изображения: когда приходит картинка с заглушкой вида \[image omitted because this model accepts text only], модель вызывает инструмент vision_describe, и плагин передаёт ссылку на изображение вместе с вопросом мультимодальной модели, повторяя попытку с резервной моделью при сбое. Настраивается на странице настроек и сохраняется через официальный API настроек.

6вчераЗрение, голос и мультимодальностьMIT
Z

dsh-voice-input-plugin

zhangbo-cn/dsh-voice-input-plugin

Микрофон composer для веб-интерфейса: нажатие для мониторинга живой транскрипции и удержание для разговора, с озвучиванием ответа через хостовый Edge TTS, транслируемым во время генерации моделью, паузой эха во время чтения и нажатием для остановки.

6в прошлом месяцеЗрение, голос и мультимодальностьMIT
G

dsh-ocr-local

grelvan/dsh-ocr-local

Локальный OCR-резерв для текстовых маршрутов: когда модель сессии заявляет, что не может принимать изображения, прикреплённое изображение кешируется локально и его путь подставляется, чтобы модель могла вызвать ocr_image — PP-OCRv5 + ONNX Runtime на CPU, без API-ключа, изображения никогда не покидают машину. Молчит, когда модель может видеть изображения.

55 дней назадЗрение, голос и мультимодальность
N

vision-exp-tile

nicholas023/vision-exp-tile

Распознавание крупных изображений для моделей vision-exp: распознавание плиток 800×800 без потерь (smart/pipeline/full), локальный OCR с предобработкой и маршрутизацией рукописного текста, опциональный мультивендорный GPU (DirectML/CUDA/OpenVINO) с автоматическим переходом на CPU.

5в прошлом месяцеЗрение, голос и мультимодальностьMIT