Зрение, голос и мультимодальность
Плагины «Зрение, голос и мультимодальность» дают текстовым моделям DeepSeek в DeepSeek-Harness (dsh) глаза, уши и голос. Здесь есть инструменты зрения и провайдерские маршруты, которые распознают и описывают вставленные скриншоты через Zhipu GLM, Gemini, Doubao или локальный Ollama, голосовой ввод с микрофона через браузерный Web Speech API или Whisper-совместимые API, озвучивание ответов с помощью Edge TTS или собственных голосов, полнодуплексные голосовые режимы, а также генераторы изображений, видео и музыки.
Найдено плагинов: 312
dsh-vision-proxy
flyvhidbwo/dsh-vision-proxy
Мозг DeepSeek + автоматическая транскрипция изображений: прикрепляйте изображения в GUI, и каждое по умолчанию транскрибируется через официальную модель deepseek-v4-flash-vision-exp (чисто текстовый мозг V4-Pro тоже может видеть изображения), в качестве альтернатив — любая VLM, совместимая с OpenAI, или локальный Ollama.
dsh-video-lens
dundunhan/dsh-video-lens
Наделяет текстовых агентов DeepSeek Harness пониманием видео: семплирование кадров с учётом сцен + VLM + необязательная ASR-транскрипция, объединённые в доказательства на временной шкале. / Плагин понимания видео для чисто текстовых моделей (семплирование кадров по сценам + VLM + необязательная расшифровка речи).
dsh-vision-opencode
poiuyjie/dsh-vision-opencode
Добавляет настраиваемую модель зрения к текстовым основным моделям: инструмент vision_read_image, селектор модели зрения на панели композитора и автоматическое преобразование изображения в текст для текстовых маршрутов.
dsh-agnes-studio
zmm863-commits/dsh-agnes-studio
Студия изображений и видео на базе ИИ в виде плавающей панели DSH, чтобы творчество шло рядом с беседой, а не вместо неё: текст-в-изображение, изображение-в-изображение и композиция из нескольких изображений в 1K–4K при восьми соотношениях сторон; текст-в-видео и изображение-в-видео с управлением по первому кадру, 4–12 секунд; режим коротких драм, который импортирует сценарий (.txt/.md/.json), разбивает его на раскадровку для предпросмотра и пакетной генерации; рабочее пространство эксперта по промптам. Без зависимостей во время выполнения.
dsh-voice-ai-girlfriend-plugin
beiyege-01/dsh-voice-ai-girlfriend-plugin
Голосовая AI-девушка для Web UI: микрофонный ввод через FunASR, голосовые ответы Qwen3-TTS, окно анимации компаньона и двусторонний QQ-чат (текст/голос/изображение push) через NapCat.
dsh-plugin-xiaomi-mimo-tts
ppy-web/dsh-plugin-xiaomi-mimo-tts
Добавляет синтез речи Xiaomi MiMo в DSH Web: чтение вслух сообщений ассистента, потоковая передача PCM, готовые и пользовательские голоса, резервный синтез речи браузера, элементы управления воспроизведением и необязательные звуки интерфейса.
dsh-speak
alan2z/dsh-speak
Плагин голосовых объявлений без зависимостей, управляемый событиями: без дополнительной модели, без затрат токенов. Озвучивает встроенным естественным голосом системы, поддерживает Windows и macOS; объявления финальных ответов, оповещения об одобрении и вопросах, необязательные уведомления о событиях (конец хода, завершение команды, изменение цели, ошибки инструментов, обновления задач), воспроизводимые финальные ответы и двуязычная визуальная страница настроек.
Gemini-Eyes
consolesun/gemini-eyes
MCP-мост к gemini.google.com: анализ изображений и видео с помощью компьютерного зрения, генерация изображений Imagen и видео Veo, а также управление диалогами через уже авторизованную сессию браузера без API-ключа.
dsh-draw
perrylink/dsh-draw
Мультидвижковая генерация текста в изображение (OpenAI Images и пресеты Zhipu CogView) с отслеживанием квот на сессию, failover движка, безопасной конфигурацией учётных данных и карточкой результата с regenerate.
dsh-deepseek-vision
siegfly/dsh-deepseek-vision
Маршрут провайдера шлюза «зрение-язык»: вставленные изображения описываются настраиваемой VL-моделью (по умолчанию Qwen-VL) перед отправкой в DeepSeek.
dsh-vision
linenxi-ctrl/dsh-vision
Внешний плагин зрения для DeepSeek Harness: панель настроек с кнопкой-китом, распознавание изображений с авто-ответом и инструменты агента для скриншотов/распознавания.
dsh-highres-vision
azwosile/dsh-highres-vision
Для нативной визуальной модели DeepSeek Harness deepseek-v4-flash-vision-exp повышает лимиты приёма изображений до 32 MiB / 8192 px / 600 изображений и добавляет инструмент highres_read, который разбивает большие изображения на фрагменты, а затем возвращает полное изображение плюс фрагменты 800x800 через инструмент read_image хоста.
dsh-voice
goodandready/dsh-voice
Голосовой ввод для web UI: диктовка, разбитая по паузам, и голосовые сообщения — для каждого предусмотрена собственная цепочка резервных провайдеров (Deepgram, Groq, HuggingFace, локальный whisper.cpp или OpenAI-совместимый endpoint).
dsh-voice
3274375092/dsh-voice
Голосовой ввод для DeepSeek Harness: говорите в микрофон, и распознанный текст отправляется как обычное сообщение чата, через локальное или браузерное распознавание речи.
dsh-free-vision
fuzzysoul/dsh-free-vision
Бесплатный мост зрения для текстовых моделей: понимание изображений, OCR, анализ интерфейса и отладка через бесплатных провайдеров (Qwen3-VL-Flash, Doubao, DeepSeek-OCR) с графическим интерфейсом настроек.
dsh-chat-imagine
corrinehu/dsh-chat-imagine
Автоматически генерирует и отображает изображения в чате DSH через API-каналы или локальные CLI (mmx / codex / agy), а также распознаёт изображения с помощью соответствующего CLI.
dsh-tool-vision
scorp1o117/dsh-tool-vision
Отправляет локальные изображения или HTTP(S) URL изображений в настроенную OpenAI-compatible vision endpoint через инструмент inspect_image и возвращает его текстовый ответ в беседу.
dsh-appshots
wongyuye/dsh-appshots
Захват окна в стиле Codex для DSH Desktop на macOS и Windows: нажмите обе клавиши Command (macOS) или обе клавиши Ctrl (Windows) либо кнопку камеры, чтобы снять переднее окно, прикрепить его к текущему чату и внедрить дерево доступности в стиле VoiceOver как скрытый контекст.
dsh-vision
54xkeee/dsh-vision
Зрение для текстового DeepSeek по умолчанию через Doubao Web (бесплатно, без API-ключа — управляет вашим авторизованным Chrome через мост Windows CDP), с квотой Antigravity IDE (flash/pro) или резервным вариантом Gemini; автоматическое повышение уровня детализации, память визуальных доказательств с регидратацией после сжатия, кеш по хешу контента и двуязычная клиентская панель.
dsh-duet
yums/dsh-duet
Полнодуплексное голосовое взаимодействие на китайском языке для DSH Web: диктуйте и редактируйте задачи, отправляйте запросы, управляйте сессиями, отвечайте на вопросы DSH и слушайте краткие объявления о завершении задач.
deepseek-harness-plugins (vision-bridge)
yinxe/deepseek-harness-plugins
Позволяет текстовым моделям видеть изображения: когда приходит картинка с заглушкой вида \[image omitted because this model accepts text only], модель вызывает инструмент vision_describe, и плагин передаёт ссылку на изображение вместе с вопросом мультимодальной модели, повторяя попытку с резервной моделью при сбое. Настраивается на странице настроек и сохраняется через официальный API настроек.
dsh-voice-input-plugin
zhangbo-cn/dsh-voice-input-plugin
Микрофон composer для веб-интерфейса: нажатие для мониторинга живой транскрипции и удержание для разговора, с озвучиванием ответа через хостовый Edge TTS, транслируемым во время генерации моделью, паузой эха во время чтения и нажатием для остановки.
dsh-ocr-local
grelvan/dsh-ocr-local
Локальный OCR-резерв для текстовых маршрутов: когда модель сессии заявляет, что не может принимать изображения, прикреплённое изображение кешируется локально и его путь подставляется, чтобы модель могла вызвать ocr_image — PP-OCRv5 + ONNX Runtime на CPU, без API-ключа, изображения никогда не покидают машину. Молчит, когда модель может видеть изображения.
vision-exp-tile
nicholas023/vision-exp-tile
Распознавание крупных изображений для моделей vision-exp: распознавание плиток 800×800 без потерь (smart/pipeline/full), локальный OCR с предобработкой и маршрутизацией рукописного текста, опциональный мультивендорный GPU (DirectML/CUDA/OpenVINO) с автоматическим переходом на CPU.