Перейти к основному содержимому

Зрение, голос и мультимодальность

Плагины «Зрение, голос и мультимодальность» дают текстовым моделям DeepSeek в DeepSeek-Harness (dsh) глаза, уши и голос. Здесь есть инструменты зрения и провайдерские маршруты, которые распознают и описывают вставленные скриншоты через Zhipu GLM, Gemini, Doubao или локальный Ollama, голосовой ввод с микрофона через браузерный Web Speech API или Whisper-совместимые API, озвучивание ответов с помощью Edge TTS или собственных голосов, полнодуплексные голосовые режимы, а также генераторы изображений, видео и музыки.

Найдено плагинов: 312

B

dsh-ocr-local

balcoz/dsh-ocr-local

Локальный OCR для DeepSeek Harness: вставьте или прикрепите изображение, получите его текст через PP-OCRv5 + ONNX Runtime, полностью офлайн. TUI (cc-tui) и Web.

52 месяца назадЗрение, голос и мультимодальность
S

dsh-vision-bridge

sfyyy/dsh-vision-bridge

Визуальная обработка по запросу для текстовых сеансов DSH: изображения становятся маркерами, а инструмент vision_describe отправляет только изображение и вопрос в модель визуального анализа, совместимую с OpenAI

52 месяца назадЗрение, голос и мультимодальностьMIT
0

dsh-voice-input

0nt-one/dsh-voice-input

Кнопка микрофона в строке инструментов композера: речь-в-текст через Web Speech API (Chrome/Edge), переключение языка и опциональная автоматическая отправка, без зависимостей.

52 месяца назадЗрение, голос и мультимодальностьMIT
T

dsh-plugin-appshot

tauruswood/dsh-plugin-appshot

Codex Appshots для DSH: захват переднего активного окна горячей клавишей и бесшовное монтирование его в композер для запросов агента.

55 дней назадЗрение, голос и мультимодальностьMIT
P

dsh-screenshot

paicat1/dsh-screenshot

Захват экрана без зависимостей для DSH: Lightweight — ноль зависимостей, ноль бинарников; Stage & shoot — полноэкранный захват, раскладка окон, hover-snap захват перекрытых окон в один клик; самообслуживание агента — доставка только путём; пути универсальны, в паре с modlens (опционально) — структурированные доказательства за один вызов.

524 дня назадЗрение, голос и мультимодальностьMIT
A

dsh-guide-dog

atropinoltt/dsh-guide-dog

Мультимодальный плагин на базе MiniMax: режим голосового вызова в реальном времени (потоковая беседа, плавающий интерфейс дока), голосовой режим и ввод голоса через микрофон, а также инструменты генерации изображений/видео/музыки/речи и визуального анализа.

52 месяца назадЗрение, голос и мультимодальностьMIT
E

canvas-workbench

elangan1997-cmyk/canvas-workbench

Локальный графический рабочий стол, без абонентской платы: используйте собственный API для генерации изображений (любой OpenAI-совместимый интерфейс, без подписки), вёрстка холста + ретушь/стирание/удаление фона/OCR/векторизация, редактируемые PSD/AI на выходе, двусторонний мост на уровне слоёв Photoshop/Illustrator

43 дня назадЗрение, голос и мультимодальностьMIT
Y

dsh-tts-bridge

yuuyuko-uu/dsh-tts-bridge

Озвучивает разговоры DSH, используя встроенное чтение вслух на веб-странице DeepSeek, управляемое небольшим расширением браузера.

43 дня назадЗрение, голос и мультимодальность
C

dsh-cycle-image-gen

chengzzzi44/dsh-cycle-image-gen

Инструмент генерации изображений для DeepSeek Harness через любой OpenAI-совместимый эндпоинт изображений, со встроенной галереей в веб-интерфейсе.

422 дня назадЗрение, голос и мультимодальностьMIT
V

tripo3d-plugin-dsh

vast-ai-research/tripo3d-plugin-dsh

Навыки Tripo 3D для DeepSeek Harness — генерация готовых для движка 3D-ресурсов из текстового запроса или референсного изображения через tripo-cli, с текстурированием, риггингом, ретопологией и конвертацией форматов за один проход.

423 дня назадЗрение, голос и мультимодальность
L

deepseek-vl-support

limccn/deepseek-vl-support

Добавляет моделям DeepSeek (только текст) возможность зрения в клиентах Claude Code, Codex и Agent Plugins: описывает изображения через любой совместимый с OpenAI vision-эндпоинт.

4в прошлом месяцеЗрение, голос и мультимодальностьMIT
L

screenshot-feedback-hook-mcp (dsh-plugin)

lkh081231/screenshot-feedback-hook-mcp

Добавляет инструмент снятия скриншота и две опциональные точки автоматического захвата, помещая экран в диалог как блок изображения; требует модель с поддержкой изображений.

4в прошлом месяцеЗрение, голос и мультимодальностьMIT
A

dsh-pdf-reader

angeloszou/dsh-pdf-reader

Плагин контентно-ориентированного чтения PDF для визуальных моделей: профилирует каждую страницу на наличие рисунков (векторных и растровых), таблиц, риска формул и двухколоночной вёрстки, затем применяет гибридное контентно-ориентированное извлечение, рендерит страницы с рисунками/таблицами/формулами как высокодетализированные обрезки регионов. Предоставляет низкодетализированный предпросмотр для понимания макета страницы и рендерит указанный регион в высоком разрешении. Упакован как несколько инструментов для агентов.

4в прошлом месяцеЗрение, голос и мультимодальностьMIT
N

dsh-hos-scrcpy

ns-zzj/dsh-hos-scrcpy

Управляйте телефоном HarmonyOS из веб-интерфейса DSH с ИИ: живая зеркализация экрана H.264, касания мышью и системные клавиши, поток hilog и агентные инструменты, которые позволяют модели читать экран, находить элементы UI, затем нажимать, долго нажимать, нажимать клавиши или вводить текст.

4позавчераЗрение, голос и мультимодальностьMIT
X

dsh-vision-hub (tool-vision)

xing666173/dsh-vision-hub

Расширенный набор инструментов vision: 14 пиксельных vision-инструментов (describe, ground, detect, crop, pixel-diff, OCR, OCR длинных скриншотов, vectorize, colors, cutout, screenshot, present, materialize, html-screenshot) на одном OpenAI-совместимом эндпоинте, с чистыми маркерами [图片: path], классификацией безопасности контента и авто-ретраем при лимите запросов.

4в прошлом месяцеЗрение, голос и мультимодальность
D

dsh-image-pathify

dami9527/dsh-image-pathify

Позволяет чисто текстовым моделям работать с вставленными в чат изображениями: нативный визуальный режим, пакетный просмотр изображений и встроенный OpenAI-совместимый инструмент analyze_image; модели с поддержкой зрения не затрагиваются.

48 дней назадЗрение, голос и мультимодальностьMIT
S

dsh-voice

stardustlc666/dsh-voice

Голосовые инструменты: бесплатный нейросетевой синтез речи edge-tts, совместимая с OpenAI транскрипция ASR, список голосов, пакетное прослушивание голосов и самопроверка состояния.

48 часов назадЗрение, голос и мультимодальностьMIT
H

dsh-voice

haoku123/dsh-voice

Полнодуплексный голосовой режим для веб-интерфейса: диктовка касанием для переключения или удержанием (клавиша отправки или `Ctrl`) с живыми субтитрами, хостовая SenseVoice ASR через sherpa-onnx, ответы вслух предложение за предложением, а речь прерывает воспроизведение и текущий ход (истинное перебивание). Ключ API не требуется.

4в прошлом месяцеЗрение, голос и мультимодальностьMIT
F

dsh-chatvoice

fuzzysoul/dsh-chatvoice

Бесплатный голосовой замкнутый цикл для веб-интерфейса: ввод с микрофона через SpeechRecognition браузера с промежуточными результатами в реальном времени, плюс кнопки динамика для озвучивания и автоматическое чтение ответов ассистента, без настройки и без API-ключа.

42 месяца назадЗрение, голос и мультимодальностьMIT
X

dsh-draw-router

xiaozhe7772222/dsh-draw-router

Единый маршрутизатор генерации изображений для DeepSeek Harness (DSH): автоматически обнаруживает модели изображений на любом OpenAI-совместимом endpoint, предоставляет инструменты draw_image и draw_list_sources, поддерживает SenseNova, StepFun, Agnes, Qwen, Flux, SD, Imagen и другие.

4в прошлом месяцеЗрение, голос и мультимодальностьMIT
N

free-vision-skill

niyongsheng/free-vision-skill

Полностью локальное понимание изображений и OCR через Vision Framework macOS: `ocr_image` (текст, макет таблицы + координаты) и `view_image` (сцена, лица, QR) — вставьте несколько изображений в поле ввода в веб-интерфейсе или передайте путь/URL/base64; изображения никогда не покидают ваш Mac.

4в прошлом месяцеЗрение, голос и мультимодальностьMIT
G

deepseek-vision (dsh-plugin-deepseek-vision)

gou-gee/deepseek-vision

Vision MCP и бандл DSH для текстового DeepSeek: инструменты analyze_image, analyze_clipboard, compare_images и vision_status, страница визуальных настроек, бесплатный GLM-4.6V-Flash по умолчанию, кэширование результатов и устойчивость к ограничению скорости; ключи не попадают в логи.

426 дней назадЗрение, голос и мультимодальностьMIT
F

dsh-plugin-deepeye

favio8/dsh-plugin-deepeye

Плагин зрения DeepEye для DeepSeek Harness (DSH): описание изображений, OCR, VQA, разметка UI и анализ буфера обмена.

42 месяца назадЗрение, голос и мультимодальность
H

dsh-her-eyes

huashenglian/dsh-her-eyes

Плагин dsh, позволяющий AI автоматически вызывать VLM (мультимодальные модели) для визуального анализа.

42 месяца назадЗрение, голос и мультимодальностьMIT