Зрение, голос и мультимодальность
Плагины «Зрение, голос и мультимодальность» дают текстовым моделям DeepSeek в DeepSeek-Harness (dsh) глаза, уши и голос. Здесь есть инструменты зрения и провайдерские маршруты, которые распознают и описывают вставленные скриншоты через Zhipu GLM, Gemini, Doubao или локальный Ollama, голосовой ввод с микрофона через браузерный Web Speech API или Whisper-совместимые API, озвучивание ответов с помощью Edge TTS или собственных голосов, полнодуплексные голосовые режимы, а также генераторы изображений, видео и музыки.
Найдено плагинов: 312
dsh-ocr-local
balcoz/dsh-ocr-local
Локальный OCR для DeepSeek Harness: вставьте или прикрепите изображение, получите его текст через PP-OCRv5 + ONNX Runtime, полностью офлайн. TUI (cc-tui) и Web.
dsh-vision-bridge
sfyyy/dsh-vision-bridge
Визуальная обработка по запросу для текстовых сеансов DSH: изображения становятся маркерами, а инструмент vision_describe отправляет только изображение и вопрос в модель визуального анализа, совместимую с OpenAI
dsh-voice-input
0nt-one/dsh-voice-input
Кнопка микрофона в строке инструментов композера: речь-в-текст через Web Speech API (Chrome/Edge), переключение языка и опциональная автоматическая отправка, без зависимостей.
dsh-plugin-appshot
tauruswood/dsh-plugin-appshot
Codex Appshots для DSH: захват переднего активного окна горячей клавишей и бесшовное монтирование его в композер для запросов агента.
dsh-screenshot
paicat1/dsh-screenshot
Захват экрана без зависимостей для DSH: Lightweight — ноль зависимостей, ноль бинарников; Stage & shoot — полноэкранный захват, раскладка окон, hover-snap захват перекрытых окон в один клик; самообслуживание агента — доставка только путём; пути универсальны, в паре с modlens (опционально) — структурированные доказательства за один вызов.
dsh-guide-dog
atropinoltt/dsh-guide-dog
Мультимодальный плагин на базе MiniMax: режим голосового вызова в реальном времени (потоковая беседа, плавающий интерфейс дока), голосовой режим и ввод голоса через микрофон, а также инструменты генерации изображений/видео/музыки/речи и визуального анализа.
canvas-workbench
elangan1997-cmyk/canvas-workbench
Локальный графический рабочий стол, без абонентской платы: используйте собственный API для генерации изображений (любой OpenAI-совместимый интерфейс, без подписки), вёрстка холста + ретушь/стирание/удаление фона/OCR/векторизация, редактируемые PSD/AI на выходе, двусторонний мост на уровне слоёв Photoshop/Illustrator
dsh-tts-bridge
yuuyuko-uu/dsh-tts-bridge
Озвучивает разговоры DSH, используя встроенное чтение вслух на веб-странице DeepSeek, управляемое небольшим расширением браузера.
dsh-cycle-image-gen
chengzzzi44/dsh-cycle-image-gen
Инструмент генерации изображений для DeepSeek Harness через любой OpenAI-совместимый эндпоинт изображений, со встроенной галереей в веб-интерфейсе.
tripo3d-plugin-dsh
vast-ai-research/tripo3d-plugin-dsh
Навыки Tripo 3D для DeepSeek Harness — генерация готовых для движка 3D-ресурсов из текстового запроса или референсного изображения через tripo-cli, с текстурированием, риггингом, ретопологией и конвертацией форматов за один проход.
deepseek-vl-support
limccn/deepseek-vl-support
Добавляет моделям DeepSeek (только текст) возможность зрения в клиентах Claude Code, Codex и Agent Plugins: описывает изображения через любой совместимый с OpenAI vision-эндпоинт.
screenshot-feedback-hook-mcp (dsh-plugin)
lkh081231/screenshot-feedback-hook-mcp
Добавляет инструмент снятия скриншота и две опциональные точки автоматического захвата, помещая экран в диалог как блок изображения; требует модель с поддержкой изображений.
dsh-pdf-reader
angeloszou/dsh-pdf-reader
Плагин контентно-ориентированного чтения PDF для визуальных моделей: профилирует каждую страницу на наличие рисунков (векторных и растровых), таблиц, риска формул и двухколоночной вёрстки, затем применяет гибридное контентно-ориентированное извлечение, рендерит страницы с рисунками/таблицами/формулами как высокодетализированные обрезки регионов. Предоставляет низкодетализированный предпросмотр для понимания макета страницы и рендерит указанный регион в высоком разрешении. Упакован как несколько инструментов для агентов.
dsh-hos-scrcpy
ns-zzj/dsh-hos-scrcpy
Управляйте телефоном HarmonyOS из веб-интерфейса DSH с ИИ: живая зеркализация экрана H.264, касания мышью и системные клавиши, поток hilog и агентные инструменты, которые позволяют модели читать экран, находить элементы UI, затем нажимать, долго нажимать, нажимать клавиши или вводить текст.
dsh-vision-hub (tool-vision)
xing666173/dsh-vision-hub
Расширенный набор инструментов vision: 14 пиксельных vision-инструментов (describe, ground, detect, crop, pixel-diff, OCR, OCR длинных скриншотов, vectorize, colors, cutout, screenshot, present, materialize, html-screenshot) на одном OpenAI-совместимом эндпоинте, с чистыми маркерами [图片: path], классификацией безопасности контента и авто-ретраем при лимите запросов.
dsh-image-pathify
dami9527/dsh-image-pathify
Позволяет чисто текстовым моделям работать с вставленными в чат изображениями: нативный визуальный режим, пакетный просмотр изображений и встроенный OpenAI-совместимый инструмент analyze_image; модели с поддержкой зрения не затрагиваются.
dsh-voice
stardustlc666/dsh-voice
Голосовые инструменты: бесплатный нейросетевой синтез речи edge-tts, совместимая с OpenAI транскрипция ASR, список голосов, пакетное прослушивание голосов и самопроверка состояния.
dsh-voice
haoku123/dsh-voice
Полнодуплексный голосовой режим для веб-интерфейса: диктовка касанием для переключения или удержанием (клавиша отправки или `Ctrl`) с живыми субтитрами, хостовая SenseVoice ASR через sherpa-onnx, ответы вслух предложение за предложением, а речь прерывает воспроизведение и текущий ход (истинное перебивание). Ключ API не требуется.
dsh-chatvoice
fuzzysoul/dsh-chatvoice
Бесплатный голосовой замкнутый цикл для веб-интерфейса: ввод с микрофона через SpeechRecognition браузера с промежуточными результатами в реальном времени, плюс кнопки динамика для озвучивания и автоматическое чтение ответов ассистента, без настройки и без API-ключа.
dsh-draw-router
xiaozhe7772222/dsh-draw-router
Единый маршрутизатор генерации изображений для DeepSeek Harness (DSH): автоматически обнаруживает модели изображений на любом OpenAI-совместимом endpoint, предоставляет инструменты draw_image и draw_list_sources, поддерживает SenseNova, StepFun, Agnes, Qwen, Flux, SD, Imagen и другие.
free-vision-skill
niyongsheng/free-vision-skill
Полностью локальное понимание изображений и OCR через Vision Framework macOS: `ocr_image` (текст, макет таблицы + координаты) и `view_image` (сцена, лица, QR) — вставьте несколько изображений в поле ввода в веб-интерфейсе или передайте путь/URL/base64; изображения никогда не покидают ваш Mac.
deepseek-vision (dsh-plugin-deepseek-vision)
gou-gee/deepseek-vision
Vision MCP и бандл DSH для текстового DeepSeek: инструменты analyze_image, analyze_clipboard, compare_images и vision_status, страница визуальных настроек, бесплатный GLM-4.6V-Flash по умолчанию, кэширование результатов и устойчивость к ограничению скорости; ключи не попадают в логи.
dsh-plugin-deepeye
favio8/dsh-plugin-deepeye
Плагин зрения DeepEye для DeepSeek Harness (DSH): описание изображений, OCR, VQA, разметка UI и анализ буфера обмена.
dsh-her-eyes
huashenglian/dsh-her-eyes
Плагин dsh, позволяющий AI автоматически вызывать VLM (мультимодальные модели) для визуального анализа.