Зрение, голос и мультимодальность
Плагины «Зрение, голос и мультимодальность» дают текстовым моделям DeepSeek в DeepSeek-Harness (dsh) глаза, уши и голос. Здесь есть инструменты зрения и провайдерские маршруты, которые распознают и описывают вставленные скриншоты через Zhipu GLM, Gemini, Doubao или локальный Ollama, голосовой ввод с микрофона через браузерный Web Speech API или Whisper-совместимые API, озвучивание ответов с помощью Edge TTS или собственных голосов, полнодуплексные голосовые режимы, а также генераторы изображений, видео и музыки.
Найдено плагинов: 312
dsh-web-ui (dsh-tool-describe-image)
zhu1090093659/dsh-web-ui
Инструмент зрения `describe_image` для текстовых моделей: изображения (локальный путь, URL, вложение) отправляются в настраиваемый совместимый с OpenAI vision endpoint, и в сессию попадает только возвращённый текст.
ipollowork
devin-axis/ipollowork
iPolloWork HyperFrames Video Studio и 27 редактируемых видеошаблонов в виде нативного окна диалога DeepSeek Harness.
modlens
liustack/modlens
Мост зрения для текстовых моделей: вставьте изображение — получите структурированные JSON-данные (OCR, разметка, семантика).
dsh-vision-router
ysr666/dsh-vision-router
Бесплатное зрение для текстовых агентов: встроенная цепочка распознавания без ключей API плюс пиксельные инструменты (вопрос-ответ, grounding, обрезка, попиксельное сравнение, цвета, OCR, трассировка в SVG, вырезание, скриншоты); просто вставьте изображение.
dsh-vision-toolkit
anionex/dsh-vision-toolkit
Зрение для текстовых моделей: вставьте изображение, и модель переключится на вариант Vision Toolkit для вопросов-ответов по изображениям, сравнения нескольких изображений, OCR длинных скриншотов, воспроизведения UI по скриншоту, привязки элементов и пиксельной разницы. По умолчанию ключ API не требуется — изображения обрабатываются бесплатным сервисом автора, 100 на машину в день; можно настроить на собственного провайдера.
tongflow
tong-io/tongflow
Студийный плагин TongFlow для DeepSeek Harness (dsh): модель проекта в стиле съёмочной группы, рабочие процессы TongFlow, создаваемые агентом, детерминированная генерация медиа, встроенный холст.
dsh-image-gen
shanliuling/dsh-image-gen
Нативная диалоговая генерация изображений для DeepSeek Harness: попросите агента создать изображение, и он выполнит генерацию и сохранит результат прямо в диалоге.
watch-skill
oxbshw/watch-skill
Возможности DeepWatch, устанавливаемые в существующий профиль DeepSeek Harness
dsh-imagegen
dickpy/dsh-imagegen
Генерация изображений на базе ИИ для веб-интерфейса DSH: преобразование текста в изображение и изображения в изображение через настраиваемую конечную точку, совместимую с OpenAI (gpt-image-2 / gpt-image-1 / dall-e-3), с карточкой настроек api_url/api_key и студией генерации с разделённой панелью в боковой панели.
dsh-comfyui
fandc520/dsh-comfyui
Управляйте локальным или удалённым сервером ComfyUI из DeepSeek Harness: инструменты comfyui_run / comfyui_object_info / comfyui_workflow генерируют и редактируют изображения и видео, с библиотекой рабочих процессов (извлечение графа: по компоненту / главный поток / всё), областью загрузки с автоматическим подбором разрешения, живой очередью, шаблонами SDXL и Wan 2.1, сопутствующим навыком и медиапрокси того же источника.
dsh-omi-voice
polinnizhong/dsh-omi-voice
Озвучивание в чате для DeepSeek Harness: нажатием читайте, ставьте на паузу и возобновляйте ответы ИИ естественными голосами Doubao TTS (BYOK); читается только итоговый ответ, код, таблицы и диаграммы отфильтровываются; локальный движок, плагин не хранит API-ключ.
deepseek-harness-video-director
chiphoton/deepseek-harness-video-director
🎬Режиссёр на базе ИИ: плагин генерации видео MiniMax-H3 под управлением DeepSeek-Harness. 🤖Больше, чем промпты. 🪄Интерфейс-канвас.
dsh-design-qa
sunxin-ai/dsh-design-qa
QA по соответствию дизайну для текстовых моделей: инструмент `deepseek_vision` заимствует «глаз» из любого OpenAI-compatible vision route, чтобы модель могла определить, соответствует ли реализация макету; вместе с бенчмарком, стоящим за этим суждением (четыре fixture, 23 внедренных дефекта, raw transcripts) и дисциплиной вопросов, на которой это основано.
picturereader
jing-hy/picturereader
«Чтение» изображений для текстовых моделей: уменьшение масштаба + снижение глубины цвета + отпечатки структуры/цвета преобразуются в текстовые сетки, возвращаемые в диалог, что позволяет модели самостоятельно масштабировать, сэмплировать и распознавать текст (OCR), как мультимодальная модель; полностью локально, без зависимости от внешних моделей, поставляется с навыком методологии чтения изображений и опциональным PaddleOCR.
dsh-voice-scribe
pensivefei/dsh-voice-scribe
Голосовой ввод для веб-интерфейса: нажмите Alt (или Alt+Space) для запуска/остановки диктовки, браузерный Web Speech (без настройки) или облачный ASR, совместимый с OpenAI, опциональная полировка через LLM, настроенный в DSH, интерфейс настроек.
dsh-vision
oil-oil/dsh-vision
Понимание изображений для DeepSeek Harness, близкое к нативному
dsh-web-ui (dsh-tool-describe-image)
damonkoy/dsh-web-ui
Даёт текстовой модели понимание изображений через визуально-языковую модель, представленную как инструмент `describe_image`.
dsh-ears
wiziscool/dsh-ears
Плагин голосового ввода для DeepSeek Harness (dsh): кнопка микрофона в композере преобразует речь в черновик транскрипции с выбором бэкендов распознавания речи, опциональной доработкой через собственные маршруты LLM dsh и нативной страницей настроек.
dsh-plugin-tts
1624318455/dsh-plugin-tts
Озвучивает ответы ассистента через бесплатный Edge TTS или собственные голосовые модели RVC: кнопки озвучивания + автоозвучивание, адаптивное поблочное прогрессивное воспроизведение (длинные тексты без пауз), установка голосовых пакетов из реестра в один клик и портативная среда выполнения RVC.
dsh-media-skills
mjorgin/dsh-media-skills
Бесплатный визуальный мост и генерация изображений для текстовых моделей: чтение вставленных изображений, отказоустойчивое переключение между движками GLM-4V-Flash и Gemini, структурированные доказательства в стиле ModLens и заранее настроенный бесплатный маршрут визуальной модели.
dsh-aigc-canvas
dsh-external/dsh-aigc-canvas
Плагин холста AIGC (cordis).
dsh-talk
perrylink/dsh-talk
Голосовой ввод/вывод для DeepSeek Harness — распознавание речи и синтез речи через микрофон и аудиовыход.
dsh-visual-plugin
jyh20030112/dsh-visual-plugin
Наделяет текстовые модели зрением: пересылает изображения пользователя в совместимую с OpenAI модель зрения и показывает описания на правой панели веб-интерфейса.
dsh-voice-mode (dsh-voice-mode)
qishuilalala/dsh-voice-mode
Полнодуплексный голосовой режим для Web UI DeepSeek Harness: переключатель (автоотправка после паузы 2 с) или удержание для диктовки в редактируемый черновик через потоковое распознавание zipformer2, опциональное слово активации; побуквенное чтение Edge TTS с живыми субтитрами, а речь прерывает воспроизведение и текущий ход (настоящее barge-in). Локальное распознавание, без API-ключа.