Перейти к основному содержимому

Плагины

Находите, фильтруйте и устанавливайте плагины DeepSeek-Harness.

Найдено плагинов: 15

S

dsh-ros2

stvli/dsh-ros2

Набор инструментов отладки ROS2 и визуального анализа состояния робота для DeepSeek Harness: перечисление узлов/топиков/сервисов/действий/интерфейсов/TF, JSON-топология всего графа, проверки rosdep, одобряемые сборки и скаффолдинг пользовательских сообщений, скриншоты GUI и мультимодальное визуальное наблюдение, а также внеэкранный рендеринг headless RViz2 (low-poly меши, прямое чтение пикселей, сквозной GPU — рендеринг движения на 30 Гц) с параллельным VLM-анализом в реальном времени.

22позавчераИнструменты и функцииMIT
F

dsh-vision-proxy

flyvhidbwo/dsh-vision-proxy

Мозг DeepSeek + автоматическая транскрипция изображений: прикрепляйте изображения в GUI, и каждое по умолчанию транскрибируется через официальную модель deepseek-v4-flash-vision-exp (чисто текстовый мозг V4-Pro тоже может видеть изображения), в качестве альтернатив — любая VLM, совместимая с OpenAI, или локальный Ollama.

15в прошлом месяцеЗрение, голос и мультимодальностьMIT
D

dsh-video-lens

dundunhan/dsh-video-lens

Наделяет текстовых агентов DeepSeek Harness пониманием видео: семплирование кадров с учётом сцен + VLM + необязательная ASR-транскрипция, объединённые в доказательства на временной шкале. / Плагин понимания видео для чисто текстовых моделей (семплирование кадров по сценам + VLM + необязательная расшифровка речи).

13в прошлом месяцеЗрение, голос и мультимодальностьMIT
I

dsh-video-understand

ilps2/dsh-video-understand

Недорогой инструмент понимания видео: video_understand преобразует ссылку Bilibili / BV / локальное видео в информационный слой AVIS (ASR + структура сцен + отслеживание объектов + YOLO-метки) и возвращает summary + Q&A. Есть динамическая маршрутизация между слоями, управляемая вопросами (L0 ASR / L1 отслеживание объектов / L2 VLM по ключевым кадрам), повторное использование семантического слоя для повторяющихся вопросов и лимит бюджета на каждый вопрос. Python-движок: для базового слоя нужны faster-whisper / opencv / yt-dlp (~200-300MB); опциональный семантический слой добавляет ~2GB torch / transformers / ultralytics. Встроенный doctor --fix настраивает venv и устанавливает оба набора.

8в прошлом месяцеИнструменты и функции
5

dsh-vision

54xkeee/dsh-vision

Зрение для текстового DeepSeek по умолчанию через Doubao Web (бесплатно, без API-ключа — управляет вашим авторизованным Chrome через мост Windows CDP), с квотой Antigravity IDE (flash/pro) или резервным вариантом Gemini; автоматическое повышение уровня детализации, память визуальных доказательств с регидратацией после сжатия, кеш по хешу контента и двуязычная клиентская панель.

72 месяца назадЗрение, голос и мультимодальностьMIT
S

dsh-vision-bridge

sfyyy/dsh-vision-bridge

Визуальная обработка по запросу для текстовых сеансов DSH: изображения становятся маркерами, а инструмент vision_describe отправляет только изображение и вопрос в модель визуального анализа, совместимую с OpenAI

52 месяца назадЗрение, голос и мультимодальностьMIT
H

dsh-her-eyes

huashenglian/dsh-her-eyes

Плагин dsh, позволяющий AI автоматически вызывать VLM (мультимодальные модели) для визуального анализа.

42 месяца назадЗрение, голос и мультимодальностьMIT
H

dsh-omni-workstation

huashenglian/dsh-omni-workstation

Мультимодальная рабочая станция для DSH: analyze_image по упорядоченной цепочке переключения из нескольких карт VLM, набор из шести инструментов зрения (масштабирование, выбор цвета, попиксельное сравнение, OCR, обнаружение элементов, встроенный показ) с общим распознавателем изображений, generate_image по протоколам OpenAI/DashScope/ComfyUI, асинхронный generate_video с несколькими картами и конструктором /build-video-tool, а также TTS speak/clone_voice по семи провайдерам — всё управляется одной автосохраняемой страницей настроек.

314 дней назадЗрение, голос и мультимодальностьMIT
5

dsh-youreyes

54xkeee/dsh-youreyes

Набор инструментов vision для текстового DeepSeek: вызываемый моделью инструмент `vision`, обёртки-адаптеры для deepseek/opencode-go (v4 flash/pro), квота Antigravity IDE (default, flash/pro) / любой совместимый с OpenAI VLM / Gemini / локальные каналы Ollama, память доказательств с ре-гидратацией после компактации, кеш хеша содержимого и двуязычная клиентская панель.

22 месяца назадЗрение, голос и мультимодальностьMIT
W

dsh-file-attachment

wszhoho/dsh-file-attachment

Drag-and-drop / paste / upload files and images; on non-multimodal models images are auto-described by a configured VLM.

13 дня назадУлучшения UIMIT
X

dsh-image-vision

xsoc1/dsh-image-vision

Мост вложений-изображений в чате с инструментом view_image для любой OpenAI-совместимой VLM (локальная Ollama или облако): вставленные/перетащенные изображения становятся маркерами путей view_image, прежде чем достичь текстовых моделей DeepSeek.

12 месяца назадЗрение, голос и мультимодальность
G

dsh-tool-vision

gloryxpnv/dsh-tool-vision

Локальное структурированное зрение для текстовых агентов: изображения уходят в локальный OpenAI-совместимый VLM и возвращаются как JSON-доказательства (сводка, дословный OCR, области вёрстки, сущности и связи, цвета, явная неуверенность), с защитой от галлюцинаций и необязательным мостом вставки и загрузки; без облачных затрат, изображения не покидают машину.

12 месяца назадЗрение, голос и мультимодальностьMIT
F

dsh-sight

fu3rte/dsh-sight

Подключаемое зрение для текстовых моделей DeepSeek Harness (dsh): инструмент `vision` со встроенными дешёвыми/бесплатными пресетами VLM, пакетным анализом нескольких изображений, приёмом изображений через вставку и веб-страницей настроек с горячей перезагрузкой.

12 месяца назадЗрение, голос и мультимодальностьMIT
R

dsh-llm-mlx

robbywang25/dsh-llm-mlx

Use local MLX-LM or MLX-VLM models in DeepSeek Harness through a loopback OpenAI-compatible provider, with optional DSH-owned server startup.

027 дней назадМодели и провайдерыMIT
L

dsh-mingmu

lab-sku/dsh-mingmu

明眸 VisionBridge - Визуальный мост собственной разработки: когда слепая модель получает изображения, она автоматически вызывает визуальную модель для распознавания и передаёт распознанный текст обратно в основную модель; незаметно, настраиваемо, без потерь при обновлении.

02 месяца назадЗрение, голос и мультимодальностьMIT