Перейти к основному содержимому

Зрение, голос и мультимодальность

Плагины «Зрение, голос и мультимодальность» дают текстовым моделям DeepSeek в DeepSeek-Harness (dsh) глаза, уши и голос. Здесь есть инструменты зрения и провайдерские маршруты, которые распознают и описывают вставленные скриншоты через Zhipu GLM, Gemini, Doubao или локальный Ollama, голосовой ввод с микрофона через браузерный Web Speech API или Whisper-совместимые API, озвучивание ответов с помощью Edge TTS или собственных голосов, полнодуплексные голосовые режимы, а также генераторы изображений, видео и музыки.

Найдено плагинов: 312

G

dsh-tts

goodandready/dsh-tts

Озвучивает ответы агента в веб-интерфейсе DeepSeek Harness через цепочку отката между провайдерами (OpenAI, ElevenLabs, Google, Azure, Groq, Deepgram, OpenRouter, Edge, Piper, eSpeak), так что сбойный или ограниченный по частоте провайдер передаёт эстафету следующему, а не замолкает.

26 дней назадЗрение, голос и мультимодальностьMIT
O

DSH-dseyes

okkay712/dsh-dseyes

Нативные прикреплённые изображения для текстового DeepSeek в Web GUI: вставленные или перетащенные изображения отображаются в виде миниатюр в сессии, и перед отправкой хост считывает их с помощью бесплатного API визуального распознавания Zhipu GLM-4V-Flash (цепочка отката glm-4v-flash) и подставляет описание, благодаря чему DeepSeek отвечает об изображении, а оригинал сохраняется в истории.

2в прошлом месяцеЗрение, голос и мультимодальностьMIT
W

dsh-wm

waynejin0918/dsh-wm

Инструментарий для исследования мировых моделей: инспектирует кадры, именует 3D/пиксельные/латентные маршруты, оценивает pred против GT, навыки RSI / wm.yaml.

22 месяца назадЗрение, голос и мультимодальностьMIT
I

dsh-tool-visual-primitives

inkshadewoods/dsh-tool-visual-primitives

Анализирует изображения из диалогов с помощью мод-специфичных промптов (caption, UI, document, grounding, topology и т.д.) и внедряет структурированные доказательства с примитивами координат (боксы, точки, ссылки) в виде текста, с кэшированием на уровне сессии для повторного использования при replay и compaction.

23 дня назадЗрение, голос и мультимодальностьMIT
V

dsh-smart-input

v-quest123456/dsh-smart-input

Плагин умного ввода для DeepSeek Harness — голосовой ввод + оптимизация промптов

22 месяца назадЗрение, голос и мультимодальностьMIT
G

dsh-vision-bridge

goodandready/dsh-vision-bridge

Направляет изображения в выбранную вами модель компьютерного зрения — авто-перезапись, явные инструменты или гибридный режим — чтобы текстовый чат-модель не срывала ход, в котором есть картинка.

26 дней назадЗрение, голос и мультимодальностьMIT
P

muxiva-dsh-voice

piyotahu/muxiva-dsh-voice

Локально-ориентированная полнодуплексная голосовая связь для DeepSeek Harness, оркестрируемая Muxiva

22 месяца назадЗрение, голос и мультимодальностьApache-2.0
P

dsh-voice-call

pandapolo/dsh-voice-call

Голосовые звонки, инициируемые агентом: `offer_call` звонит человеку (接听/拒接/稍后再说); принятые звонки синтезируются и воспроизводятся локально через CrispASR + Qwen3-TTS (9 голосов, 2 китайских диалекта), а отклонённые возвращают решение агенту.

23 дня назадЗрение, голос и мультимодальностьMIT
M

dsh-fish-tts

mari23333/dsh-fish-tts

Озвучивает ответы ассистента только через Fish Audio API (ключ нужен свой): чтение по каждому сообщению, переключатель автопрочтения и страница настроек для модели, voice reference_id, зашифрованного API-ключа и прокси.

2позавчераЗрение, голос и мультимодальностьMIT
X

dsh-vision

xiaoshihou514/dsh-vision

Нативное расширение возможностей зрения, использующее либо Zhipu (бесплатно), либо Qwen-VL (локально).

2в прошлом месяцеЗрение, голос и мультимодальностьMIT
K

dsh-vision-recognizer

kaixinbaba/dsh-vision-recognizer

Маршрут визуального поставщика, который преобразует прикреплённые изображения в текст через настраиваемую модель (более 15 совместимых с OpenAI и Anthropic поставщиков), пока DeepSeek продолжает отвечать.

2в прошлом месяцеЗрение, голос и мультимодальностьMIT
H

dsh-open-eyes

hyp6666/dsh-open-eyes

Визуальный мост для текстовых маршрутов DeepSeek, который анализирует прикреплённые и локальные изображения через настраиваемые endpoints OpenAI Responses, Chat Completions или Anthropic Messages, оставляя image-capable маршруты нативными.

227 дней назадЗрение, голос и мультимодальностьMIT
5

dsh-youreyes

54xkeee/dsh-youreyes

Набор инструментов vision для текстового DeepSeek: вызываемый моделью инструмент `vision`, обёртки-адаптеры для deepseek/opencode-go (v4 flash/pro), квота Antigravity IDE (default, flash/pro) / любой совместимый с OpenAI VLM / Gemini / локальные каналы Ollama, память доказательств с ре-гидратацией после компактации, кеш хеша содержимого и двуязычная клиентская панель.

22 месяца назадЗрение, голос и мультимодальностьMIT
3

dsh-vision (vision-tool)

314857493/dsh-vision

Вызываемый моделью инструмент `vision` для DeepSeek Harness: описывает и распознаёт текст на файлах изображений, напрямую вызывая бесплатный Zhipu GLM vision API (цепочка fallback glm-4v-flash), без внешнего CLI.

228 дней назадЗрение, голос и мультимодальностьMIT
3

dsh-vision (vision-route)

314857493/dsh-vision

Регистрирует маршрут провайдера `deepseek-vision`: веб-интерфейс принимает вставленные изображения и преобразует их в текст через бесплатный Zhipu GLM vision API, после чего передаёт в адаптер DeepSeek.

228 дней назадЗрение, голос и мультимодальностьMIT
X

dsh-vision-bridge

ximengxiaolan/dsh-vision-bridge

Изображения, прикреплённые в composer, распознаются в текст vision-моделью, совместимой с OpenAI, прежде чем попасть к текстовым моделям DeepSeek.

22 месяца назадЗрение, голос и мультимодальностьMIT
J

dsh-live2d-voice

john-walks-slow/dsh-live2d-voice

Live2D session view with realtime voice: continuous voice input, streaming TTS, subtitle translation, multi-model catalog, standalone entry / Live2D 实时语音会话视图:连续语音输入、流式 TTS、字幕翻译、多模型目录、独立入口

14 дня назадЗрение, голос и мультимодальностьMIT
W

dsh-multi-tts

wyr-233/dsh-multi-tts

Per-reply read-aloud with a multi-provider settings page — MiniMax or any OpenAI-compatible /audio/speech endpoint, with voice, emotion, speed and model selection plus an auto-read toggle.

121 день назадЗрение, голос и мультимодальность
V

dsh-live-voice

victorwads/dsh-live-voice

Local-first voice conversations for DSH, with local speech recognition and synthesis and optional external providers.

118 дней назадЗрение, голос и мультимодальностьGPL-3.0
C

dsh-vision-autoswitch

cultofluna/dsh-vision-autoswitch

DeepSeek Harness plugin: auto-route image-bearing requests to deepseek-v4-flash-vision-exp, then fall back to the original model.

1в прошлом месяцеЗрение, голос и мультимодальностьMIT
N

dsh-dictate

navneetset/dsh-dictate

Live speech-to-text dictation into the dsh web composer via OpenRouter STT

127 дней назадЗрение, голос и мультимодальностьMIT
M

dsh-minimax-asr

moluyao/dsh-minimax-asr

MiniMax 语音识别(asr-1.0)+ 语音合成(speech-2.8-hd)的 DeepSeek Harness 全局插件:转写工具、任务结束后用喇叭念一句的播报、实时免手对话、303 个音色可选

119 дней назадЗрение, голос и мультимодальностьMIT
N

dsh-imgdraw

ninjasln-labs/dsh-imgdraw

Text-to-image for DeepSeek Harness: a `draw_image` model tool, an input-bar 生图 button with a prompt popup (async generation, 4-grid results, download / keep / delete), an /imgdraw image route, and persisted history. Backends: DashScope wan2.7-image (free

128 дней назадЗрение, голос и мультимодальностьMIT
D

dsh-voice-talk

duoduoqian708/dsh-voice-talk

Voice conversation mode for the DSH Web GUI: tap the mic to start a full-screen call, talk hands-free, and hear each reply read aloud as it streams. Bilingual (Chinese/English) UI, light and dark themes, adjustable speech rate, and switchable voices.

120 дней назадЗрение, голос и мультимодальностьMIT