Плагины
Находите, фильтруйте и устанавливайте плагины DeepSeek-Harness.
Найдено плагинов: 30
dsh-prompt-enhancer
fishsb/dsh-prompt-enhancer
Улучшение промптов в один клик (5 режимов, цепочка памяти, запасной вариант нескольких моделей) плюс распознавание речи (облачный Qwen3-ASR / офлайн SenseVoice, авто-остановка при тишине) для композера, с перезапуском службы DSH в один клик.
dsh-voice-scribe
pensivefei/dsh-voice-scribe
Голосовой ввод для веб-интерфейса: нажмите Alt (или Alt+Space) для запуска/остановки диктовки, браузерный Web Speech (без настройки) или облачный ASR, совместимый с OpenAI, опциональная полировка через LLM, настроенный в DSH, интерфейс настроек.
dsh-ears
wiziscool/dsh-ears
Плагин голосового ввода для DeepSeek Harness (dsh): кнопка микрофона в композере преобразует речь в черновик транскрипции с выбором бэкендов распознавания речи, опциональной доработкой через собственные маршруты LLM dsh и нативной страницей настроек.
dsh-voice-mode (dsh-voice-mode)
qishuilalala/dsh-voice-mode
Полнодуплексный голосовой режим для Web UI DeepSeek Harness: переключатель (автоотправка после паузы 2 с) или удержание для диктовки в редактируемый черновик через потоковое распознавание zipformer2, опциональное слово активации; побуквенное чтение Edge TTS с живыми субтитрами, а речь прерывает воспроизведение и текущий ход (настоящее barge-in). Локальное распознавание, без API-ключа.
dsh-video-lens
dundunhan/dsh-video-lens
Наделяет текстовых агентов DeepSeek Harness пониманием видео: семплирование кадров с учётом сцен + VLM + необязательная ASR-транскрипция, объединённые в доказательства на временной шкале. / Плагин понимания видео для чисто текстовых моделей (семплирование кадров по сценам + VLM + необязательная расшифровка речи).
dsh-voice-ai-girlfriend-plugin
beiyege-01/dsh-voice-ai-girlfriend-plugin
Голосовая AI-девушка для Web UI: микрофонный ввод через FunASR, голосовые ответы Qwen3-TTS, окно анимации компаньона и двусторонний QQ-чат (текст/голос/изображение push) через NapCat.
dsh-bilibili
czx2244/dsh-bilibili
Анализ видео Bilibili: метаданные, транскрипт (резервное ASR через Bijian/sherpa-onnx/whisper.cpp), комментарии, данмаку и чёткие ключевые кадры с опциональными локальными описаниями через vision.
dsh-video-understand
ilps2/dsh-video-understand
Недорогой инструмент понимания видео: video_understand преобразует ссылку Bilibili / BV / локальное видео в информационный слой AVIS (ASR + структура сцен + отслеживание объектов + YOLO-метки) и возвращает summary + Q&A. Есть динамическая маршрутизация между слоями, управляемая вопросами (L0 ASR / L1 отслеживание объектов / L2 VLM по ключевым кадрам), повторное использование семантического слоя для повторяющихся вопросов и лимит бюджета на каждый вопрос. Python-движок: для базового слоя нужны faster-whisper / opencv / yt-dlp (~200-300MB); опциональный семантический слой добавляет ~2GB torch / transformers / ultralytics. Встроенный doctor --fix настраивает venv и устанавливает оба набора.
dsh-voice
stardustlc666/dsh-voice
Голосовые инструменты: бесплатный нейросетевой синтез речи edge-tts, совместимая с OpenAI транскрипция ASR, список голосов, пакетное прослушивание голосов и самопроверка состояния.
dsh-voice
haoku123/dsh-voice
Полнодуплексный голосовой режим для веб-интерфейса: диктовка касанием для переключения или удержанием (клавиша отправки или `Ctrl`) с живыми субтитрами, хостовая SenseVoice ASR через sherpa-onnx, ответы вслух предложение за предложением, а речь прерывает воспроизведение и текущий ход (истинное перебивание). Ключ API не требуется.
dsh-hold-to-talk
wangzhanchao883/dsh-hold-to-talk
Ввод одной рукой и без клавиатуры для поля ввода: зажмите кнопку мыши на поле ввода, говорите, отпустите — текст попадает в черновик, а сдвиг вверх отменяет ввод, не оставляя недописанной фразы. Не нужно целиться в кнопку микрофона и запоминать горячую клавишу; рука никогда не покидает область ввода, что важно, когда вторая рука занята. Распознавание работает полностью офлайн (SenseVoice через sherpa-onnx, без API-ключа, звук не покидает машину).
voco-input-sh
nothree-code/voco-input-sh
Голосовой ввод для Web UI: кнопка микрофона, которая запускает локальное офлайн-распознавание речи VocoType и автоматически вставляет распознанный текст в composer (авторазвертывание, дедупликация, непрерывная диктовка).
dsh-voice-call
biliye/dsh-voice-call
Голосовой ассистент звонков для веб-GUI DSH: перетаскиваемый плавающий шар звонка, VAD на стороне браузера, отправляющий каждую фразу после паузы, распознавание речи FunASR по HTTP или потоково, ответы TTS от MiniMax или совместимые с OpenAI, необязательный режим слова-активатора с автосном и отправка задач в отдельные сессии субагентов с прогрессом, остановкой и озвученными отчётами о завершении.
muxiva-dsh-voice
piyotahu/muxiva-dsh-voice
Локально-ориентированная полнодуплексная голосовая связь для DeepSeek Harness, оркестрируемая Muxiva
dsh-voice-call
pandapolo/dsh-voice-call
Голосовые звонки, инициируемые агентом: `offer_call` звонит человеку (接听/拒接/稍后再说); принятые звонки синтезируются и воспроизводятся локально через CrispASR + Qwen3-TTS (9 голосов, 2 китайских диалекта), а отклонённые возвращают решение агенту.
dsh-wsl-media
173787247/dsh-wsl-media
Local media/doc pipeline: ffprobe, extract, thumbnail, PDF, ASR, pandoc, OCR, exif (allowRoots include IM inbox).
dsh-wsl-im
173787247/dsh-wsl-im
Bridges Feishu, WeCom, DingTalk, QQ, Slack, Discord, Telegram and Mattermost into dsh agents (outbound WS/Stream/Gateway/long-poll/webhook), with im_status, optional local Whisper ASR, plain-text outbound for QQ/DingTalk/Telegram/Mattermost, and env CSV allowlists (DSH_IM_*_ALLOWED_USER_IDS). Empty allowedUserIds means EVERYONE can drive your agent — set a whitelist before exposing a bot.
dsh-minimax-asr
moluyao/dsh-minimax-asr
MiniMax 语音识别(asr-1.0)+ 语音合成(speech-2.8-hd)的 DeepSeek Harness 全局插件:转写工具、任务结束后用喇叭念一句的播报、实时免手对话、303 个音色可选
dsh-funasr-voice
fenglin-ai/dsh-funasr-voice
Offline voice input for the DSH Web UI: mic to local FunASR (SenseVoiceSmall), one-click install, no cloud.
dsh-voice-input-cn
schumchanvi/dsh-voice-input-cn
Готовый к Китаю голосовой ввод для композера. Требуется локальный Python-мост (pip install dashscope websockets, запуск bridge/voice-bridge.py) — сам плагин не работает. Микрофон браузера передаёт 16 кГц PCM в мост, который запускает Alibaba Cloud DashScope ASR (paraformer-realtime-v2); промежуточный текст заполняет черновик в позиции курсора, авто-остановка по тишине, опциональная авто-отправка.
dsh-audio-copilot
ai-yucheng/dsh-audio-copilot
Audio Copilot for DeepSeek Harness: transcribe audio (ASR) and synthesize speech (TTS) — gives text-only agents ears and a voice. Windows-local SAPI TTS out of the box; OpenAI-compatible ASR/TTS endpoints configurable. Includes an in-composer voice-input
dsh-asr-voice
bittersmilezzz/dsh-asr-voice
开口即成文 · Speak-to-prompt for DeepSeek Harness:云端 ASR 语音识别 + 提示词优化 + 填入草稿/自动发送,跨平台 macOS / Windows。
dsh-voice-input
rio-promax/dsh-voice-input
DSH voice input plugin: browser realtime + VAD dictation + local/cloud ASR + DeepSeek AI polish
dsh-voice-input-qwen-asr
jsoncode/dsh-voice-input-qwen-asr
Voice input plugin (dual-face): mic button beside the composer send action, live recording bubble streaming PCM to a local Qwen3-ASR python service managed by the host, plus an ASR environment settings page (clone runtime/model repos, create venv, run ser