Перейти к основному содержимому

Плагины

Находите, фильтруйте и устанавливайте плагины DeepSeek-Harness.

Найдено плагинов: 18

F

dsh-vision-proxy

flyvhidbwo/dsh-vision-proxy

Мозг DeepSeek + автоматическая транскрипция изображений: прикрепляйте изображения в GUI, и каждое по умолчанию транскрибируется через официальную модель deepseek-v4-flash-vision-exp (чисто текстовый мозг V4-Pro тоже может видеть изображения), в качестве альтернатив — любая VLM, совместимая с OpenAI, или локальный Ollama.

16в прошлом месяцеЗрение, голос и мультимодальностьMIT
R

dsh-plugin-call-me

radres/dsh-plugin-call-me

Звонит на ваш телефон через CallKit: инструменты `call_me` и `text_me`, а также опциональные звонки по завершении хода и для подтверждений, чей устный ответ транскрибируется обратно в сессию.

7позавчераИнтеграции и удалённый доступMIT
S

dsh-voice-assistant

supersyh-sss/dsh-voice-assistant

Голосовой ассистент для dsh web: произнесите фразу активации (например, «小鲸»), чтобы включить диктовку без рук — сказанное распознаётся и автоматически вводится в поле чата. Поддерживает голосовые команды редактирования (отправить, очистить, новая строка, остановить чтение) и читает ответы ассистента вслух на китайском. Распознавание речи выполняется локально в браузере через sherpa-onnx WASM, поэтому работает офлайн без API-ключа.

3в прошлом месяцеЗрение, голос и мультимодальностьMIT
B

dsh-stt-input

baisama-cloud/dsh-stt-input

Голосовой ввод с распознаванием речи для Web UI: кнопка микрофона в композиторе транскрибирует речь в черновик через Web Speech API браузера (без настройки) или совместимый с OpenAI Whisper API (OpenAI / Groq), с выбором модели и языка в Настройках.

3в прошлом месяцеЗрение, голос и мультимодальностьMIT
J

dsh-voice

jesse-njx/dsh-voice

Голосовые заметки на входе, озвученные ответы на выходе: надиктуйте аудио, которое становится сообщением пользователя (транскрипция), пусть агент читает ответы вслух (озвучивание), локально в ~/.dsh/voice.

32 месяца назадЗрение, голос и мультимодальностьMIT
B

dsh-vision-plugin

bug-huntter/dsh-vision-plugin

Настраиваемое распознавание изображений для текстовых моделей DSH: изображения сначала транскрибируются моделью vision, совместимой с OpenAI (базовый URL, идентификатор модели и API-ключ задаются в разделе настроек), а затем передаются основной модели в виде текста, при этом заявляется поддержка ввода изображений. Схема аутентификации по API-ключу выбирается (заголовки запросов в стиле OpenAI, Anthropic, Gemini или Azure), а отсутствие ключа сообщается до отправки любого запроса.

27 дней назадЗрение, голос и мультимодальностьMIT
K

dsh-vision-recognizer

kaixinbaba/dsh-vision-recognizer

Маршрут визуального поставщика, который преобразует прикреплённые изображения в текст через настраиваемую модель (более 15 совместимых с OpenAI и Anthropic поставщиков), пока DeepSeek продолжает отвечать.

22 месяца назадЗрение, голос и мультимодальностьMIT
3

dsh-vision (vision-route)

314857493/dsh-vision

Регистрирует маршрут провайдера `deepseek-vision`: веб-интерфейс принимает вставленные изображения и преобразует их в текст через бесплатный Zhipu GLM vision API, после чего передаёт в адаптер DeepSeek.

2в прошлом месяцеЗрение, голос и мультимодальностьMIT
X

dsh-vision-bridge

ximengxiaolan/dsh-vision-bridge

Изображения, прикреплённые в composer, распознаются в текст vision-моделью, совместимой с OpenAI, прежде чем попасть к текстовым моделям DeepSeek.

22 месяца назадЗрение, голос и мультимодальностьMIT
J

dsh-mmroute

jmxsxwyzjdwl/dsh-mmroute

Прозрачная мультимодальная маршрутизация для текстовых моделей: каждое изображение в каждом вызове модели полностью транскрибируется (дословное OCR, данные, зоны неопределённости, защита от инъекций) вашим собственным мультимодальным интерпретатором, с целенаправленным повторным просмотром через vision_relook и автоматическим повтором при сбоях, связанных с изображениями. Без встроенных эндпоинтов, без заимствованных логинов.

128 дней назадЗрение, голос и мультимодальностьMIT
A

dsh-audio-copilot

ai-yucheng/dsh-audio-copilot

Аудио-второй пилот для DeepSeek Harness: транскрибирует аудио (ASR) и синтезирует речь (TTS) — даёт текстовым агентам уши и голос. Из коробки локальный Windows SAPI TTS; настраиваются ASR/TTS-эндпоинты, совместимые с OpenAI. Включает голосовой ввод в композере.

12 месяца назадЗрение, голос и мультимодальностьMIT
3

dsh-vision

314857493/dsh-vision

Плагин DeepSeek Harness: маршрут `deepseek-vision`, который объявляет ввод изображений и распознаёт вставленные изображения через бесплатные модели зрения Zhipu GLM, прежде чем передать управление адаптеру DeepSeek.

12 месяца назадЗрение, голос и мультимодальностьMIT
C

dsh-voice-mimo

ch1bug/dsh-voice-mimo

Xiaomi MiMo-powered voice for DeepSeek Harness: browser 🎤/🧠/🔊 UI, voice_transcribe/voice_understand/voice_speak tools, configurable voice map (preset/voicedesign/voiceclone). Fork of zhuiyueya/dsh-voice (MIT), Settings pattern from Anionex/dsh-vision-toolkit (MIT).

021 день назадЗрение, голос и мультимодальностьMIT
M

dsh-voice-input-en

mohith-das/dsh-voice-input-en

Minimal English-only voice input for the DeepSeek Harness Web UI: a mic button in the composer that transcribes speech into the draft via the browser's native SpeechRecognition API. No dependencies, no subprocess, no network calls beyond whatever the brow

0в прошлом месяцеЗрение, голос и мультимодальностьMIT
S

dsh-vision-pro-bridge

shainedemo/dsh-vision-pro-bridge

Vision bridge for text-only DeepSeek models: transcribes attached images with deepseek-v4-flash-vision-exp before they reach deepseek-v4-pro, with no third-party dependencies.

0в прошлом месяцеЗрение, голос и мультимодальностьMIT
J

dsh-autovision

junkrat9527/dsh-autovision

Vision for text-only dsh models: paste an image and a configured multimodal model transcribes it to text automatically — transparent twin routing, an agent-callable read-image tool, no built-in keys or relay.

02 месяца назадЗрение, голос и мультимодальностьMIT
N

dsh-voice-input

newdanew/dsh-voice-input

Voice input for the web UI: a mic button in the composer that transcribes speech into the draft via the Web Speech API, with an optional auto-send toggle.

02 месяца назадЗрение, голос и мультимодальностьMIT
E

dsh-plugin-image-input

elohia/dsh-plugin-image-input

Image-to-text input for the Web UI: paste or drag an image and it is transcribed into structured text and sent, giving text-only LLMs image-input takeover (OpenAI-compatible vision API).

02 месяца назадЗрение, голос и мультимодальностьMIT