Plugins
Durchsuche, filtere und installiere DeepSeek-Harness-Plugins.
18 Plugins gefunden
dsh-vision-proxy
flyvhidbwo/dsh-vision-proxy
DeepSeek-Gehirn + automatische Bildtranskription: Bilder in der GUI anhängen und jedes wird standardmäßig über das offizielle deepseek-v4-flash-vision-exp transkribiert (ein reines Text-V4-Pro-Gehirn kann Bilder sehen), mit jeder OpenAI-kompatiblen VLM oder lokalem Ollama als Alternative.
dsh-plugin-call-me
radres/dsh-plugin-call-me
Lässt dein Telefon über CallKit klingeln: die Tools `call_me` und `text_me`, plus optionale Anrufe bei Rundenende und Freigaben, deren gesprochene Antwort zurück in die Sitzung transkribiert wird.
dsh-voice-assistant
supersyh-sss/dsh-voice-assistant
Sprachassistent für dsh web: Mit dem Weckruf (z. B. „小鲸“) wird freihändiges Diktieren aktiviert – das Gesagte wird transkribiert und automatisch in das Chatfeld getippt. Unterstützt gesprochene Bearbeitungsbefehle (senden, leeren, neue Zeile, Vorlesen beenden) und liest Antworten des Assistenten auf Chinesisch vor. Die Spracherkennung läuft lokal im Browser über sherpa-onnx WASM, funktioniert also offline ohne API-Schlüssel.
dsh-stt-input
baisama-cloud/dsh-stt-input
Speech-to-Text-Spracheingabe für die Web-UI: ein Mikrofon-Button im Composer transkribiert Sprache per Browser Web Speech API (null Konfiguration) oder eine OpenAI-kompatible Whisper-API (OpenAI / Groq) in den Entwurf, mit auswählbarem Modell und Sprache in den Settings.
dsh-voice
jesse-njx/dsh-voice
Sprachnotizen rein, gesprochene Antworten raus: Audio diktieren, das zu Nutzernachrichten wird (Transkription), den Agenten Antworten laut vorlesen lassen (Sprachausgabe), lokal-first unter ~/.dsh/voice.
dsh-vision-plugin
bug-huntter/dsh-vision-plugin
Konfigurierbare Bilderkennung für textbasierte DSH-Modelle: Bildnachrichten werden zunächst von einem OpenAI-kompatiblen Vision-Modell transkribiert (Basis-URL, Modell-ID und API-Schlüssel in einem Einstellungsbereich festgelegt) und dann als Text an das Hauptmodell weitergegeben, während die Unterstützung für Bildeingaben angekündigt wird. Das API-Schlüssel-Authentifizierungsschema ist wählbar (OpenAI-, Anthropic-, Gemini- oder Azure-Stil-Anfrage-Header) und ein fehlender Schlüssel wird vor jedem Versand einer Anfrage gemeldet.
dsh-vision-recognizer
kaixinbaba/dsh-vision-recognizer
Vision-Anbieter-Route, die angehängte Bilder über ein konfigurierbares Modell (über 15 OpenAI-kompatible und Anthropic-Anbieter) in Text transkribiert, während DeepSeek weiterhin antwortet.
dsh-vision (vision-route)
314857493/dsh-vision
Registriert eine `deepseek-vision`-Provider-Route: Die Web-GUI akzeptiert eingefügte Bilder und transkribiert sie über die kostenlose Zhipu-GLM-Vision-API in Text, bevor an den DeepSeek-Adapter übergeben wird.
dsh-vision-bridge
ximengxiaolan/dsh-vision-bridge
Im Composer angehängte Bilder werden von einem OpenAI-kompatiblen Vision-Modell in Text umgewandelt, bevor sie textbasierte DeepSeek-Modelle erreichen.
dsh-mmroute
jmxsxwyzjdwl/dsh-mmroute
Transparentes multimodales Routing für reine Textmodelle: Jedes Bild in jedem Modellaufruf wird von deinem eigenen multimodalen Verständnismodell vollständig transkribiert (wörtliche OCR, Daten, Unsicherheitszonen, injektionsgehärtet), mit gezieltem erneutem Hinsehen über vision_relook und automatischem Wiederholungsversuch bei bildbezogenen Fehlern. Keine mitgelieferten Endpunkte, keine geliehenen Logins.
dsh-audio-copilot
ai-yucheng/dsh-audio-copilot
Audio Copilot für DeepSeek Harness: Audio-Transkription (ASR) und Sprachsynthese (TTS) – gibt textbasierten Agenten Ohren und eine Stimme. Windows-lokales SAPI-TTS ab Werk; OpenAI-kompatible ASR/TTS-Endpunkte konfigurierbar. Inklusive Spracheingabe im Composer.
dsh-vision
314857493/dsh-vision
DeepSeek Harness-Plugin: eine `deepseek-vision`-Route, die Bildeingabe deklariert und eingefügte Bilder über die kostenlosen Zhipu GLM-Visionsmodelle transkribiert, bevor sie an den DeepSeek-Adapter delegiert.
dsh-voice-mimo
ch1bug/dsh-voice-mimo
Xiaomi MiMo-powered voice for DeepSeek Harness: browser 🎤/🧠/🔊 UI, voice_transcribe/voice_understand/voice_speak tools, configurable voice map (preset/voicedesign/voiceclone). Fork of zhuiyueya/dsh-voice (MIT), Settings pattern from Anionex/dsh-vision-toolkit (MIT).
dsh-voice-input-en
mohith-das/dsh-voice-input-en
Minimal English-only voice input for the DeepSeek Harness Web UI: a mic button in the composer that transcribes speech into the draft via the browser's native SpeechRecognition API. No dependencies, no subprocess, no network calls beyond whatever the brow
dsh-vision-pro-bridge
shainedemo/dsh-vision-pro-bridge
Vision bridge for text-only DeepSeek models: transcribes attached images with deepseek-v4-flash-vision-exp before they reach deepseek-v4-pro, with no third-party dependencies.
dsh-autovision
junkrat9527/dsh-autovision
Vision for text-only dsh models: paste an image and a configured multimodal model transcribes it to text automatically — transparent twin routing, an agent-callable read-image tool, no built-in keys or relay.
dsh-voice-input
newdanew/dsh-voice-input
Voice input for the web UI: a mic button in the composer that transcribes speech into the draft via the Web Speech API, with an optional auto-send toggle.
dsh-plugin-image-input
elohia/dsh-plugin-image-input
Image-to-text input for the Web UI: paste or drag an image and it is transcribed into structured text and sent, giving text-only LLMs image-input takeover (OpenAI-compatible vision API).