Zum Hauptinhalt springen

Plugins

Durchsuche, filtere und installiere DeepSeek-Harness-Plugins.

18 Plugins gefunden

F

dsh-vision-proxy

flyvhidbwo/dsh-vision-proxy

DeepSeek-Gehirn + automatische Bildtranskription: Bilder in der GUI anhängen und jedes wird standardmäßig über das offizielle deepseek-v4-flash-vision-exp transkribiert (ein reines Text-V4-Pro-Gehirn kann Bilder sehen), mit jeder OpenAI-kompatiblen VLM oder lokalem Ollama als Alternative.

16letzten MonatVision, Sprache & MultimodalMIT
R

dsh-plugin-call-me

radres/dsh-plugin-call-me

Lässt dein Telefon über CallKit klingeln: die Tools `call_me` und `text_me`, plus optionale Anrufe bei Rundenende und Freigaben, deren gesprochene Antwort zurück in die Sitzung transkribiert wird.

7vorgesternIntegrationen & FernzugriffMIT
S

dsh-voice-assistant

supersyh-sss/dsh-voice-assistant

Sprachassistent für dsh web: Mit dem Weckruf (z. B. „小鲸“) wird freihändiges Diktieren aktiviert – das Gesagte wird transkribiert und automatisch in das Chatfeld getippt. Unterstützt gesprochene Bearbeitungsbefehle (senden, leeren, neue Zeile, Vorlesen beenden) und liest Antworten des Assistenten auf Chinesisch vor. Die Spracherkennung läuft lokal im Browser über sherpa-onnx WASM, funktioniert also offline ohne API-Schlüssel.

3letzten MonatVision, Sprache & MultimodalMIT
B

dsh-stt-input

baisama-cloud/dsh-stt-input

Speech-to-Text-Spracheingabe für die Web-UI: ein Mikrofon-Button im Composer transkribiert Sprache per Browser Web Speech API (null Konfiguration) oder eine OpenAI-kompatible Whisper-API (OpenAI / Groq) in den Entwurf, mit auswählbarem Modell und Sprache in den Settings.

3letzten MonatVision, Sprache & MultimodalMIT
J

dsh-voice

jesse-njx/dsh-voice

Sprachnotizen rein, gesprochene Antworten raus: Audio diktieren, das zu Nutzernachrichten wird (Transkription), den Agenten Antworten laut vorlesen lassen (Sprachausgabe), lokal-first unter ~/.dsh/voice.

3vor 2 MonatenVision, Sprache & MultimodalMIT
B

dsh-vision-plugin

bug-huntter/dsh-vision-plugin

Konfigurierbare Bilderkennung für textbasierte DSH-Modelle: Bildnachrichten werden zunächst von einem OpenAI-kompatiblen Vision-Modell transkribiert (Basis-URL, Modell-ID und API-Schlüssel in einem Einstellungsbereich festgelegt) und dann als Text an das Hauptmodell weitergegeben, während die Unterstützung für Bildeingaben angekündigt wird. Das API-Schlüssel-Authentifizierungsschema ist wählbar (OpenAI-, Anthropic-, Gemini- oder Azure-Stil-Anfrage-Header) und ein fehlender Schlüssel wird vor jedem Versand einer Anfrage gemeldet.

2vor 7 TagenVision, Sprache & MultimodalMIT
K

dsh-vision-recognizer

kaixinbaba/dsh-vision-recognizer

Vision-Anbieter-Route, die angehängte Bilder über ein konfigurierbares Modell (über 15 OpenAI-kompatible und Anthropic-Anbieter) in Text transkribiert, während DeepSeek weiterhin antwortet.

2vor 2 MonatenVision, Sprache & MultimodalMIT
3

dsh-vision (vision-route)

314857493/dsh-vision

Registriert eine `deepseek-vision`-Provider-Route: Die Web-GUI akzeptiert eingefügte Bilder und transkribiert sie über die kostenlose Zhipu-GLM-Vision-API in Text, bevor an den DeepSeek-Adapter übergeben wird.

2letzten MonatVision, Sprache & MultimodalMIT
X

dsh-vision-bridge

ximengxiaolan/dsh-vision-bridge

Im Composer angehängte Bilder werden von einem OpenAI-kompatiblen Vision-Modell in Text umgewandelt, bevor sie textbasierte DeepSeek-Modelle erreichen.

2vor 2 MonatenVision, Sprache & MultimodalMIT
J

dsh-mmroute

jmxsxwyzjdwl/dsh-mmroute

Transparentes multimodales Routing für reine Textmodelle: Jedes Bild in jedem Modellaufruf wird von deinem eigenen multimodalen Verständnismodell vollständig transkribiert (wörtliche OCR, Daten, Unsicherheitszonen, injektionsgehärtet), mit gezieltem erneutem Hinsehen über vision_relook und automatischem Wiederholungsversuch bei bildbezogenen Fehlern. Keine mitgelieferten Endpunkte, keine geliehenen Logins.

1vor 28 TagenVision, Sprache & MultimodalMIT
A

dsh-audio-copilot

ai-yucheng/dsh-audio-copilot

Audio Copilot für DeepSeek Harness: Audio-Transkription (ASR) und Sprachsynthese (TTS) – gibt textbasierten Agenten Ohren und eine Stimme. Windows-lokales SAPI-TTS ab Werk; OpenAI-kompatible ASR/TTS-Endpunkte konfigurierbar. Inklusive Spracheingabe im Composer.

1vor 2 MonatenVision, Sprache & MultimodalMIT
3

dsh-vision

314857493/dsh-vision

DeepSeek Harness-Plugin: eine `deepseek-vision`-Route, die Bildeingabe deklariert und eingefügte Bilder über die kostenlosen Zhipu GLM-Visionsmodelle transkribiert, bevor sie an den DeepSeek-Adapter delegiert.

1vor 2 MonatenVision, Sprache & MultimodalMIT
C

dsh-voice-mimo

ch1bug/dsh-voice-mimo

Xiaomi MiMo-powered voice for DeepSeek Harness: browser 🎤/🧠/🔊 UI, voice_transcribe/voice_understand/voice_speak tools, configurable voice map (preset/voicedesign/voiceclone). Fork of zhuiyueya/dsh-voice (MIT), Settings pattern from Anionex/dsh-vision-toolkit (MIT).

0vor 21 TagenVision, Sprache & MultimodalMIT
M

dsh-voice-input-en

mohith-das/dsh-voice-input-en

Minimal English-only voice input for the DeepSeek Harness Web UI: a mic button in the composer that transcribes speech into the draft via the browser's native SpeechRecognition API. No dependencies, no subprocess, no network calls beyond whatever the brow

0letzten MonatVision, Sprache & MultimodalMIT
S

dsh-vision-pro-bridge

shainedemo/dsh-vision-pro-bridge

Vision bridge for text-only DeepSeek models: transcribes attached images with deepseek-v4-flash-vision-exp before they reach deepseek-v4-pro, with no third-party dependencies.

0letzten MonatVision, Sprache & MultimodalMIT
J

dsh-autovision

junkrat9527/dsh-autovision

Vision for text-only dsh models: paste an image and a configured multimodal model transcribes it to text automatically — transparent twin routing, an agent-callable read-image tool, no built-in keys or relay.

0vor 2 MonatenVision, Sprache & MultimodalMIT
N

dsh-voice-input

newdanew/dsh-voice-input

Voice input for the web UI: a mic button in the composer that transcribes speech into the draft via the Web Speech API, with an optional auto-send toggle.

0vor 2 MonatenVision, Sprache & MultimodalMIT
E

dsh-plugin-image-input

elohia/dsh-plugin-image-input

Image-to-text input for the Web UI: paste or drag an image and it is transcribed into structured text and sent, giving text-only LLMs image-input takeover (OpenAI-compatible vision API).

0vor 2 MonatenVision, Sprache & MultimodalMIT