Passer au contenu principal

Plugins

Parcourez, filtrez et installez des plugins DeepSeek-Harness.

18 plugins trouvés

F

dsh-vision-proxy

flyvhidbwo/dsh-vision-proxy

Cerveau DeepSeek + transcription automatique d'images : attachez des images dans la GUI et chacune est transcrite par le modèle officiel deepseek-v4-flash-vision-exp par défaut (un cerveau V4-Pro en texte pur peut voir les images), avec n'importe quelle VLM compatible OpenAI ou Ollama local comme alternatives.

16le mois dernierVision, voix et multimodalMIT
R

dsh-plugin-call-me

radres/dsh-plugin-call-me

Fait sonner votre téléphone via CallKit : outils `call_me` et `text_me`, plus des appels optionnels en fin de tour ou pour approbation, dont la réponse orale est retranscrite dans la session.

7avant-hierIntégrations et accès distantMIT
S

dsh-voice-assistant

supersyh-sss/dsh-voice-assistant

Assistant vocal pour dsh web : prononcez la phrase de réveil (par ex. « 小鲸 ») pour activer la dictée mains libres — ce que vous dites est transcrit et saisi automatiquement dans la zone de chat. Prend en charge les commandes d'édition vocales (envoyer, effacer, nouvelle ligne, arrêter la lecture) et lit à voix haute les réponses de l'assistant en chinois. La reconnaissance vocale s'exécute localement dans le navigateur via sherpa-onnx WASM, elle fonctionne donc hors ligne sans clé API.

3le mois dernierVision, voix et multimodalMIT
B

dsh-stt-input

baisama-cloud/dsh-stt-input

Saisie vocale de reconnaissance vocale pour l'interface Web : un bouton micro dans le compositeur transcrit la parole en brouillon via l'API Web Speech du navigateur (sans configuration) ou une API Whisper compatible OpenAI (OpenAI / Groq), avec modèle et langue sélectionnables dans Paramètres.

3le mois dernierVision, voix et multimodalMIT
J

dsh-voice

jesse-njx/dsh-voice

Notes vocales en entrée, réponses parlées en sortie : dictez de l'audio qui devient des messages utilisateur (transcription), faites lire les réponses à voix haute par l'agent (synthèse vocale), local-first sous ~/.dsh/voice.

3il y a 2 moisVision, voix et multimodalMIT
B

dsh-vision-plugin

bug-huntter/dsh-vision-plugin

Reconnaissance d'images configurable pour les modèles DSH en texte seul : les messages image sont d'abord transcrits par un modèle de vision compatible OpenAI (URL de base, ID de modèle et clé API définis dans une section Paramètres) puis transmis au modèle principal sous forme de texte, tandis que la prise en charge des entrées d'image est annoncée. Le schéma d'authentification par clé API est sélectionnable (en-têtes de requête de style OpenAI, Anthropic, Gemini ou Azure) et l'absence de clé est signalée avant tout envoi de requête.

2il y a 7 joursVision, voix et multimodalMIT
K

dsh-vision-recognizer

kaixinbaba/dsh-vision-recognizer

Route de fournisseur de vision qui transcrit les images jointes en texte via un modèle configurable (plus de 15 fournisseurs compatibles OpenAI et Anthropic) tandis que DeepSeek continue de répondre.

2il y a 2 moisVision, voix et multimodalMIT
3

dsh-vision (vision-route)

314857493/dsh-vision

Enregistre une route de fournisseur `deepseek-vision` : l’interface web accepte les images collées et les transcrit en texte via l’API de vision Zhipu GLM gratuite avant de passer à l’adaptateur DeepSeek.

2le mois dernierVision, voix et multimodalMIT
X

dsh-vision-bridge

ximengxiaolan/dsh-vision-bridge

Les images jointes au composeur sont transcrites en texte par un modèle de vision compatible OpenAI avant d'atteindre les modèles DeepSeek texte seul.

2il y a 2 moisVision, voix et multimodalMIT
J

dsh-mmroute

jmxsxwyzjdwl/dsh-mmroute

Routage multimodal transparent pour les modèles texte uniquement : chaque image de chaque appel de modèle est entièrement transcrite (OCR verbatim, données, zones d’incertitude, durci contre l’injection) par votre propre compréhenseur multimodal, avec réexamen ciblé via vision_relook et nouvelle tentative automatique en cas d’échec lié aux images. Aucun point de terminaison intégré, aucun identifiant emprunté.

1il y a 28 joursVision, voix et multimodalMIT
A

dsh-audio-copilot

ai-yucheng/dsh-audio-copilot

Audio Copilot pour DeepSeek Harness : transcription audio (ASR) et synthèse vocale (TTS) — donne des oreilles et une voix aux agents en texte seul. TTS SAPI local Windows prêt à l'emploi ; points d'accès ASR/TTS compatibles OpenAI configurables. Inclut une entrée vocale dans le compositeur.

1il y a 2 moisVision, voix et multimodalMIT
3

dsh-vision

314857493/dsh-vision

Plugin DeepSeek Harness : une route `deepseek-vision` qui déclare l'entrée d'images et transcrit les images collées via les modèles de vision gratuits Zhipu GLM avant de déléguer à l'adaptateur DeepSeek.

1il y a 2 moisVision, voix et multimodalMIT
C

dsh-voice-mimo

ch1bug/dsh-voice-mimo

Xiaomi MiMo-powered voice for DeepSeek Harness: browser 🎤/🧠/🔊 UI, voice_transcribe/voice_understand/voice_speak tools, configurable voice map (preset/voicedesign/voiceclone). Fork of zhuiyueya/dsh-voice (MIT), Settings pattern from Anionex/dsh-vision-toolkit (MIT).

0il y a 21 joursVision, voix et multimodalMIT
M

dsh-voice-input-en

mohith-das/dsh-voice-input-en

Minimal English-only voice input for the DeepSeek Harness Web UI: a mic button in the composer that transcribes speech into the draft via the browser's native SpeechRecognition API. No dependencies, no subprocess, no network calls beyond whatever the brow

0le mois dernierVision, voix et multimodalMIT
S

dsh-vision-pro-bridge

shainedemo/dsh-vision-pro-bridge

Vision bridge for text-only DeepSeek models: transcribes attached images with deepseek-v4-flash-vision-exp before they reach deepseek-v4-pro, with no third-party dependencies.

0le mois dernierVision, voix et multimodalMIT
J

dsh-autovision

junkrat9527/dsh-autovision

Vision for text-only dsh models: paste an image and a configured multimodal model transcribes it to text automatically — transparent twin routing, an agent-callable read-image tool, no built-in keys or relay.

0il y a 2 moisVision, voix et multimodalMIT
N

dsh-voice-input

newdanew/dsh-voice-input

Voice input for the web UI: a mic button in the composer that transcribes speech into the draft via the Web Speech API, with an optional auto-send toggle.

0il y a 2 moisVision, voix et multimodalMIT
E

dsh-plugin-image-input

elohia/dsh-plugin-image-input

Image-to-text input for the Web UI: paste or drag an image and it is transcribed into structured text and sent, giving text-only LLMs image-input takeover (OpenAI-compatible vision API).

0il y a 2 moisVision, voix et multimodalMIT