- Startseite
- Kategorien
- Vision, Sprache & Multimodal
Vision, Sprache & Multimodal
Vision, Sprache & Multimodal-Plugins verleihen den reinen Text-DeepSeek-Modellen in DeepSeek-Harness (dsh) Augen, Ohren und eine Stimme. Finden Sie Vision-Tools und Provider-Routen, die eingefügte Screenshots über Zhipu GLM, Gemini, Doubao oder lokales Ollama per OCR erfassen und beschreiben, Mikrofon-Spracheingabe über die Web Speech API des Browsers oder Whisper-kompatible APIs, Vorlesen per Edge TTS oder eigenen Stimmen, Vollduplex-Sprachmodi sowie Generatoren für Bilder, Video und Musik.
312 Plugins gefunden
dsh-vision-sidecar
121103qwq/dsh-vision-sidecar
Gehosteter, kostenloser Vision-Sidecar für DeepSeek Harness mit dauerhaften Sitzungsbelegen.
dsh-image-subagent
yuqingsh/dsh-image-subagent
dsh-vision-bridge
gxx182/dsh-vision-bridge
Verbindet Sitzungsbilder mit konfigurierbaren Vision-Anbietern und gibt rein textbasierte Analysen an berechtigte DeepSeek Harness-Modellrouten zurück.
dsh-omni-workstation
huashenglian/dsh-omni-workstation
Omnimodale Workstation für DSH: analyze_image über eine geordnete Failover-Kette aus mehreren VLM-Karten, ein Bildwerkzeugkasten mit sechs Werkzeugen (Zoom, Farbabtastung, Pixel-Diff, OCR, Elementerkennung, Anzeige im Chat), die denselben Bildauflöser nutzen, generate_image über die Protokolle OpenAI/DashScope/ComfyUI, asynchrones generate_video mit mehreren Karten samt Builder /build-video-tool und speak/clone_voice für Sprachausgabe über sieben Anbieter – alles gesteuert von einer selbst speichernden Einstellungsseite.
dsh-hold-to-talk
wangzhanchao883/dsh-hold-to-talk
Einhändige Eingabe ohne Tastatur für das Eingabefeld: Maustaste im Eingabefeld gedrückt halten, sprechen, loslassen – der Text landet im Entwurf, und Hochschieben bricht ab, ohne einen halben Satz zu hinterlassen. Kein Mikrofonknopf zum Anvisieren und kein Kurzbefehl zum Merken; die Hand muss den Eingabebereich nie verlassen, was gerade dann zählt, wenn die andere Hand beschäftigt ist. Die Erkennung läuft vollständig offline (SenseVoice über sherpa-onnx, kein API-Schlüssel, Audio verlässt nie den Rechner).
dsh-plugin-speech
nakamuraia/dsh-plugin-speech
Liest Assistentenantworten in DeepSeek Harness laut vor: Text-zu-Sprache-Anbieter mit Streaming-Wiedergabe.
dsh-voice-assistant
supersyh-sss/dsh-voice-assistant
Sprachassistent für dsh web: Mit dem Weckruf (z. B. „小鲸“) wird freihändiges Diktieren aktiviert – das Gesagte wird transkribiert und automatisch in das Chatfeld getippt. Unterstützt gesprochene Bearbeitungsbefehle (senden, leeren, neue Zeile, Vorlesen beenden) und liest Antworten des Assistenten auf Chinesisch vor. Die Spracherkennung läuft lokal im Browser über sherpa-onnx WASM, funktioniert also offline ohne API-Schlüssel.
dsh-audiogen
shimingming520/dsh-audiogen
KI-Audioerzeugung für die DeepSeek Harness Web-GUI — Multi-Vendor-TTS, Musik, Soundeffekte und Voice-Design mit Seitenleisten-Panel, Modellvergleich, Ressourcenbibliothek und Agent-Tools.
dsh-voco
lgquan/dsh-voco
Durchgängige Sprachkonversationen für DSH mit freihändigem Zuhören, Push-to-Talk, Spracherkennung, TTS-Antworten und Hintergrund-Agent-Delegation.
dsh-gsv
taoruiliu19/dsh-gsv
Lokales Echtzeit-TTS für DeepSeek Harness: Stimmvoreinstellungen, automatisches Vorlesen, Engine-Setup-Assistent, Vorlese-Button und ein Einstellungsbereich für die GSV-TTS-Lite-Engine.
dsh-ximalaya
jerryqx/dsh-ximalaya
Ximalaya-Podcasts und Hörbücher in der DSH-Weboberfläche hören: Alben suchen, seitenweise Titel durchblättern und über eine Leiste für den laufenden Titel abspielen (zurück/abspielen/weiter, Spulen, Lautstärke, Geschwindigkeit). Nach der Anmeldung per QR-Code listet die Seite „Meine“ deine favorisierten Titel (zum Abspielen anklicken), abonnierte Alben mit Hinweisen auf die neuesten Folgen und gefolgte Sprecher mit ihren öffentlichen Alben; der Host leitet Audiostreams mit Unterstützung für Range weiter und registriert ein Werkzeug `ximalaya_play`, damit der Agent auf Wunsch suchen und abspielen kann.
phone-eye
boheastill/phone-eye
Lässt deinen KI-Agenten ein echtes Android-Telefon sehen und bedienen: phone_look (Verschmelzung von Bilderkennung und UI-Baum), Tippen/Wischen/Eingeben, Screenshot – über adb, für jeden MCP-Client.
dsh-image-vision
xiaoyuink/dsh-image-vision
Bildverständnis für jedes DSH-Modell: Vision-, OCR-, Grounding- und Zuschneide-Tools mit Domänen-Presets für Histopathologie, Zellbiologie, Anatomie, klinische Bilder und wissenschaftliche Abbildungen.
Deepseek-Continuity
linxuhao/deepseek-continuity
Lokale Erzeugung von Bildern, Stimmen, Musik und Soundeffekten sowie Transkription, mit fixierter Identität: Charaktere, Tiere, Objekte und Schauspielernstimmen werden einmal definiert und bei jedem späteren Aufruf wiederverwendet; degenerierte Ausgaben (nahezu flaches Bild, stilles Audio) werden abgelehnt statt als Erfolg zurückgegeben, und eine erzeugte Zeile kann als Text zurückgelesen werden, sodass ein Klon, der sein Ende verschluckt hat, sichtbar wird. Die Engines entladen sich im Leerlauf, und Bildgenerierung und Transkription können jeweils auf eine OpenAI-kompatible API statt auf das lokale Vulkan-Backend zeigen.
dsh-ui-spec
yumimanji/dsh-ui-spec
DeepSeek Harness-Plugin, das UI-Screenshots mithilfe von OCR, deterministischer Geometrie, Szenengraphen, Assets und Render-Vergleich in implementierungsreife Web-Spezifikationen umwandelt.
deepseekeyes
dttxorg/deepseekeyes
Auditierbare Vision- und plattformübergreifende Computer-Use-Laufzeit für DeepSeek Harness mit quellenerhaltenden Beweisen.
voco-input-sh
nothree-code/voco-input-sh
Spracheingabe für die Web UI: eine Mikrofonschaltfläche, die die lokale Offline-Spracherkennung von VocoType steuert und erkannten Text automatisch in den Editor einfügt (Auto-Deploy, Deduplizierung, kontinuierliche Diktation).
dsh-stt-input
baisama-cloud/dsh-stt-input
Speech-to-Text-Spracheingabe für die Web-UI: ein Mikrofon-Button im Composer transkribiert Sprache per Browser Web Speech API (null Konfiguration) oder eine OpenAI-kompatible Whisper-API (OpenAI / Groq) in den Entwurf, mit auswählbarem Modell und Sprache in den Settings.
visual-review
wang-bool/visual-review
Zeigt eingefügte oder hochgeladene Bilder direkt im DSH-Web-Chat an und gibt reinen Textmodellen Sehkraft: Das vom Modell aufrufbare Tool visual_review nutzt zuerst eine OpenAI-kompatible multimodale API und fällt bei einem Fehler auf einen lokalen Qwen3-VL-Worker zurück.
dsh-plugins (dsh-vision)
tzhr-invest/dsh-plugins
Agentenaufrufbares Vision-Tool, das lokale Bilder über einen von dir konfigurierten, OpenAI-kompatiblen Vision-Endpunkt beschreibt, mit optionalem Multi-Modell-Gegencheck und ohne integrierte Schlüssel.
dsh-plugin-multimodal
shinjiyu/dsh-plugin-multimodal
Bewirbt das Einfügen von Bildern auf reinen Text-Routen von DeepSeek, beschreibt Anhänge mit einem Vision-Sidecar und lässt native Vision-Modelle unangetastet.
dsh-vision-tools
moon09300731/dsh-vision-tools
Komplettes Vision-Funktionspaket für DeepSeek Harness: ein vision_understand-Tool (OpenAI-kompatible Vision-APIs, standardmäßig kostenloses Zhipu GLM-4V-Flash) sowie Einfüge-/Drag-and-Drop-/Button-Einstiegspunkte für die Bilderkennung.
dsh-plugin-grok2api-media-tool
lsjspl/dsh-plugin-grok2api-media-tool
Gibt dsh die Fähigkeit, Bilder und Videos über die grok2api-API zu erzeugen.
dsh-image-gen
leemancheung/dsh-image-gen
GPT Image 2 `image_gen` mit standardmäßigem Codex-Abonnement-OAuth oder explizitem API-Schlüsselmodus: Entwicklungskarte, bis zu drei Live-API-Teilstücke, persistente Anhangs-Wiedergabe / Lightbox / Download, reiner Textmodell-Ausgabe und begrenzten, credential-sicheren Anfragen.