Zum Hauptinhalt springen

Vision, Sprache & Multimodal

Vision, Sprache & Multimodal-Plugins verleihen den reinen Text-DeepSeek-Modellen in DeepSeek-Harness (dsh) Augen, Ohren und eine Stimme. Finden Sie Vision-Tools und Provider-Routen, die eingefügte Screenshots über Zhipu GLM, Gemini, Doubao oder lokales Ollama per OCR erfassen und beschreiben, Mikrofon-Spracheingabe über die Web Speech API des Browsers oder Whisper-kompatible APIs, Vorlesen per Edge TTS oder eigenen Stimmen, Vollduplex-Sprachmodi sowie Generatoren für Bilder, Video und Musik.

312 Plugins gefunden

1

dsh-vision-sidecar

121103qwq/dsh-vision-sidecar

Gehosteter, kostenloser Vision-Sidecar für DeepSeek Harness mit dauerhaften Sitzungsbelegen.

4vor 2 MonatenVision, Sprache & MultimodalMIT
Y

dsh-image-subagent

yuqingsh/dsh-image-subagent

4vor 2 MonatenVision, Sprache & MultimodalMIT
G

dsh-vision-bridge

gxx182/dsh-vision-bridge

Verbindet Sitzungsbilder mit konfigurierbaren Vision-Anbietern und gibt rein textbasierte Analysen an berechtigte DeepSeek Harness-Modellrouten zurück.

4vor 2 MonatenVision, Sprache & MultimodalMIT
H

dsh-omni-workstation

huashenglian/dsh-omni-workstation

Omnimodale Workstation für DSH: analyze_image über eine geordnete Failover-Kette aus mehreren VLM-Karten, ein Bildwerkzeugkasten mit sechs Werkzeugen (Zoom, Farbabtastung, Pixel-Diff, OCR, Elementerkennung, Anzeige im Chat), die denselben Bildauflöser nutzen, generate_image über die Protokolle OpenAI/DashScope/ComfyUI, asynchrones generate_video mit mehreren Karten samt Builder /build-video-tool und speak/clone_voice für Sprachausgabe über sieben Anbieter – alles gesteuert von einer selbst speichernden Einstellungsseite.

3vor 14 TagenVision, Sprache & MultimodalMIT
W

dsh-hold-to-talk

wangzhanchao883/dsh-hold-to-talk

Einhändige Eingabe ohne Tastatur für das Eingabefeld: Maustaste im Eingabefeld gedrückt halten, sprechen, loslassen – der Text landet im Entwurf, und Hochschieben bricht ab, ohne einen halben Satz zu hinterlassen. Kein Mikrofonknopf zum Anvisieren und kein Kurzbefehl zum Merken; die Hand muss den Eingabebereich nie verlassen, was gerade dann zählt, wenn die andere Hand beschäftigt ist. Die Erkennung läuft vollständig offline (SenseVoice über sherpa-onnx, kein API-Schlüssel, Audio verlässt nie den Rechner).

3vor 23 StundenVision, Sprache & MultimodalMIT
N

dsh-plugin-speech

nakamuraia/dsh-plugin-speech

Liest Assistentenantworten in DeepSeek Harness laut vor: Text-zu-Sprache-Anbieter mit Streaming-Wiedergabe.

3vor 18 TagenVision, Sprache & MultimodalMIT
S

dsh-voice-assistant

supersyh-sss/dsh-voice-assistant

Sprachassistent für dsh web: Mit dem Weckruf (z. B. „小鲸“) wird freihändiges Diktieren aktiviert – das Gesagte wird transkribiert und automatisch in das Chatfeld getippt. Unterstützt gesprochene Bearbeitungsbefehle (senden, leeren, neue Zeile, Vorlesen beenden) und liest Antworten des Assistenten auf Chinesisch vor. Die Spracherkennung läuft lokal im Browser über sherpa-onnx WASM, funktioniert also offline ohne API-Schlüssel.

3letzten MonatVision, Sprache & MultimodalMIT
S

dsh-audiogen

shimingming520/dsh-audiogen

KI-Audioerzeugung für die DeepSeek Harness Web-GUI — Multi-Vendor-TTS, Musik, Soundeffekte und Voice-Design mit Seitenleisten-Panel, Modellvergleich, Ressourcenbibliothek und Agent-Tools.

3vor 24 TagenVision, Sprache & MultimodalApache-2.0
L

dsh-voco

lgquan/dsh-voco

Durchgängige Sprachkonversationen für DSH mit freihändigem Zuhören, Push-to-Talk, Spracherkennung, TTS-Antworten und Hintergrund-Agent-Delegation.

3letzten MonatVision, Sprache & MultimodalMIT
T

dsh-gsv

taoruiliu19/dsh-gsv

Lokales Echtzeit-TTS für DeepSeek Harness: Stimmvoreinstellungen, automatisches Vorlesen, Engine-Setup-Assistent, Vorlese-Button und ein Einstellungsbereich für die GSV-TTS-Lite-Engine.

3letzten MonatVision, Sprache & MultimodalMIT
J

dsh-ximalaya

jerryqx/dsh-ximalaya

Ximalaya-Podcasts und Hörbücher in der DSH-Weboberfläche hören: Alben suchen, seitenweise Titel durchblättern und über eine Leiste für den laufenden Titel abspielen (zurück/abspielen/weiter, Spulen, Lautstärke, Geschwindigkeit). Nach der Anmeldung per QR-Code listet die Seite „Meine“ deine favorisierten Titel (zum Abspielen anklicken), abonnierte Alben mit Hinweisen auf die neuesten Folgen und gefolgte Sprecher mit ihren öffentlichen Alben; der Host leitet Audiostreams mit Unterstützung für Range weiter und registriert ein Werkzeug `ximalaya_play`, damit der Agent auf Wunsch suchen und abspielen kann.

3letzten MonatVision, Sprache & MultimodalMIT
B

phone-eye

boheastill/phone-eye

Lässt deinen KI-Agenten ein echtes Android-Telefon sehen und bedienen: phone_look (Verschmelzung von Bilderkennung und UI-Baum), Tippen/Wischen/Eingeben, Screenshot – über adb, für jeden MCP-Client.

3letzten MonatVision, Sprache & MultimodalMIT
X

dsh-image-vision

xiaoyuink/dsh-image-vision

Bildverständnis für jedes DSH-Modell: Vision-, OCR-, Grounding- und Zuschneide-Tools mit Domänen-Presets für Histopathologie, Zellbiologie, Anatomie, klinische Bilder und wissenschaftliche Abbildungen.

3vor 29 TagenVision, Sprache & Multimodal
L

Deepseek-Continuity

linxuhao/deepseek-continuity

Lokale Erzeugung von Bildern, Stimmen, Musik und Soundeffekten sowie Transkription, mit fixierter Identität: Charaktere, Tiere, Objekte und Schauspielernstimmen werden einmal definiert und bei jedem späteren Aufruf wiederverwendet; degenerierte Ausgaben (nahezu flaches Bild, stilles Audio) werden abgelehnt statt als Erfolg zurückgegeben, und eine erzeugte Zeile kann als Text zurückgelesen werden, sodass ein Klon, der sein Ende verschluckt hat, sichtbar wird. Die Engines entladen sich im Leerlauf, und Bildgenerierung und Transkription können jeweils auf eine OpenAI-kompatible API statt auf das lokale Vulkan-Backend zeigen.

3vor 12 TagenVision, Sprache & MultimodalMIT
Y

dsh-ui-spec

yumimanji/dsh-ui-spec

DeepSeek Harness-Plugin, das UI-Screenshots mithilfe von OCR, deterministischer Geometrie, Szenengraphen, Assets und Render-Vergleich in implementierungsreife Web-Spezifikationen umwandelt.

3vor 2 MonatenVision, Sprache & MultimodalMIT
D

deepseekeyes

dttxorg/deepseekeyes

Auditierbare Vision- und plattformübergreifende Computer-Use-Laufzeit für DeepSeek Harness mit quellenerhaltenden Beweisen.

3vor 2 MonatenVision, Sprache & MultimodalMIT
N

voco-input-sh

nothree-code/voco-input-sh

Spracheingabe für die Web UI: eine Mikrofonschaltfläche, die die lokale Offline-Spracherkennung von VocoType steuert und erkannten Text automatisch in den Editor einfügt (Auto-Deploy, Deduplizierung, kontinuierliche Diktation).

3vor 19 TagenVision, Sprache & MultimodalMIT
B

dsh-stt-input

baisama-cloud/dsh-stt-input

Speech-to-Text-Spracheingabe für die Web-UI: ein Mikrofon-Button im Composer transkribiert Sprache per Browser Web Speech API (null Konfiguration) oder eine OpenAI-kompatible Whisper-API (OpenAI / Groq) in den Entwurf, mit auswählbarem Modell und Sprache in den Settings.

3letzten MonatVision, Sprache & MultimodalMIT
W

visual-review

wang-bool/visual-review

Zeigt eingefügte oder hochgeladene Bilder direkt im DSH-Web-Chat an und gibt reinen Textmodellen Sehkraft: Das vom Modell aufrufbare Tool visual_review nutzt zuerst eine OpenAI-kompatible multimodale API und fällt bei einem Fehler auf einen lokalen Qwen3-VL-Worker zurück.

3vor 2 MonatenVision, Sprache & MultimodalMIT
T

dsh-plugins (dsh-vision)

tzhr-invest/dsh-plugins

Agentenaufrufbares Vision-Tool, das lokale Bilder über einen von dir konfigurierten, OpenAI-kompatiblen Vision-Endpunkt beschreibt, mit optionalem Multi-Modell-Gegencheck und ohne integrierte Schlüssel.

3vor 5 TagenVision, Sprache & MultimodalMIT
S

dsh-plugin-multimodal

shinjiyu/dsh-plugin-multimodal

Bewirbt das Einfügen von Bildern auf reinen Text-Routen von DeepSeek, beschreibt Anhänge mit einem Vision-Sidecar und lässt native Vision-Modelle unangetastet.

3vor 2 MonatenVision, Sprache & MultimodalMIT
M

dsh-vision-tools

moon09300731/dsh-vision-tools

Komplettes Vision-Funktionspaket für DeepSeek Harness: ein vision_understand-Tool (OpenAI-kompatible Vision-APIs, standardmäßig kostenloses Zhipu GLM-4V-Flash) sowie Einfüge-/Drag-and-Drop-/Button-Einstiegspunkte für die Bilderkennung.

3vor 2 MonatenVision, Sprache & MultimodalMIT
L

dsh-plugin-grok2api-media-tool

lsjspl/dsh-plugin-grok2api-media-tool

Gibt dsh die Fähigkeit, Bilder und Videos über die grok2api-API zu erzeugen.

3letzten MonatVision, Sprache & Multimodal
L

dsh-image-gen

leemancheung/dsh-image-gen

GPT Image 2 `image_gen` mit standardmäßigem Codex-Abonnement-OAuth oder explizitem API-Schlüsselmodus: Entwicklungskarte, bis zu drei Live-API-Teilstücke, persistente Anhangs-Wiedergabe / Lightbox / Download, reiner Textmodell-Ausgabe und begrenzten, credential-sicheren Anfragen.

3vor 5 TagenVision, Sprache & MultimodalMIT