Zum Hauptinhalt springen

Vision, Sprache & Multimodal

Vision, Sprache & Multimodal-Plugins verleihen den reinen Text-DeepSeek-Modellen in DeepSeek-Harness (dsh) Augen, Ohren und eine Stimme. Finden Sie Vision-Tools und Provider-Routen, die eingefügte Screenshots über Zhipu GLM, Gemini, Doubao oder lokales Ollama per OCR erfassen und beschreiben, Mikrofon-Spracheingabe über die Web Speech API des Browsers oder Whisper-kompatible APIs, Vorlesen per Edge TTS oder eigenen Stimmen, Vollduplex-Sprachmodi sowie Generatoren für Bilder, Video und Musik.

312 Plugins gefunden

Z

dsh-web-ui (dsh-tool-describe-image)

zhu1090093659/dsh-web-ui

Ein `describe_image`-Vision-Tool für rein textbasierte Modelle: Bilder (lokaler Pfad, URL, Anhang) werden an einen konfigurierbaren, OpenAI-kompatiblen Vision-Endpunkt gesendet, und nur der zurückgegebene Text gelangt in die Sitzung.

8kvor 6 TagenVision, Sprache & MultimodalApache-2.0
D

ipollowork

devin-axis/ipollowork

iPolloWork HyperFrames Video Studio und 27 bearbeitbare Videovorlagen als native Konversationsansicht für DeepSeek Harness.

4.2kletzten MonatVision, Sprache & Multimodal
L

modlens

liustack/modlens

Vision-Brücke für reine Textmodelle: Bild einfügen, strukturierte JSON-Belege erhalten (OCR, Layout, Semantik).

4.1kvor 5 TagenVision, Sprache & MultimodalMIT
Y

dsh-vision-router

ysr666/dsh-vision-router

Kostenlose Vision für reine Textagenten: integrierte, schlüssellose Vision-Chain plus Pixel-Tools (Q&A, Grounding, Zuschneiden, Pixel-Diff, Farben, OCR, SVG-Trace, Freistellen, Screenshots); Bild einfügen zur Nutzung.

1.1kgesternVision, Sprache & MultimodalMIT
A

dsh-vision-toolkit

anionex/dsh-vision-toolkit

Vision für reine Textmodelle: Fügen Sie ein Bild ein und das Modell wechselt zur Vision-Toolkit-Variante für Bild-Q&A, Mehrbildvergleich, Lang-Screenshot-OCR, Screenshot-zu-UI-Reproduktion, Element-Grounding und Pixel-Diff. Standardmäßig kein API-Key erforderlich — Bilder werden vom kostenlosen, vom Autor gehosteten Dienst verarbeitet, 100 pro Maschine pro Tag; konfigurierbar auf Ihren eigenen Anbieter.

887vorgesternVision, Sprache & MultimodalMIT
T

tongflow

tong-io/tongflow

TongFlow-Studio-Plugin für DeepSeek Harness (dsh): Filmcrew-artiges Projektmodell, vom Agent erstellte TongFlow-Workflows, deterministische Medienerstellung, eingebettete Canvas.

870letzten MonatVision, Sprache & MultimodalAGPL-3.0
S

dsh-image-gen

shanliuling/dsh-image-gen

Native konversationelle Bildgenerierung für DeepSeek Harness: Bitten Sie den Agenten, ein Bild zu erstellen, und er übernimmt die Generierung und behält das Ergebnis direkt in der Konversation.

564vor 3 TagenVision, Sprache & MultimodalApache-2.0
O

watch-skill

oxbshw/watch-skill

Die Funktionen von DeepWatch, installierbar in ein bestehendes DeepSeek Harness-Profil

378vor 18 TagenVision, Sprache & MultimodalMIT
D

dsh-imagegen

dickpy/dsh-imagegen

KI-Bildgenerierung für die DSH-Web-GUI: Text-zu-Bild und Bild-zu-Bild über einen konfigurierbaren OpenAI-kompatiblen Endpunkt (gpt-image-2 / gpt-image-1 / dall-e-3), mit einer api_url/api_key-Einstellungskarte und einem geteilten Generierungsstudio in der Seitenleiste.

99vorgesternVision, Sprache & MultimodalApache-2.0
F

dsh-comfyui

fandc520/dsh-comfyui

Steuern Sie einen lokalen oder Remote-ComfyUI-Server aus DeepSeek Harness: Die Tools comfyui_run / comfyui_object_info / comfyui_workflow erzeugen und bearbeiten Bilder und Videos, mit einer Workflow-Bibliothek (Graph-Extraktion: pro Komponente / Hauptfluss / alle), einem Ladebereich mit automatischer Auflösungsanpassung, einer Live-Warteschlange, SDXL- und Wan-2.1-Vorlagen, einem Begleit-Skill und einem Media-Proxy gleicher Herkunft.

93vor 6 TagenVision, Sprache & MultimodalMIT
P

dsh-omi-voice

polinnizhong/dsh-omi-voice

Vorlesen im Chat für DeepSeek Harness: per Tipp AI-Antworten vorlesen, pausieren und fortsetzen mit natürlichen Doubao-TTS-Stimmen (BYOK); liest nur die endgültige Antwort, Code, Tabellen und Diagramme werden ausgefiltert; lokale Engine, das Plugin speichert keinen API-Schlüssel.

74letzten MonatVision, Sprache & MultimodalMIT
C

deepseek-harness-video-director

chiphoton/deepseek-harness-video-director

🎬KI-Regisseur: MiniMax-H3-Videogenerierungs-Plugin unter der Regie von DeepSeek-Harness. 🤖Mehr als Prompts. 🪄Canvas-UI.

69vor 4 TagenVision, Sprache & MultimodalMIT
S

dsh-design-qa

sunxin-ai/dsh-design-qa

Design-Treue-QA für textbasierte Modelle: Ein `deepseek_vision`-Tool leiht sich ein Auge von jedem OpenAI-kompatiblen Vision-Pfad, damit das Modell beurteilen kann, ob eine Implementierung zu seinem Mock passt — ausgeliefert mit dem Benchmark hinter diesem Urteil (vier Fixtures, 23 injizierte Defekte, Rohtranskripte) und der Fragedisziplin, von der es abhängt.

44vor 26 TagenVision, Sprache & MultimodalMIT
J

picturereader

jing-hy/picturereader

Bild-„Lesen“ für reine Textmodelle: Herunterskalieren + Reduzierung der Farbtiefe + Struktur-/Farb-Fingerabdrücke werden in Textraster umgewandelt und in das Gespräch zurückgespeist, sodass das Modell wie ein multimodales Modell autonom zoomen, sampeln und OCR durchführen kann; vollständig lokal ohne Abhängigkeit von externen Modellen, enthält einen Skill zur Bild-Lese-Methodik sowie optional PaddleOCR.

37vorgesternVision, Sprache & MultimodalMIT
P

dsh-voice-scribe

pensivefei/dsh-voice-scribe

Spracheingabe für die Web-UI: Alt (oder Alt+Space) drücken, um das Diktat zu starten/stoppen, Browser Web Speech (Zero-Config) oder OpenAI-kompatible Cloud-ASR, optionale Politur durch das DSH-konfigurierte LLM, Einstellungs-UI.

34vor 3 TagenVision, Sprache & MultimodalMIT
O

dsh-vision

oil-oil/dsh-vision

Nahezu native Bildverständnis-Funktionen für DeepSeek Harness.

24vor 2 MonatenVision, Sprache & MultimodalMIT
D

dsh-web-ui (dsh-tool-describe-image)

damonkoy/dsh-web-ui

Verleiht einem Text-only-Modell Bildverständnis über ein Vision-Language-Modell, bereitgestellt als `describe_image`-Werkzeug.

22vor 2 MonatenVision, Sprache & MultimodalApache-2.0
W

dsh-ears

wiziscool/dsh-ears

Spracheingabe-Plugin für DeepSeek Harness (dsh): Eine Mikrofon-Schaltfläche im Composer wandelt Sprache in einen Entwurfstranskript um, mit wählbaren Spracherkennungs-Backends, optionaler Nachbearbeitung über die eigenen LLM-Routen von dsh und einer nativen Einstellungsseite.

21vor 21 StundenVision, Sprache & MultimodalMIT
1

dsh-plugin-tts

1624318455/dsh-plugin-tts

Liest Assistentenantworten laut vor über kostenloses Edge TTS oder eigene RVC-Sprachmodelle: Vorlese-Schaltflächen + automatisches Vorlesen, adaptive blockweise progressive Wiedergabe (lückenlose Langtexte), Ein-Klick-Installation von Voice-Packs aus einer Registry sowie eine portable RVC-Laufzeitumgebung.

21vor 6 TagenVision, Sprache & MultimodalMIT
M

dsh-media-skills

mjorgin/dsh-media-skills

Kostenlose Vision-Bridge und Bildgenerierung für reine Textmodelle: Lesen eingefügter Bilder, Failover zwischen GLM-4V-Flash- und Gemini-Engine, strukturierte Evidenz im ModLens-Stil und eine vorbelegte kostenlose Vision-Modell-Route.

19vor 12 TagenVision, Sprache & MultimodalMIT
D

dsh-aigc-canvas

dsh-external/dsh-aigc-canvas

AIGC-Canvas-Plugin (cordis).

17vor 21 TagenVision, Sprache & Multimodal
P

dsh-talk

perrylink/dsh-talk

Sprach-Ein-/Ausgabe für DeepSeek Harness — Sprache-zu-Text und Text-zu-Sprache über Mikrofon und Audioausgabe.

16vor 8 TagenVision, Sprache & MultimodalApache-2.0
J

dsh-visual-plugin

jyh20030112/dsh-visual-plugin

Verleiht reinen Textmodellen Sehvermögen: leitet Benutzerbilder an ein OpenAI-kompatibles Vision-Modell weiter und zeigt die Beschreibungen in einem rechten Panel der Web-UI an.

16vor 3 TagenVision, Sprache & MultimodalMIT
Q

dsh-voice-mode (dsh-voice-mode)

qishuilalala/dsh-voice-mode

Vollduplex-Sprachmodus für die DeepSeek Harness Web-UI: Toggle (2-Sekunden-Pause Auto-Send) oder Hold-to-Talk-Diktat in einen editierbaren Entwurf mit zipformer2-Streaming-ASR, optionalem Wake Word; Edge-TTS-Vorlesen Satz für Satz mit Live-Untertiteln, und Sprechen unterbricht Wiedergabe und laufenden Turn (echtes Barge-in). On-Device-ASR, kein API-Schlüssel.

15vor 6 StundenVision, Sprache & MultimodalMIT