- Startseite
- Kategorien
- Vision, Sprache & Multimodal
Vision, Sprache & Multimodal
Vision, Sprache & Multimodal-Plugins verleihen den reinen Text-DeepSeek-Modellen in DeepSeek-Harness (dsh) Augen, Ohren und eine Stimme. Finden Sie Vision-Tools und Provider-Routen, die eingefügte Screenshots über Zhipu GLM, Gemini, Doubao oder lokales Ollama per OCR erfassen und beschreiben, Mikrofon-Spracheingabe über die Web Speech API des Browsers oder Whisper-kompatible APIs, Vorlesen per Edge TTS oder eigenen Stimmen, Vollduplex-Sprachmodi sowie Generatoren für Bilder, Video und Musik.
312 Plugins gefunden
dsh-web-ui (dsh-tool-describe-image)
zhu1090093659/dsh-web-ui
Ein `describe_image`-Vision-Tool für rein textbasierte Modelle: Bilder (lokaler Pfad, URL, Anhang) werden an einen konfigurierbaren, OpenAI-kompatiblen Vision-Endpunkt gesendet, und nur der zurückgegebene Text gelangt in die Sitzung.
ipollowork
devin-axis/ipollowork
iPolloWork HyperFrames Video Studio und 27 bearbeitbare Videovorlagen als native Konversationsansicht für DeepSeek Harness.
modlens
liustack/modlens
Vision-Brücke für reine Textmodelle: Bild einfügen, strukturierte JSON-Belege erhalten (OCR, Layout, Semantik).
dsh-vision-router
ysr666/dsh-vision-router
Kostenlose Vision für reine Textagenten: integrierte, schlüssellose Vision-Chain plus Pixel-Tools (Q&A, Grounding, Zuschneiden, Pixel-Diff, Farben, OCR, SVG-Trace, Freistellen, Screenshots); Bild einfügen zur Nutzung.
dsh-vision-toolkit
anionex/dsh-vision-toolkit
Vision für reine Textmodelle: Fügen Sie ein Bild ein und das Modell wechselt zur Vision-Toolkit-Variante für Bild-Q&A, Mehrbildvergleich, Lang-Screenshot-OCR, Screenshot-zu-UI-Reproduktion, Element-Grounding und Pixel-Diff. Standardmäßig kein API-Key erforderlich — Bilder werden vom kostenlosen, vom Autor gehosteten Dienst verarbeitet, 100 pro Maschine pro Tag; konfigurierbar auf Ihren eigenen Anbieter.
tongflow
tong-io/tongflow
TongFlow-Studio-Plugin für DeepSeek Harness (dsh): Filmcrew-artiges Projektmodell, vom Agent erstellte TongFlow-Workflows, deterministische Medienerstellung, eingebettete Canvas.
dsh-image-gen
shanliuling/dsh-image-gen
Native konversationelle Bildgenerierung für DeepSeek Harness: Bitten Sie den Agenten, ein Bild zu erstellen, und er übernimmt die Generierung und behält das Ergebnis direkt in der Konversation.
watch-skill
oxbshw/watch-skill
Die Funktionen von DeepWatch, installierbar in ein bestehendes DeepSeek Harness-Profil
dsh-imagegen
dickpy/dsh-imagegen
KI-Bildgenerierung für die DSH-Web-GUI: Text-zu-Bild und Bild-zu-Bild über einen konfigurierbaren OpenAI-kompatiblen Endpunkt (gpt-image-2 / gpt-image-1 / dall-e-3), mit einer api_url/api_key-Einstellungskarte und einem geteilten Generierungsstudio in der Seitenleiste.
dsh-comfyui
fandc520/dsh-comfyui
Steuern Sie einen lokalen oder Remote-ComfyUI-Server aus DeepSeek Harness: Die Tools comfyui_run / comfyui_object_info / comfyui_workflow erzeugen und bearbeiten Bilder und Videos, mit einer Workflow-Bibliothek (Graph-Extraktion: pro Komponente / Hauptfluss / alle), einem Ladebereich mit automatischer Auflösungsanpassung, einer Live-Warteschlange, SDXL- und Wan-2.1-Vorlagen, einem Begleit-Skill und einem Media-Proxy gleicher Herkunft.
dsh-omi-voice
polinnizhong/dsh-omi-voice
Vorlesen im Chat für DeepSeek Harness: per Tipp AI-Antworten vorlesen, pausieren und fortsetzen mit natürlichen Doubao-TTS-Stimmen (BYOK); liest nur die endgültige Antwort, Code, Tabellen und Diagramme werden ausgefiltert; lokale Engine, das Plugin speichert keinen API-Schlüssel.
deepseek-harness-video-director
chiphoton/deepseek-harness-video-director
🎬KI-Regisseur: MiniMax-H3-Videogenerierungs-Plugin unter der Regie von DeepSeek-Harness. 🤖Mehr als Prompts. 🪄Canvas-UI.
dsh-design-qa
sunxin-ai/dsh-design-qa
Design-Treue-QA für textbasierte Modelle: Ein `deepseek_vision`-Tool leiht sich ein Auge von jedem OpenAI-kompatiblen Vision-Pfad, damit das Modell beurteilen kann, ob eine Implementierung zu seinem Mock passt — ausgeliefert mit dem Benchmark hinter diesem Urteil (vier Fixtures, 23 injizierte Defekte, Rohtranskripte) und der Fragedisziplin, von der es abhängt.
picturereader
jing-hy/picturereader
Bild-„Lesen“ für reine Textmodelle: Herunterskalieren + Reduzierung der Farbtiefe + Struktur-/Farb-Fingerabdrücke werden in Textraster umgewandelt und in das Gespräch zurückgespeist, sodass das Modell wie ein multimodales Modell autonom zoomen, sampeln und OCR durchführen kann; vollständig lokal ohne Abhängigkeit von externen Modellen, enthält einen Skill zur Bild-Lese-Methodik sowie optional PaddleOCR.
dsh-voice-scribe
pensivefei/dsh-voice-scribe
Spracheingabe für die Web-UI: Alt (oder Alt+Space) drücken, um das Diktat zu starten/stoppen, Browser Web Speech (Zero-Config) oder OpenAI-kompatible Cloud-ASR, optionale Politur durch das DSH-konfigurierte LLM, Einstellungs-UI.
dsh-vision
oil-oil/dsh-vision
Nahezu native Bildverständnis-Funktionen für DeepSeek Harness.
dsh-web-ui (dsh-tool-describe-image)
damonkoy/dsh-web-ui
Verleiht einem Text-only-Modell Bildverständnis über ein Vision-Language-Modell, bereitgestellt als `describe_image`-Werkzeug.
dsh-ears
wiziscool/dsh-ears
Spracheingabe-Plugin für DeepSeek Harness (dsh): Eine Mikrofon-Schaltfläche im Composer wandelt Sprache in einen Entwurfstranskript um, mit wählbaren Spracherkennungs-Backends, optionaler Nachbearbeitung über die eigenen LLM-Routen von dsh und einer nativen Einstellungsseite.
dsh-plugin-tts
1624318455/dsh-plugin-tts
Liest Assistentenantworten laut vor über kostenloses Edge TTS oder eigene RVC-Sprachmodelle: Vorlese-Schaltflächen + automatisches Vorlesen, adaptive blockweise progressive Wiedergabe (lückenlose Langtexte), Ein-Klick-Installation von Voice-Packs aus einer Registry sowie eine portable RVC-Laufzeitumgebung.
dsh-media-skills
mjorgin/dsh-media-skills
Kostenlose Vision-Bridge und Bildgenerierung für reine Textmodelle: Lesen eingefügter Bilder, Failover zwischen GLM-4V-Flash- und Gemini-Engine, strukturierte Evidenz im ModLens-Stil und eine vorbelegte kostenlose Vision-Modell-Route.
dsh-aigc-canvas
dsh-external/dsh-aigc-canvas
AIGC-Canvas-Plugin (cordis).
dsh-talk
perrylink/dsh-talk
Sprach-Ein-/Ausgabe für DeepSeek Harness — Sprache-zu-Text und Text-zu-Sprache über Mikrofon und Audioausgabe.
dsh-visual-plugin
jyh20030112/dsh-visual-plugin
Verleiht reinen Textmodellen Sehvermögen: leitet Benutzerbilder an ein OpenAI-kompatibles Vision-Modell weiter und zeigt die Beschreibungen in einem rechten Panel der Web-UI an.
dsh-voice-mode (dsh-voice-mode)
qishuilalala/dsh-voice-mode
Vollduplex-Sprachmodus für die DeepSeek Harness Web-UI: Toggle (2-Sekunden-Pause Auto-Send) oder Hold-to-Talk-Diktat in einen editierbaren Entwurf mit zipformer2-Streaming-ASR, optionalem Wake Word; Edge-TTS-Vorlesen Satz für Satz mit Live-Untertiteln, und Sprechen unterbricht Wiedergabe und laufenden Turn (echtes Barge-in). On-Device-ASR, kein API-Schlüssel.