Zum Hauptinhalt springen

Vision, Sprache & Multimodal

Vision, Sprache & Multimodal-Plugins verleihen den reinen Text-DeepSeek-Modellen in DeepSeek-Harness (dsh) Augen, Ohren und eine Stimme. Finden Sie Vision-Tools und Provider-Routen, die eingefügte Screenshots über Zhipu GLM, Gemini, Doubao oder lokales Ollama per OCR erfassen und beschreiben, Mikrofon-Spracheingabe über die Web Speech API des Browsers oder Whisper-kompatible APIs, Vorlesen per Edge TTS oder eigenen Stimmen, Vollduplex-Sprachmodi sowie Generatoren für Bilder, Video und Musik.

312 Plugins gefunden

F

dsh-vision-proxy

flyvhidbwo/dsh-vision-proxy

DeepSeek-Gehirn + automatische Bildtranskription: Bilder in der GUI anhängen und jedes wird standardmäßig über das offizielle deepseek-v4-flash-vision-exp transkribiert (ein reines Text-V4-Pro-Gehirn kann Bilder sehen), mit jeder OpenAI-kompatiblen VLM oder lokalem Ollama als Alternative.

15letzten MonatVision, Sprache & MultimodalMIT
D

dsh-video-lens

dundunhan/dsh-video-lens

Gibt reinen Text-DeepSeek-Harness-Agenten Videoverständnis: szenenbewusste Frame-Abtastung + VLM + optionale ASR-Transkription, zu Zeitleistenbeweisen fusioniert. / Video-Verständnis-Plugin für reine Textmodelle (szenenbewusste Frame-Extraktion + VLM + optionale Spracherkennung).

13letzten MonatVision, Sprache & MultimodalMIT
P

dsh-vision-opencode

poiuyjie/dsh-vision-opencode

Fügt reinen Text-Hauptmodellen ein konfigurierbares Vision-Modell hinzu: ein vision_read_image-Tool, einen Vision-Modell-Selektor in der Composer-Leiste und automatische Bild-zu-Text-Konvertierung für reine Textrouten.

13vor 23 TagenVision, Sprache & MultimodalMIT
Z

dsh-agnes-studio

zmm863-commits/dsh-agnes-studio

KI-Bild- und -Video-Studio als schwebendes DSH-Panel, damit die Erstellung parallel zum Gespräch läuft statt es zu ersetzen: Text-zu-Bild, Bild-zu-Bild und Multi-Bild-Komposition in 1K–4K über acht Seitenverhältnisse; Text-zu-Video und Bild-zu-Video mit Steuerung des ersten Frames bei 4–12 Sekunden; Kurzdrama-Modus, der ein Skript (.txt/.md/.json) importiert und in Storyboard-Shots für Vorschau und Stapelgenerierung zerlegt; dazu ein Prompt-Experten-Workspace. Keine Laufzeitabhängigkeiten.

12vor 3 TagenVision, Sprache & Multimodal
B

dsh-voice-ai-girlfriend-plugin

beiyege-01/dsh-voice-ai-girlfriend-plugin

Sprach-IA-Freundin für die Web-UI: FunASR-Mikrofoneingabe, Qwen3-TTS gesprochene Antworten, Animationsfenster für den Begleiter und Zwei-Wege-QQ-Chat (Text/Sprache/Bild-Push) via NapCat.

12vor 19 TagenVision, Sprache & Multimodal
P

dsh-plugin-xiaomi-mimo-tts

ppy-web/dsh-plugin-xiaomi-mimo-tts

Fügt Xiaomi MiMo Text-to-Speech zum DSH Web hinzu: Vorlesen von Assistenten-Nachrichten, PCM-Streaming, vordefiniertes und eigenes Voice-Design, Browser-Sprachausgabe als Fallback, Wiedergabesteuerung und optionale UI-Töne.

11vor 3 TagenVision, Sprache & MultimodalMIT
A

dsh-speak

alan2z/dsh-speak

Ereignisgesteuertes Sprachansage-Plugin ohne Abhängigkeiten: kein zusätzliches Modell, keine Token-Kosten. Spricht mit der integrierten natürlichen Stimme des Systems, unterstützt sowohl Windows als auch macOS; Endantwort-Ansagen, Genehmigungs- und Frage-Alarme, optionale Ereignisansagen (Zugende, Befehl abgeschlossen, Zieländerung, Werkzeugfehler, Aufgabenaktualisierungen), wiederholbare Endantworten und eine zweisprachige visuelle Einstellungsseite.

11vor 7 TagenVision, Sprache & MultimodalMIT
C

Gemini-Eyes

consolesun/gemini-eyes

MCP-Brücke zu gemini.google.com: Bild- und Videovisionsanalyse, Imagen-Bild- und Veo-Videoerzeugung sowie Gesprächsverwaltung über die bereits angemeldete Browser-Sitzung, ganz ohne API-Schlüssel.

11letzten MonatVision, Sprache & Multimodal
P

dsh-draw

perrylink/dsh-draw

Multi-Engine-Text-zu-Bild-Generierung (OpenAI Images und Zhipu-CogView-Presets) mit Quotenverfolgung pro Sitzung, Engine-Failover, credential-sicherer Konfiguration und einer Ergebniskarte mit erneuter Generierung.

9vor 8 TagenVision, Sprache & MultimodalApache-2.0
S

dsh-deepseek-vision

siegfly/dsh-deepseek-vision

Eine Vision-Language-Gateway-Provider-Route: Eingefügte Bilder werden von einem konfigurierbaren VL-Modell (standardmäßig Qwen-VL) beschrieben, bevor sie an DeepSeek gesendet werden.

9vor 21 TagenVision, Sprache & MultimodalMIT
L

dsh-vision

linenxi-ctrl/dsh-vision

Externes Vision-Plugin für DeepSeek Harness: Konfigurationspanel über den Whale-Button, Bilderkennung mit automatischer Antwort sowie Agent-Tools für Screenshot und Erkennung.

9vor 2 MonatenVision, Sprache & MultimodalMIT
A

dsh-highres-vision

azwosile/dsh-highres-vision

Für das native Vision-Modell deepseek-v4-flash-vision-exp von DeepSeek Harness erhöht er die Bildzulassungsgrenzen auf 32 MiB / 8192 px / 600 Bilder und fügt ein highres_read-Werkzeug hinzu, das große Bilder in Kacheln zerlegt und dann das Gesamtbild plus 800x800-Kacheln über das Host-Werkzeug read_image zurückgibt.

8vor 22 TagenVision, Sprache & MultimodalMIT
G

dsh-voice

goodandready/dsh-voice

Spracheingabe für die Web-UI: nach Pausen segmentiertes Diktat und Sprachnachrichten, jeweils mit eigener Anbieter-Fallback-Kette (Deepgram, Groq, HuggingFace, lokales whisper.cpp oder ein OpenAI-kompatibler Endpunkt).

8gesternVision, Sprache & MultimodalMIT
3

dsh-voice

3274375092/dsh-voice

Spracheingabe für DeepSeek Harness: Sprechen Sie ins Mikrofon und der erkannte Text wird als normale Chat-Nachricht übermittelt, über lokale oder Browser-Spracherkennung.

8vorgesternVision, Sprache & MultimodalMIT
F

dsh-free-vision

fuzzysoul/dsh-free-vision

Kostenlose Vision-Brücke für reine Textmodelle: Bildverständnis, OCR, UI- und Debug-Analyse über kostenlose Anbieter (Qwen3-VL-Flash, Doubao, DeepSeek-OCR) mit einer Einstellungs-GUI.

8letzten MonatVision, Sprache & MultimodalMIT
C

dsh-chat-imagine

corrinehu/dsh-chat-imagine

Erzeugt und zeigt automatisch Bilder im DSH-Chat über API-Kanäle oder lokale CLIs (mmx / codex / agy) an und kann Bilder auch über die entsprechende CLI erkennen.

8letzten MonatVision, Sprache & MultimodalMIT
S

dsh-tool-vision

scorp1o117/dsh-tool-vision

Sendet lokale Bilder oder HTTP(S)-Bild-URLs an einen konfigurierten OpenAI-kompatiblen Vision-Endpunkt mit dem inspect_image-Tool und gibt dessen Textantwort an die Unterhaltung zurück.

8vor 3 TagenVision, Sprache & Multimodal
W

dsh-appshots

wongyuye/dsh-appshots

Codex-artige Fensterfassung für DSH Desktop unter macOS und Windows: Drücken Sie beide Command-Tasten (macOS) oder beide Ctrl-Tasten (Windows) oder die Kamera-Schaltfläche, um das vorderste Fenster aufzunehmen, es an den aktuellen Chat anzuhängen und einen Accessibility-Baum im VoiceOver-Stil als versteckten Kontext einzufügen.

7vor 15 TagenVision, Sprache & MultimodalMIT
5

dsh-vision

54xkeee/dsh-vision

Vision für das reine Text-DeepSeek standardmäßig über Doubao Web (kostenlos, kein API-Schlüssel nötig – steuert Ihr angemeldetes Chrome über eine Windows-CDP-Brücke), mit Antigravity-IDE-Kontingent (flash/pro) oder Gemini als Fallback; automatische Detail-Eskalation, Vision-Beleg-Speicher mit Rehydrierung nach Kompaktierung, Content-Hash-Cache und ein zweisprachiges Client-Panel.

7vor 2 MonatenVision, Sprache & MultimodalMIT
Y

dsh-duet

yums/dsh-duet

Vollduplex-Sprachinteraktion auf Chinesisch für DSH Web: diktiere und bearbeite Aufgaben, sende Anfragen, verwalte Sitzungen, beantworte DSH-Fragen und höre prägnante Aufgabenabschluss-Ansagen.

6vor 3 TagenVision, Sprache & MultimodalApache-2.0
Y

deepseek-harness-plugins (vision-bridge)

yinxe/deepseek-harness-plugins

Lässt reine Textmodelle Bilder sehen: Trifft ein Bild mit einem Platzhalter wie \[image omitted because this model accepts text only] ein, ruft das Modell das Werkzeug vision_describe auf, und das Plugin leitet die Bildreferenz samt Frage an ein multimodales Modell weiter und wiederholt bei Fehlschlag mit einem Ausweichmodell. Konfiguriert wird auf der Einstellungsseite, gespeichert über die offizielle Settings-API.

6vorgesternVision, Sprache & MultimodalMIT
Z

dsh-voice-input-plugin

zhangbo-cn/dsh-voice-input-plugin

Composer-Mikrofon für die Web-UI: Tippen zum Überwachen der Live-Transkription und Gedrückthalten zum Sprechen, mit Host-Edge-TTS-Antwortvorlesung, die gestreamt wird, während das Modell generiert, Echo-Pause während des Vorlesens und Tippen zum Stoppen.

6letzten MonatVision, Sprache & MultimodalMIT
G

dsh-ocr-local

grelvan/dsh-ocr-local

Lokaler OCR-Fallback für reine Textrouten: Wenn das Sitzungsmodell erklärt, dass es keine Bilder akzeptieren kann, wird das angehängte Bild lokal zwischengespeichert und sein Pfad injiziert, damit das Modell ocr_image aufrufen kann — PP-OCRv5 + ONNX Runtime auf der CPU, kein API-Schlüssel erforderlich, Bilder verlassen die Maschine nie. Still, wenn das Modell Bilder sehen kann.

5vor 5 TagenVision, Sprache & Multimodal
N

vision-exp-tile

nicholas023/vision-exp-tile

Großbild-Erkennung für vision-exp-Modelle: verlustfreie 800×800-Kachel-Erkennung (smart/pipeline/full), lokales OCR mit Vorverarbeitung und Handschriftrouting, optionale Multi-Vendor-GPU (DirectML/CUDA/OpenVINO) mit automatischem CPU-Fallback.

5letzten MonatVision, Sprache & MultimodalMIT