- Startseite
- Kategorien
- Vision, Sprache & Multimodal
Vision, Sprache & Multimodal
Vision, Sprache & Multimodal-Plugins verleihen den reinen Text-DeepSeek-Modellen in DeepSeek-Harness (dsh) Augen, Ohren und eine Stimme. Finden Sie Vision-Tools und Provider-Routen, die eingefügte Screenshots über Zhipu GLM, Gemini, Doubao oder lokales Ollama per OCR erfassen und beschreiben, Mikrofon-Spracheingabe über die Web Speech API des Browsers oder Whisper-kompatible APIs, Vorlesen per Edge TTS oder eigenen Stimmen, Vollduplex-Sprachmodi sowie Generatoren für Bilder, Video und Musik.
312 Plugins gefunden
dsh-vision-proxy
flyvhidbwo/dsh-vision-proxy
DeepSeek-Gehirn + automatische Bildtranskription: Bilder in der GUI anhängen und jedes wird standardmäßig über das offizielle deepseek-v4-flash-vision-exp transkribiert (ein reines Text-V4-Pro-Gehirn kann Bilder sehen), mit jeder OpenAI-kompatiblen VLM oder lokalem Ollama als Alternative.
dsh-video-lens
dundunhan/dsh-video-lens
Gibt reinen Text-DeepSeek-Harness-Agenten Videoverständnis: szenenbewusste Frame-Abtastung + VLM + optionale ASR-Transkription, zu Zeitleistenbeweisen fusioniert. / Video-Verständnis-Plugin für reine Textmodelle (szenenbewusste Frame-Extraktion + VLM + optionale Spracherkennung).
dsh-vision-opencode
poiuyjie/dsh-vision-opencode
Fügt reinen Text-Hauptmodellen ein konfigurierbares Vision-Modell hinzu: ein vision_read_image-Tool, einen Vision-Modell-Selektor in der Composer-Leiste und automatische Bild-zu-Text-Konvertierung für reine Textrouten.
dsh-agnes-studio
zmm863-commits/dsh-agnes-studio
KI-Bild- und -Video-Studio als schwebendes DSH-Panel, damit die Erstellung parallel zum Gespräch läuft statt es zu ersetzen: Text-zu-Bild, Bild-zu-Bild und Multi-Bild-Komposition in 1K–4K über acht Seitenverhältnisse; Text-zu-Video und Bild-zu-Video mit Steuerung des ersten Frames bei 4–12 Sekunden; Kurzdrama-Modus, der ein Skript (.txt/.md/.json) importiert und in Storyboard-Shots für Vorschau und Stapelgenerierung zerlegt; dazu ein Prompt-Experten-Workspace. Keine Laufzeitabhängigkeiten.
dsh-voice-ai-girlfriend-plugin
beiyege-01/dsh-voice-ai-girlfriend-plugin
Sprach-IA-Freundin für die Web-UI: FunASR-Mikrofoneingabe, Qwen3-TTS gesprochene Antworten, Animationsfenster für den Begleiter und Zwei-Wege-QQ-Chat (Text/Sprache/Bild-Push) via NapCat.
dsh-plugin-xiaomi-mimo-tts
ppy-web/dsh-plugin-xiaomi-mimo-tts
Fügt Xiaomi MiMo Text-to-Speech zum DSH Web hinzu: Vorlesen von Assistenten-Nachrichten, PCM-Streaming, vordefiniertes und eigenes Voice-Design, Browser-Sprachausgabe als Fallback, Wiedergabesteuerung und optionale UI-Töne.
dsh-speak
alan2z/dsh-speak
Ereignisgesteuertes Sprachansage-Plugin ohne Abhängigkeiten: kein zusätzliches Modell, keine Token-Kosten. Spricht mit der integrierten natürlichen Stimme des Systems, unterstützt sowohl Windows als auch macOS; Endantwort-Ansagen, Genehmigungs- und Frage-Alarme, optionale Ereignisansagen (Zugende, Befehl abgeschlossen, Zieländerung, Werkzeugfehler, Aufgabenaktualisierungen), wiederholbare Endantworten und eine zweisprachige visuelle Einstellungsseite.
Gemini-Eyes
consolesun/gemini-eyes
MCP-Brücke zu gemini.google.com: Bild- und Videovisionsanalyse, Imagen-Bild- und Veo-Videoerzeugung sowie Gesprächsverwaltung über die bereits angemeldete Browser-Sitzung, ganz ohne API-Schlüssel.
dsh-draw
perrylink/dsh-draw
Multi-Engine-Text-zu-Bild-Generierung (OpenAI Images und Zhipu-CogView-Presets) mit Quotenverfolgung pro Sitzung, Engine-Failover, credential-sicherer Konfiguration und einer Ergebniskarte mit erneuter Generierung.
dsh-deepseek-vision
siegfly/dsh-deepseek-vision
Eine Vision-Language-Gateway-Provider-Route: Eingefügte Bilder werden von einem konfigurierbaren VL-Modell (standardmäßig Qwen-VL) beschrieben, bevor sie an DeepSeek gesendet werden.
dsh-vision
linenxi-ctrl/dsh-vision
Externes Vision-Plugin für DeepSeek Harness: Konfigurationspanel über den Whale-Button, Bilderkennung mit automatischer Antwort sowie Agent-Tools für Screenshot und Erkennung.
dsh-highres-vision
azwosile/dsh-highres-vision
Für das native Vision-Modell deepseek-v4-flash-vision-exp von DeepSeek Harness erhöht er die Bildzulassungsgrenzen auf 32 MiB / 8192 px / 600 Bilder und fügt ein highres_read-Werkzeug hinzu, das große Bilder in Kacheln zerlegt und dann das Gesamtbild plus 800x800-Kacheln über das Host-Werkzeug read_image zurückgibt.
dsh-voice
goodandready/dsh-voice
Spracheingabe für die Web-UI: nach Pausen segmentiertes Diktat und Sprachnachrichten, jeweils mit eigener Anbieter-Fallback-Kette (Deepgram, Groq, HuggingFace, lokales whisper.cpp oder ein OpenAI-kompatibler Endpunkt).
dsh-voice
3274375092/dsh-voice
Spracheingabe für DeepSeek Harness: Sprechen Sie ins Mikrofon und der erkannte Text wird als normale Chat-Nachricht übermittelt, über lokale oder Browser-Spracherkennung.
dsh-free-vision
fuzzysoul/dsh-free-vision
Kostenlose Vision-Brücke für reine Textmodelle: Bildverständnis, OCR, UI- und Debug-Analyse über kostenlose Anbieter (Qwen3-VL-Flash, Doubao, DeepSeek-OCR) mit einer Einstellungs-GUI.
dsh-chat-imagine
corrinehu/dsh-chat-imagine
Erzeugt und zeigt automatisch Bilder im DSH-Chat über API-Kanäle oder lokale CLIs (mmx / codex / agy) an und kann Bilder auch über die entsprechende CLI erkennen.
dsh-tool-vision
scorp1o117/dsh-tool-vision
Sendet lokale Bilder oder HTTP(S)-Bild-URLs an einen konfigurierten OpenAI-kompatiblen Vision-Endpunkt mit dem inspect_image-Tool und gibt dessen Textantwort an die Unterhaltung zurück.
dsh-appshots
wongyuye/dsh-appshots
Codex-artige Fensterfassung für DSH Desktop unter macOS und Windows: Drücken Sie beide Command-Tasten (macOS) oder beide Ctrl-Tasten (Windows) oder die Kamera-Schaltfläche, um das vorderste Fenster aufzunehmen, es an den aktuellen Chat anzuhängen und einen Accessibility-Baum im VoiceOver-Stil als versteckten Kontext einzufügen.
dsh-vision
54xkeee/dsh-vision
Vision für das reine Text-DeepSeek standardmäßig über Doubao Web (kostenlos, kein API-Schlüssel nötig – steuert Ihr angemeldetes Chrome über eine Windows-CDP-Brücke), mit Antigravity-IDE-Kontingent (flash/pro) oder Gemini als Fallback; automatische Detail-Eskalation, Vision-Beleg-Speicher mit Rehydrierung nach Kompaktierung, Content-Hash-Cache und ein zweisprachiges Client-Panel.
dsh-duet
yums/dsh-duet
Vollduplex-Sprachinteraktion auf Chinesisch für DSH Web: diktiere und bearbeite Aufgaben, sende Anfragen, verwalte Sitzungen, beantworte DSH-Fragen und höre prägnante Aufgabenabschluss-Ansagen.
deepseek-harness-plugins (vision-bridge)
yinxe/deepseek-harness-plugins
Lässt reine Textmodelle Bilder sehen: Trifft ein Bild mit einem Platzhalter wie \[image omitted because this model accepts text only] ein, ruft das Modell das Werkzeug vision_describe auf, und das Plugin leitet die Bildreferenz samt Frage an ein multimodales Modell weiter und wiederholt bei Fehlschlag mit einem Ausweichmodell. Konfiguriert wird auf der Einstellungsseite, gespeichert über die offizielle Settings-API.
dsh-voice-input-plugin
zhangbo-cn/dsh-voice-input-plugin
Composer-Mikrofon für die Web-UI: Tippen zum Überwachen der Live-Transkription und Gedrückthalten zum Sprechen, mit Host-Edge-TTS-Antwortvorlesung, die gestreamt wird, während das Modell generiert, Echo-Pause während des Vorlesens und Tippen zum Stoppen.
dsh-ocr-local
grelvan/dsh-ocr-local
Lokaler OCR-Fallback für reine Textrouten: Wenn das Sitzungsmodell erklärt, dass es keine Bilder akzeptieren kann, wird das angehängte Bild lokal zwischengespeichert und sein Pfad injiziert, damit das Modell ocr_image aufrufen kann — PP-OCRv5 + ONNX Runtime auf der CPU, kein API-Schlüssel erforderlich, Bilder verlassen die Maschine nie. Still, wenn das Modell Bilder sehen kann.
vision-exp-tile
nicholas023/vision-exp-tile
Großbild-Erkennung für vision-exp-Modelle: verlustfreie 800×800-Kachel-Erkennung (smart/pipeline/full), lokales OCR mit Vorverarbeitung und Handschriftrouting, optionale Multi-Vendor-GPU (DirectML/CUDA/OpenVINO) mit automatischem CPU-Fallback.