Zum Hauptinhalt springen

Vision, Sprache & Multimodal

Vision, Sprache & Multimodal-Plugins verleihen den reinen Text-DeepSeek-Modellen in DeepSeek-Harness (dsh) Augen, Ohren und eine Stimme. Finden Sie Vision-Tools und Provider-Routen, die eingefügte Screenshots über Zhipu GLM, Gemini, Doubao oder lokales Ollama per OCR erfassen und beschreiben, Mikrofon-Spracheingabe über die Web Speech API des Browsers oder Whisper-kompatible APIs, Vorlesen per Edge TTS oder eigenen Stimmen, Vollduplex-Sprachmodi sowie Generatoren für Bilder, Video und Musik.

312 Plugins gefunden

B

dsh-ocr-local

balcoz/dsh-ocr-local

Lokale OCR für DeepSeek Harness: Bild einfügen/anfügen, Text über PP-OCRv5 + ONNX Runtime erhalten, vollständig offline. TUI (cc-tui) und Web.

5vor 2 MonatenVision, Sprache & Multimodal
S

dsh-vision-bridge

sfyyy/dsh-vision-bridge

On-Demand-Vision für reine Text-DSH-Sitzungen: Bilder werden zu Markern, und ein vision_describe-Tool sendet nur das Bild und die Frage an ein OpenAI-kompatibles Vision-Modell

5vor 2 MonatenVision, Sprache & MultimodalMIT
0

dsh-voice-input

0nt-one/dsh-voice-input

Mikrofon-Schaltfläche in der Composer-Werkzeugleiste: Web-Speech-API-Sprache-zu-Text (Chrome/Edge), Sprachwechsel und optionaler Auto-Send, ohne Abhängigkeiten.

5vor 2 MonatenVision, Sprache & MultimodalMIT
T

dsh-plugin-appshot

tauruswood/dsh-plugin-appshot

Codex Appshots für DSH: erfasst das vorderste aktive Fenster via Global-Shortcut und mountet es nahtlos in den Composer für Agent-Queries.

5vor 5 TagenVision, Sprache & MultimodalMIT
P

dsh-screenshot

paicat1/dsh-screenshot

Bildschirmaufnahme ohne Abhängigkeiten für DSH: Lightweight — null Abhängigkeiten, null Binaries; Stage & shoot — Vollbild-, Fensterlayout- und Hover-Snap-Aufnahme verdeckter Fenster mit einem Klick; Agent-Self-Service — Lieferung nur per Pfad; Pfade sind universell, kombiniere es mit modlens (optional) für strukturierte Nachweise mit einem Aufruf.

5vor 24 TagenVision, Sprache & MultimodalMIT
A

dsh-guide-dog

atropinoltt/dsh-guide-dog

MiniMax-betriebenes multimodales Plugin: Echtzeit-Sprachanrufmodus (Streaming-Gespräch, schwebende Dock-UI), Sprachmodus und Mikrofon-Spracheingabe, sowie Bild-/Video-/Musik-/Sprachgenerierung und visuelle Inspektionstools.

5vor 2 MonatenVision, Sprache & MultimodalMIT
E

canvas-workbench

elangan1997-cmyk/canvas-workbench

Lokale Bildgenerierungs-Werkbank, ohne Abo: Eigene API für die Bildgenerierung nutzen (jede OpenAI-kompatible Schnittstelle, null Abo), Canvas-Layout + Retusche/Löschen/Hintergrund entfernen/OCR/Vektorisierung, bearbeitbare PSD/AI-Ausgabe, bidirektionale Photoshop/Illustrator-Ebenen-Bridge

4vor 3 TagenVision, Sprache & MultimodalMIT
Y

dsh-tts-bridge

yuuyuko-uu/dsh-tts-bridge

Liest DSH-Konversationen laut vor, indem es die integrierte Vorlesefunktion der DeepSeek-Webseite nutzt, gesteuert von einer kleinen Browser-Erweiterung.

4vor 3 TagenVision, Sprache & Multimodal
C

dsh-cycle-image-gen

chengzzzi44/dsh-cycle-image-gen

Werkzeug zur Bilderzeugung für DeepSeek Harness über jeden OpenAI-kompatiblen Bilder-Endpunkt, mit integrierter Galerie in der Web-UI.

4vor 22 TagenVision, Sprache & MultimodalMIT
V

tripo3d-plugin-dsh

vast-ai-research/tripo3d-plugin-dsh

Tripo-3D-Skills für DeepSeek Harness – engine-fertige 3D-Assets aus einer Textaufforderung oder einem Referenzbild über tripo-cli erzeugen, mit Texturierung, Rigging, Retopologie und Formatkonvertierung in einem Durchgang.

4vor 23 TagenVision, Sprache & Multimodal
L

deepseek-vl-support

limccn/deepseek-vl-support

Verleiht DeepSeek-Modellen (nur Text) Bildverarbeitung in Claude Code-, Codex- und Agent-Plugins-Clients: beschreibt Bilder über jeden OpenAI-kompatiblen Vision-Endpoint.

4letzten MonatVision, Sprache & MultimodalMIT
L

screenshot-feedback-hook-mcp (dsh-plugin)

lkh081231/screenshot-feedback-hook-mcp

Fügt ein Screenshot-Werkzeug sowie zwei optionale automatische Erfassungspunkte hinzu, die den Bildschirm als Bildblock in das Gespräch einfügen; erfordert ein bildfähiges Modell.

4letzten MonatVision, Sprache & MultimodalMIT
A

dsh-pdf-reader

angeloszou/dsh-pdf-reader

Ein inhaltsbewusstes PDF-Lesepaket für Visionsmodelle: profiliert jede Seite auf Abbildungen (Vektor und Raster), Tabellen, Formelrisiko und zweispaltiges Layout, wendet dann eine inhaltsbewusste hybride Extraktion an und rendert Seiten mit Abbildungen/Tabellen/Formeln als hochauflösende Region-Crops. Bietet eine niedrigauflösende Vorschau zum Verständnis des Seitenlayouts und rendert eine angegebene Region hochauflösend. Als mehrere Werkzeuge für Agents verpackt.

4letzten MonatVision, Sprache & MultimodalMIT
N

dsh-hos-scrcpy

ns-zzj/dsh-hos-scrcpy

Steuere ein HarmonyOS-Telefon über die DSH-Weboberfläche mit KI: Live-H.264-Bildschirmspiegelung, Mausberührung und Systemtasten, hilog-Streaming sowie agentische Werkzeuge, mit denen das Modell den Bildschirm lesen, UI-Steuerelemente finden und dann tippen, lange drücken, Tasten drücken oder Text eingeben kann.

4vorgesternVision, Sprache & MultimodalMIT
X

dsh-vision-hub (tool-vision)

xing666173/dsh-vision-hub

Erweiterte Vision-Toolbox: 14 Pixel-Level-Vision-Tools (describe, ground, detect, crop, pixel-diff, OCR, long-screenshot OCR, vectorize, colors, cutout, screenshot, present, materialize, html-screenshot), gesteuert von einem OpenAI-kompatiblen Endpoint, mit sauberen [图片: path]-Bridge-Markern, Content-Safety-Klassifikation und Auto-Retry bei Rate-Limits.

4letzten MonatVision, Sprache & Multimodal
D

dsh-image-pathify

dami9527/dsh-image-pathify

Ermöglicht reinen Textmodellen den Umgang mit eingefügten Chat-Bildern, mit nativem Vision-Erlebnis, Bildanzeige im Stapel und einem integrierten OpenAI-kompatiblen analyze_image-Tool; visionsfähige Modelle bleiben unbeeinflusst.

4vor 8 TagenVision, Sprache & MultimodalMIT
S

dsh-voice

stardustlc666/dsh-voice

Sprachwerkzeuge: kostenlose neuronale Sprachsynthese mit edge-tts, OpenAI-kompatible ASR-Transkription, Stimmliste, Massenvorschau der Stimmen und Integritäts-Selbstprüfung.

4vor 9 StundenVision, Sprache & MultimodalMIT
H

dsh-voice

haoku123/dsh-voice

Full-Duplex-Sprachmodus für die Web-UI: Tippen zum Umschalten oder Halten zum Sprechen zum Diktieren (Senden-Taste oder `Ctrl`) mit Live-Untertiteln, hostseitige SenseVoice-ASR über sherpa-onnx, satzweise gesprochene Antworten und Sprechen unterbricht die Wiedergabe und den laufenden Zug (echtes Hineinreden). Kein API-Schlüssel erforderlich.

4letzten MonatVision, Sprache & MultimodalMIT
F

dsh-chatvoice

fuzzysoul/dsh-chatvoice

Kostenlose geschlossene Sprachschleife für die Web-UI: Mikrofoneingabe über die Browser-SpeechRecognition mit Live-Zwischenergebnissen plus Vorlese-Lautsprecherschaltflächen und automatisches Vorlesen der Antworten des Assistenten, ganz ohne Konfiguration und ohne API-Schlüssel.

4vor 2 MonatenVision, Sprache & MultimodalMIT
X

dsh-draw-router

xiaozhe7772222/dsh-draw-router

Einheitlicher Router für Bilderzeugung für DeepSeek Harness (DSH): entdeckt Bildmodelle automatisch von jedem OpenAI-kompatiblen Endpunkt, stellt die Tools draw_image und draw_list_sources bereit und unterstützt SenseNova, StepFun, Agnes, Qwen, Flux, SD, Imagen und mehr.

4letzten MonatVision, Sprache & MultimodalMIT
N

free-vision-skill

niyongsheng/free-vision-skill

Völlig lokale Bildverarbeitung und OCR über das macOS Vision Framework: `ocr_image` (Text, Tabellenlayout + Koordinaten) und `view_image` (Szene, Gesichter, QR) — fügen Sie mehrere Bilder in das Web-Eingabefeld ein oder übergeben Sie Pfad/URL/base64; Bilder verlassen Ihren Mac nie.

4letzten MonatVision, Sprache & MultimodalMIT
G

deepseek-vision (dsh-plugin-deepseek-vision)

gou-gee/deepseek-vision

Vision-MCP- und DSH-Bundle für textbasiertes DeepSeek: analyze_image-, analyze_clipboard-, compare_images- und vision_status-Werkzeuge, eine visuelle Einstellungsseite, standardmäßig kostenloses GLM-4.6V-Flash, Ergebnis-Caching und Rate-Limit-Toleranz; Schlüssel erscheinen nicht in Logs.

4vor 26 TagenVision, Sprache & MultimodalMIT
F

dsh-plugin-deepeye

favio8/dsh-plugin-deepeye

DeepEye-Vision-Plugin für DeepSeek Harness (DSH): Bildbeschreibung, OCR, VQA, UI-Layout und Zwischenablage-Analyse.

4vor 2 MonatenVision, Sprache & Multimodal
H

dsh-her-eyes

huashenglian/dsh-her-eyes

Ein dsh-Plugin, mit dem die KI automatisch VLMs (multimodale Modelle) für die visuelle Analyse aufrufen kann.

4vor 2 MonatenVision, Sprache & MultimodalMIT