Passer au contenu principal

Plugins

Parcourez, filtrez et installez des plugins DeepSeek-Harness.

15 plugins trouvés

S

dsh-ros2

stvli/dsh-ros2

Boîte à outils de débogage ROS2 et analyse de vision d'état de robot pour DeepSeek Harness : énumération de node/topic/service/action/interface/TF, JSON de topologie du graphe complet, vérifications rosdep, builds à approbation validée et échafaudage de messages personnalisés, captures d'écran GUI et observation de vision multimodale, plus rendu offscreen RViz2 headless (maillages low-poly, lecture directe de pixels, passthrough GPU - rendu de mouvement à 30Hz) avec analyse temps réel VLM en parallèle.

22avant-hierOutils et capacitésMIT
F

dsh-vision-proxy

flyvhidbwo/dsh-vision-proxy

Cerveau DeepSeek + transcription automatique d'images : attachez des images dans la GUI et chacune est transcrite par le modèle officiel deepseek-v4-flash-vision-exp par défaut (un cerveau V4-Pro en texte pur peut voir les images), avec n'importe quelle VLM compatible OpenAI ou Ollama local comme alternatives.

15le mois dernierVision, voix et multimodalMIT
D

dsh-video-lens

dundunhan/dsh-video-lens

Donne aux agents DeepSeek Harness textuels la compréhension vidéo : échantillonnage de trames contextuel + VLM + transcription ASR optionnelle fusionnés en preuves de timeline. / Plugin de compréhension vidéo pour modèles texte uniquement (échantillonnage de trames contextuel + VLM + transcription vocale optionnelle).

13le mois dernierVision, voix et multimodalMIT
I

dsh-video-understand

ilps2/dsh-video-understand

Outil de compréhension vidéo à faible coût : un outil video_understand transforme un lien Bilibili / BV / une vidéo locale en couche d’informations AVIS (ASR + structure de scène + suivi d’objets + étiquettes YOLO) et renvoie un résumé + Q&R. Routage dynamique inter-couches guidé par les questions (L0 ASR / L1 suivi d’objets / L2 VLM sur image clé), réutilisation de la couche sémantique pour les questions répétées, plafond de budget par question. Moteur Python : la couche principale nécessite faster-whisper / opencv / yt-dlp (~200-300MB) ; la couche sémantique optionnelle ajoute ~2GB de torch / transformers / ultralytics. Un doctor --fix inclus configure le venv et installe les deux.

8le mois dernierOutils et capacités
5

dsh-vision

54xkeee/dsh-vision

Vision pour DeepSeek en mode texte seul via Doubao Web par défaut (gratuit, sans clé API — pilote votre Chrome connecté via un pont CDP Windows), avec quota Antigravity IDE (flash/pro) ou repli sur Gemini ; escalade automatique du niveau de détail, mémoire de preuves visuelles avec réhydratation après compaction, cache par hachage de contenu, et un panneau client bilingue.

7il y a 2 moisVision, voix et multimodalMIT
S

dsh-vision-bridge

sfyyy/dsh-vision-bridge

Vision à la demande pour les sessions DSH texte uniquement : les images deviennent des marqueurs, et un outil vision_describe envoie uniquement l'image et la question à un modèle de vision compatible OpenAI

5il y a 2 moisVision, voix et multimodalMIT
H

dsh-her-eyes

huashenglian/dsh-her-eyes

Un plugin dsh qui permet à l'IA d'invoquer automatiquement des VLM (modèles multimodaux) pour l'analyse visuelle.

4il y a 2 moisVision, voix et multimodalMIT
H

dsh-omni-workstation

huashenglian/dsh-omni-workstation

Station de travail omni-modale pour DSH : analyze_image sur une chaîne de basculement VLM ordonnée à plusieurs cartes, une boîte à outils de vision à six outils (zoom, échantillonnage de couleurs, diff de pixels, OCR, détection d'éléments, affichage en ligne) partageant le même résolveur d'images, generate_image via les protocoles OpenAI/DashScope/ComfyUI, generate_video asynchrone multi-cartes avec un constructeur /build-video-tool, et TTS speak/clone_voice sur sept fournisseurs, le tout piloté par une seule page de paramètres à enregistrement automatique.

3il y a 14 joursVision, voix et multimodalMIT
5

dsh-youreyes

54xkeee/dsh-youreyes

Boîte à outils de vision pour DeepSeek texte seul : outil `vision` appelable par le modèle, adaptateurs wrappers pour deepseek/opencode-go (v4 flash/pro), quota Antigravity IDE (default, flash/pro) / tout VLM compatible OpenAI / Gemini / canaux Ollama locaux, mémoire de preuves avec réhydratation par compactage, cache de hachage de contenu et panneau client bilingue.

2il y a 2 moisVision, voix et multimodalMIT
W

dsh-file-attachment

wszhoho/dsh-file-attachment

Drag-and-drop / paste / upload files and images; on non-multimodal models images are auto-described by a configured VLM.

1il y a 3 joursAméliorations UIMIT
X

dsh-image-vision

xsoc1/dsh-image-vision

Pont de pièces jointes d'images dans le chat avec un outil view_image pour tout VLM compatible OpenAI (Ollama local ou cloud) : les images collées/déposées deviennent des marqueurs de chemin view_image avant d'atteindre les modèles DeepSeek texte uniquement.

1il y a 2 moisVision, voix et multimodal
G

dsh-tool-vision

gloryxpnv/dsh-tool-vision

Vision structurée local-first pour agents texte seul : les images partent vers un VLM local compatible OpenAI et reviennent en preuves JSON (résumé, OCR littéral, régions de mise en page, entités/relations, couleurs, incertitude explicite), avec repli anti-hallucination et pont facultatif de collage/envoi ; coût cloud nul, les images ne quittent jamais la machine.

1il y a 2 moisVision, voix et multimodalMIT
F

dsh-sight

fu3rte/dsh-sight

Vision en plugin pour les modèles DeepSeek Harness (dsh) texte seul : un outil `vision` avec des préréglages VLM gratuits/économiques intégrés, analyse par lot multi-images, admission d'image par indice de collage, et une page de réglages web avec rechargement à chaud.

1il y a 2 moisVision, voix et multimodalMIT
R

dsh-llm-mlx

robbywang25/dsh-llm-mlx

Use local MLX-LM or MLX-VLM models in DeepSeek Harness through a loopback OpenAI-compatible provider, with optional DSH-owned server startup.

0il y a 27 joursModèles et fournisseursMIT
L

dsh-mingmu

lab-sku/dsh-mingmu

明眸 VisionBridge - Pont visuel développé en interne : lorsqu'un modèle aveugle reçoit une image, il appelle automatiquement un modèle visuel pour la reconnaître et renvoie le texte reconnu au modèle principal ; transparent, configurable, sans perte lors des mises à jour.

0il y a 2 moisVision, voix et multimodalMIT