Saltar al contenido principal

Plugins

Explora, filtra e instala plugins de DeepSeek-Harness.

15 plugins encontrados

S

dsh-ros2

stvli/dsh-ros2

Conjunto de herramientas de depuración ROS2 y análisis de visión del estado del robot para DeepSeek Harness: enumeración de node/topic/service/action/interface/TF, JSON de topología completa del grafo, comprobaciones rosdep, builds con aprobación y andamiaje de mensajes personalizados, capturas de pantalla de GUI y observación de visión multimodal, más renderizado offscreen sin cabeza de RViz2 (mallas low-poly, lectura directa de píxeles, paso de GPU: renderizado de movimiento a 30 Hz) con análisis paralelo de VLM en tiempo real.

22anteayerHerramientas y funcionesMIT
F

dsh-vision-proxy

flyvhidbwo/dsh-vision-proxy

Cerebro DeepSeek + transcripción automática de imágenes: adjunta imágenes en la GUI y cada una se transcribe mediante el modelo oficial deepseek-v4-flash-vision-exp por defecto (un cerebro V4-Pro puramente textual puede ver imágenes), con cualquier VLM compatible con OpenAI u Ollama local como alternativas.

15el mes pasadoVisión, voz y multimodalMIT
D

dsh-video-lens

dundunhan/dsh-video-lens

Da a los agentes de DeepSeek Harness solo de texto comprensión de vídeo: muestreo de fotogramas consciente de la escena + VLM + transcripción ASR opcional fusionados en evidencia de línea de tiempo. / Complemento de comprensión de vídeo para modelos solo de texto (muestreo de fotogramas consciente de la escena + VLM + transcripción de voz opcional).

13el mes pasadoVisión, voz y multimodalMIT
I

dsh-video-understand

ilps2/dsh-video-understand

Herramienta de comprensión de video de bajo coste: una herramienta video_understand convierte un enlace de Bilibili / BV / video local en una capa de información AVIS (ASR + estructura de escenas + seguimiento de objetos + etiquetas YOLO) y devuelve un resumen + Q&A. Incluye enrutamiento dinámico entre capas guiado por preguntas (L0 ASR / L1 seguimiento de objetos / L2 VLM de fotograma clave), reutilización de la capa semántica para preguntas repetidas y un tope de presupuesto por pregunta. Motor Python: la capa principal necesita faster-whisper / opencv / yt-dlp (~200-300MB); la capa semántica opcional añade ~2GB de torch / transformers / ultralytics. Un doctor --fix incluido configura el venv e instala ambos.

8el mes pasadoHerramientas y funciones
5

dsh-vision

54xkeee/dsh-vision

Visión para DeepSeek de solo texto mediante Doubao Web de forma predeterminada (sin costo, sin clave de API: controla tu Chrome con sesión iniciada a través de un puente CDP de Windows), con cuota de Antigravity IDE (flash/pro) o alternativa a Gemini; escalado automático de detalle, memoria de evidencia visual con rehidratación tras compactación, caché por hash de contenido y un panel de cliente bilingüe.

7hace 2 mesesVisión, voz y multimodalMIT
S

dsh-vision-bridge

sfyyy/dsh-vision-bridge

Visión bajo demanda para sesiones DSH solo de texto: las imágenes se convierten en marcadores, y una herramienta vision_describe envía solo la imagen y la pregunta a un modelo de visión compatible con OpenAI

5hace 2 mesesVisión, voz y multimodalMIT
H

dsh-her-eyes

huashenglian/dsh-her-eyes

Un plugin de dsh que permite a la IA invocar automáticamente VLM (modelos multimodales) para el análisis visual.

4hace 2 mesesVisión, voz y multimodalMIT
H

dsh-omni-workstation

huashenglian/dsh-omni-workstation

Estación de trabajo omnimodal para DSH: analyze_image sobre una cadena ordenada de conmutación por error VLM de varias tarjetas, un conjunto de seis herramientas de visión (zoom, muestreo de color, diferencia de píxeles, OCR, detección de elementos y visualización en línea) que comparten el mismo resolutor de imágenes, generate_image mediante los protocolos OpenAI/DashScope/ComfyUI, generate_video asíncrono con varias tarjetas y un constructor /build-video-tool, y speak/clone_voice TTS en siete proveedores, todo gobernado por una única página de ajustes con autoguardado.

3hace 14 díasVisión, voz y multimodalMIT
5

dsh-youreyes

54xkeee/dsh-youreyes

Kit de visión para DeepSeek solo de texto: herramienta `vision` invocable por el modelo, adaptadores contenedores para deepseek/opencode-go (v4 flash/pro), cuota de Antigravity IDE (default, flash/pro) / cualquier VLM compatible con OpenAI / Gemini / canales locales de Ollama, memoria de evidencias con rehidratación por compactación, caché de hash de contenido y un panel de cliente bilingüe.

2hace 2 mesesVisión, voz y multimodalMIT
W

dsh-file-attachment

wszhoho/dsh-file-attachment

Drag-and-drop / paste / upload files and images; on non-multimodal models images are auto-described by a configured VLM.

1hace 3 díasMejoras de UIMIT
X

dsh-image-vision

xsoc1/dsh-image-vision

Puente de adjuntos de imágenes en el chat con una herramienta view_image para cualquier VLM compatible con OpenAI (Ollama local o nube): las imágenes pegadas/arrastradas se convierten en marcadores de ruta view_image antes de llegar a los modelos DeepSeek de solo texto.

1hace 2 mesesVisión, voz y multimodal
G

dsh-tool-vision

gloryxpnv/dsh-tool-vision

Visión estructurada local-first para agentes solo de texto: las imágenes van a un VLM local compatible con OpenAI y vuelven como evidencia JSON (resumen, OCR literal, regiones de diseño, entidades/relaciones, colores, incertidumbre explícita), con respaldo anti-alucinación y un puente opcional de pegado/subida; coste en la nube cero, las imágenes nunca salen de la máquina.

1hace 2 mesesVisión, voz y multimodalMIT
F

dsh-sight

fu3rte/dsh-sight

Visión enchufable para los modelos de solo texto de DeepSeek Harness (dsh): una herramienta `vision` con preajustes de VLM económicos/gratuitos integrados, análisis por lotes de varias imágenes, admisión de imágenes al pegarlas como pista, y una página de ajustes web con recarga en caliente.

1hace 2 mesesVisión, voz y multimodalMIT
R

dsh-llm-mlx

robbywang25/dsh-llm-mlx

Use local MLX-LM or MLX-VLM models in DeepSeek Harness through a loopback OpenAI-compatible provider, with optional DSH-owned server startup.

0hace 27 díasModelos y proveedoresMIT
L

dsh-mingmu

lab-sku/dsh-mingmu

明眸 VisionBridge - Puente visual propio: cuando un modelo ciego recibe imágenes, llama automáticamente a un modelo visual para reconocerlas y devuelve el texto reconocido al modelo principal; transparente, configurable y sin pérdidas al actualizar.

0hace 2 mesesVisión, voz y multimodalMIT