Pular para o conteúdo principal

Plugins

Navegue, filtre e instale plugins do DeepSeek-Harness.

15 plugins encontrados

S

dsh-ros2

stvli/dsh-ros2

Conjunto de ferramentas de depuração ROS2 e análise de visão do estado do robô para DeepSeek Harness: enumeração de node/topic/service/action/interface/TF, JSON de topologia do grafo inteiro, verificações rosdep, builds com gate de aprovação e scaffolding de mensagens customizadas, capturas de tela da GUI e observação de visão multimodal, além de renderização offscreen RViz2 headless (malhas low-poly, leitura direta de pixel, passthrough GPU - renderização de movimento a 30Hz) com análise VLM paralela em tempo real.

22anteontemFerramentas e funçõesMIT
F

dsh-vision-proxy

flyvhidbwo/dsh-vision-proxy

Cérebro DeepSeek + transcrição automática de imagens: anexe imagens na GUI e cada uma é transcrita pelo deepseek-v4-flash-vision-exp oficial por padrão (um cérebro V4-Pro puramente textual pode ver imagens), com qualquer VLM compatível com OpenAI ou Ollama local como alternativas.

15mês passadoVisão, voz e multimodalMIT
D

dsh-video-lens

dundunhan/dsh-video-lens

Dá aos agentes DeepSeek Harness apenas de texto compreensão de vídeo: amostragem de quadros consciente da cena + VLM + transcrição ASR opcional fundidos em evidência da linha do tempo. / Plugin de compreensão de vídeo para modelos apenas de texto (amostragem de quadros consciente da cena + VLM + transcrição de voz opcional).

13mês passadoVisão, voz e multimodalMIT
I

dsh-video-understand

ilps2/dsh-video-understand

Ferramenta de compreensão de vídeo de baixo custo: uma ferramenta video_understand transforma um link do Bilibili / BV / vídeo local em uma camada de informação AVIS (ASR + estrutura de cena + rastreamento de objetos + rótulos YOLO) e retorna resumo + Q&A. Roteamento dinâmico entre camadas orientado por perguntas (L0 ASR / L1 rastreamento de objetos / L2 VLM de keyframe), reutilização da camada semântica para perguntas repetidas, teto de orçamento por pergunta. Motor Python: a camada principal precisa de faster-whisper / opencv / yt-dlp (~200-300MB); a camada semântica opcional adiciona ~2GB de torch / transformers / ultralytics. Um doctor --fix incluído configura o venv e instala ambos.

8mês passadoFerramentas e funções
5

dsh-vision

54xkeee/dsh-vision

Visão para o DeepSeek somente-texto via Doubao Web por padrão (sem custo, sem chave de API — controla seu Chrome logado por meio de uma ponte CDP do Windows), com cota do Antigravity IDE (flash/pro) ou fallback para o Gemini; escalonamento automático de detalhe, memória de evidências visuais com reidratação após compactação, cache por hash de conteúdo e um painel de cliente bilíngue.

7há 2 mesesVisão, voz e multimodalMIT
S

dsh-vision-bridge

sfyyy/dsh-vision-bridge

Visão sob demanda para sessões DSH somente texto: imagens se tornam marcadores, e uma ferramenta vision_describe envia apenas a imagem e a pergunta para um modelo de visão compatível com OpenAI

5há 2 mesesVisão, voz e multimodalMIT
H

dsh-her-eyes

huashenglian/dsh-her-eyes

Um plugin dsh que permite à IA invocar automaticamente VLMs (modelos multimodais) para análise visual.

4há 2 mesesVisão, voz e multimodalMIT
H

dsh-omni-workstation

huashenglian/dsh-omni-workstation

Estação de trabalho omni-modal para o DSH: analyze_image sobre uma cadeia ordenada de vários cartões VLM com comutação de recurso, um conjunto de seis ferramentas de visão (zoom, amostragem de cor, diff de píxeis, OCR, deteção de elementos, apresentação inline) que partilham o mesmo resolvedor de imagens, generate_image sobre protocolos OpenAI/DashScope/ComfyUI, generate_video assíncrono com vários cartões e um construtor /build-video-tool, e TTS speak/clone_voice sobre sete fornecedores, tudo controlado por uma única página de definições com gravação automática.

3há 14 diasVisão, voz e multimodalMIT
5

dsh-youreyes

54xkeee/dsh-youreyes

Kit de visão para DeepSeek apenas texto: ferramenta `vision` invocável pelo modelo, adaptadores wrapper para deepseek/opencode-go (v4 flash/pro), cota do Antigravity IDE (default, flash/pro) / qualquer VLM compatível com OpenAI / Gemini / canais locais do Ollama, memória de evidências com reidratação por compactação, cache de hash de conteúdo e um painel de cliente bilíngue.

2há 2 mesesVisão, voz e multimodalMIT
W

dsh-file-attachment

wszhoho/dsh-file-attachment

Drag-and-drop / paste / upload files and images; on non-multimodal models images are auto-described by a configured VLM.

1há 3 diasMelhorias de UIMIT
X

dsh-image-vision

xsoc1/dsh-image-vision

Ponte de anexos de imagem no chat com uma ferramenta view_image para qualquer VLM compatível com OpenAI (Ollama local ou nuvem): imagens coladas/arrastadas se tornam marcadores de caminho view_image antes de chegarem aos modelos DeepSeek somente texto.

1há 2 mesesVisão, voz e multimodal
G

dsh-tool-vision

gloryxpnv/dsh-tool-vision

Visão estruturada local-first para agentes somente texto: as imagens vão a um VLM local compatível com OpenAI e voltam como evidência JSON (resumo, OCR literal, regiões de layout, entidades/relações, cores, incerteza explícita), com fallback anti-alucinação e ponte opcional de colar/enviar; custo zero em nuvem, as imagens nunca saem da máquina.

1há 2 mesesVisão, voz e multimodalMIT
F

dsh-sight

fu3rte/dsh-sight

Visão plugável para modelos do DeepSeek Harness (dsh) somente de texto: uma ferramenta `vision` com presets embutidos de VLM baratos/gratuitos, análise em lote de múltiplas imagens, admissão de imagens por colagem e uma página de configurações web com hot-reload

1há 2 mesesVisão, voz e multimodalMIT
R

dsh-llm-mlx

robbywang25/dsh-llm-mlx

Use local MLX-LM or MLX-VLM models in DeepSeek Harness through a loopback OpenAI-compatible provider, with optional DSH-owned server startup.

0há 27 diasModelos e provedoresMIT
L

dsh-mingmu

lab-sku/dsh-mingmu

明眸 VisionBridge - Ponte visual própria: quando um modelo cego recebe imagens, chama automaticamente um modelo visual para reconhecê-las e devolve o texto reconhecido ao modelo principal; transparente, configurável e sem perdas ao atualizar.

0há 2 mesesVisão, voz e multimodalMIT