跳过主要内容

插件

浏览、筛选并安装 DeepSeek-Harness 插件。

共 15 个插件

F

dsh-vision-proxy

flyvhidbwo/dsh-vision-proxy

DeepSeek 大脑 + 自动识图:GUI 附加的每张图片自动经官方 deepseek-v4-flash-vision-exp 原生识图转译,再交给纯文本的 DeepSeek 作答(纯文本 V4-Pro 也能看图);支持任意 OpenAI 兼容 VLM 与本地 Ollama 作为备选。

14上个月视觉、语音与多模态MIT
D

dsh-video-lens

dundunhan/dsh-video-lens

为纯文本 DeepSeek Harness Agent 提供视频理解:场景感知抽帧、VLM 与可选 ASR 转录融合为时间线证据。

13上个月视觉、语音与多模态MIT
I

dsh-video-understand

ilps2/dsh-video-understand

低成本视频理解工具:video_understand 把 B站链接/BV号/本地视频转成 AVIS 信息层(ASR+场景结构+对象轨迹+YOLO 标签)并输出摘要+问答。问题驱动动态路由分层(L0 ASR / L1 对象轨迹 / L2 关键帧 VLM)、语义层复用(重复提问直接查层)、单次问题预算上限。Python 引擎:核心层需 faster-whisper / opencv / yt-dlp(约 200-300MB);可选语义层另需约 2GB 的 torch / transformers / ultralytics。内置 doctor --fix 一键建 venv 并装齐两者。

8上个月工具与能力
5

dsh-vision

54xkeee/dsh-vision

纯文本 DeepSeek 的识图插件:默认走豆包 Web(零成本、免 API key,经 Windows CDP 桥接驱动已登录 Chrome),另有反重力额度(flash/pro)与 Gemini 降级通道;档位自动升级、视觉证据记忆与会话压缩恢复、内容哈希缓存、双语客户端面板。

7上个月视觉、语音与多模态MIT
S

dsh-vision-bridge

sfyyy/dsh-vision-bridge

为纯文本 DSH 会话按需提供视觉能力:图片变为标记,vision_describe 工具只把图片和问题发给 OpenAI 兼容的视觉模型。

5上个月视觉、语音与多模态MIT
H

dsh-her-eyes

huashenglian/dsh-her-eyes

一个可以让ai自动调用VLM(多模态模型)进行视觉分析的dsh插件。A dsh plugin that allows AI to automatically invoke VLMs (multimodal models) for visual analysis.

42个月前视觉、语音与多模态MIT
H

dsh-omni-workstation

huashenglian/dsh-omni-workstation

面向 DSH 的全模态工作站:analyze_image 走有序多卡片 VLM 故障转移链;六个视觉工具箱工具(局部放大、色调采样、像素比对、OCR、元素检测、内联展示)共用同一套图片来源解析;generate_image 支持 OpenAI/DashScope/ComfyUI 协议;多卡片异步 generate_video 配 /build-video-tool 构建器;speak/clone_voice 语音合成覆盖七家供应商;全部由一个自动保存的设置页驱动。

311天前视觉、语音与多模态MIT
5

dsh-youreyes

54xkeee/dsh-youreyes

纯文本 DeepSeek 的识图工具包:模型可主动调用的 `vision` 工具、deepseek/opencode-go 包装适配器(v4 flash/pro)、反重力额度(默认,flash/pro)/ 任意 OpenAI 兼容 VLM / Gemini / 本地 Ollama 通道、证据记忆与会话压缩恢复、内容哈希缓存、双语客户端面板。

2上个月视觉、语音与多模态MIT
W

dsh-file-attachment

wszhoho/dsh-file-attachment

拖拽/粘贴/上传文件和图片,非多模态模型下图片自动调用已配置 VLM 识别。

115小时前UI 增强MIT
X

dsh-image-vision

xsoc1/dsh-image-vision

纯文本 DeepSeek 的聊天识图插件:view_image 工具转发任意 OpenAI 兼容 VLM(本地 Ollama 或云端),对话框粘贴/拖拽的图片自动改写为 view_image 路径标记供模型查看。

12个月前视觉、语音与多模态
G

dsh-tool-vision

gloryxpnv/dsh-tool-vision

本地优先的结构化视觉插件:图片交给本地 OpenAI 兼容 VLM,返回 JSON 证据(摘要、逐字 OCR、版面区域、实体/关系、配色、显式不确定项),带反幻觉回退与可选粘贴/上传桥;零云端成本,图片不出本机。

12个月前视觉、语音与多模态MIT
F

dsh-sight

fu3rte/dsh-sight

为纯文本 DeepSeek Harness 模型补上视觉:vision 工具内置免费 VLM 预设,支持多图批量分析、粘贴图片与热重载设置页。

12个月前视觉、语音与多模态MIT
R

dsh-llm-mlx

robbywang25/dsh-llm-mlx

通过回环 OpenAI-compatible 提供方在 DeepSeek Harness 中使用本机 MLX-LM 或 MLX-VLM 模型,并可选由 DSH 托管模型服务进程。

024天前模型与账号接入MIT
S

dsh-ros2

stvli/dsh-ros2

面向 DeepSeek Harness 的 ROS2 调试工具集与机器人状态视觉分析:节点/话题/服务/动作/接口/TF 枚举、全图拓扑 JSON、依赖检查,审批门控的构建与自定义消息骨架生成,GUI 截图与多模态视觉观察,以及无头 RViz2 离屏渲染(低模 + 直读像素 + GPU 直通,动作渲染 30Hz)与并行 VLM 实时分析。

0工具与能力可能已停更
L

dsh-mingmu

lab-sku/dsh-mingmu

明眸 VisionBridge:纯文本模型收到图片时自动调用视觉模型识别,把文字喂回主模型,全程无感、可配置。

0上个月视觉、语音与多模态MIT