Which Harness Runs DeepSeek V4 Best? dsh Benchmark Data
关于「哪个 harness 最适合跑 DeepSeek V4」的第三方新数据:Composio 五方成本/速度横评、KV cache 经济学,以及 Reddit 上关于 dsh 与对手的实测报告。
不存在唯一"最好的 DeepSeek V4 harness"——基于发布两周以来真正出现的第三方数据,诚实的答案是:这取决于你在优化什么。目前最清晰的一份数据来自 Composio 的五方 harness 横评:Pi Agent 解题最多,DeepSeek Harness(dsh)在单次成功任务成本上最优,而 Claude Code 在原始速度上最快。没有哪一个 deepseek coding harness 能在所有维度上通吃。
本文是 Best Harness for DeepSeek V4 的"数据更新篇"——那一篇在还没有任何正面实测数据之前,先给出了选型框架(dsh 原生集成 vs. 把某个 provider 无关的 harness 指向 DeepSeek 的 OpenAI 兼容端点)。两周过去,已经有第三方真的把这个对比跑了一遍。本文汇总这些结果,并注明来源,同时更新决策矩阵。我们没有自己跑 benchmark——以下全部数据均标注出处。
Composio 五方横评
目前最扎实的一份数据来自 Composio 的横评推文,发布于 2026 年 8 月 19 日(发帖时浏览量 78,670,收藏 267)。Composio 用同一个模型——DeepSeek V4 Pro 0813——跑了五个不同的 harness,做同一批 30 个高难度 Agent 任务:Claude Code、DeepSeek Harness 0.1、Hermes、Pi Agent、OpenCode。
Composio 公开的数字:
| Harness | 结果 | 指标 |
|---|---|---|
| Pi Agent | 五者中解题数最多 | 任务完成数(推文未公布具体数字) |
| DeepSeek Harness 0.1 | 每成功任务 $0.028 | 五者中成本最低 |
| Claude Code | 每成功任务 $0.074 | 约为 dsh 的 2.6 倍 |
| Claude Code | 中位完成时间 181.8 秒 | 最快 |
| DeepSeek Harness 0.1 | 中位完成时间 252.1 秒 | 第二快 |
| Hermes、OpenCode | — | 公开推文未单独列出 |
这些数字取自 Composio 的公开测试;具体条件、任务选择与完整方法论详见原推文,我们没有独立复现过。请这样看待它——目前能拿到的最好的头对头数据,而非经我们验证过的 benchmark。不过它确实印证了下文社区反馈里反复出现的一个规律:dsh 相对于其他对手的优势不在解题能力,而在成本效率。
"轻量 vs 臃肿"的分野
第二个反复出现、但没有量化数据支撑的主题,来自本地模型/自部署圈子:harness 的"体量"——具体说,系统提示词在真正开始干活之前要消耗多少 token——比很多人想象的更重要。
在一条被广泛讨论的 r/LocalLLaMA 帖子里,楼主追问为什么 dsh"感觉"效率更高,最高票评论指出主流 harness(OpenCode、Claude Code、Codex)往往自带体量庞大、功能堆砌的系统提示词,这对本地跑模型、没有多余 token 预算的场景是实打实的成本;同一帖子里 dsh 和 Pi 被反复点名是更轻量的选项。一位评论者引用外部分析称 Hermes——一个独立于 harness 之外的 Agent 编排层——注入了约 19,000–20,000 token 的系统提示词;这一数字是社区转述,我们没有直接核实过 Hermes 的源码。这条帖子里反复出现的共识是:上下文越精简,本地 prefill 就越快——这正是用 llama.cpp 等本地方案而非托管 API 的用户所面对的实际瓶颈。
本地模型场景实证:正反两面数据
Reddit 上也出现了最接近"真实长跑本地使用数据"的内容,而且结论是两面的。
正面案例出自同一条 r/LocalLLaMA 帖子:一位用户描述用 dsh 接本地 llama.cpp(Q4_K_M 量化)连续跑了 16 小时、2000 万以上 token,整个过程完成了所有任务、没有失败——这是一个真实的本地部署稳定性数据点,但仅来自该单一 Reddit 账号,并非独立测试。
反面案例出自 dsh 发布首周的另一条 r/LocalLLaMA 帖子:一位用户反馈在 WSL 环境下不稳定,转投第三方 harness reasonix 作为替代方案——另一条回复也提到了对 Claude Code 在 WSL 下表现的类似抱怨。两份报告都不是受控测试,都只是单一用户的自述。我们把两者都列出来,是因为基于目前已经披露的信息,真实情况是喜忧参半,而非一边倒的正面。
dsh 为什么便宜:KV cache 命中率
Composio 数据里的成本差距,与另一个反复出现的社区观察相互印证:DeepSeek API 层的 prompt 缓存机制,在 Agent 场景下会产生异常高的缓存命中率——因为大段上下文会在多轮之间重复。r/DeepSeek 的一条帖子和另一条 r/DeepSeek 帖子都报告真实会话中的缓存命中率在 97%–99% 区间,与 DeepSeek 官方的 KV cache 文档 相符。这是 DeepSeek API 层面的特性,并非 dsh 独有的实现——但由于 dsh 就是 DeepSeek 自家的 harness,它天然处于能利用这一缓存机制的位置,且无需任何额外配置。缓存机制的具体原理——prefill、前缀匹配、工具输出是否计入命中——我们在另一篇深度文章里展开:DeepSeek Harness KV Cache 详解。
如果你自己的工作流也需要追踪成本,社区插件生态已经有现成工具——例如 dsh-token-anxiety,一个展示单任务花费和峰谷电价时段的插件:
dsh plugin --profile web add github:mov-eax-eax/dsh-token-anxiety
更多成本与用量相关工具见 用量与计费 分类,或浏览 FindHarness 的完整插件索引——截至 2026 年 8 月 21 日,dsh 主仓库已有 178,538 star。
决策矩阵:按你在优化什么来选
以上数据没有指向一个通吃全场的赢家。基于目前已公开的信息:
| 如果你要的是... | 选 | 为什么 |
|---|---|---|
| 最高的原始解题率 | Pi Agent | Composio 测试的 30 个任务中解题数最多 |
| 单次成功任务最低成本 | dsh | 同一测试中 $0.028 vs Claude Code 的 $0.074;DeepSeek 的缓存经济学也有帮助 |
| 最快的墙钟完成时间 | Claude Code | Composio 测试中中位 181.8 秒 vs dsh 的 252.1 秒 |
| 完全本地/自部署运行 | dsh 或 Pi | 在本地模型讨论帖里两者被反复点名是轻量提示词选项 |
| DeepSeek 专属、最深的插件/生态 | dsh | 它的插件目录(见 /zh/plugins)是专为这个模型家族打造的,本次对比里其他 harness 都没有对等物 |
| 想保留既有的 Claude Code 工作流 | Claude Code,或让 dsh 委派给它 | dsh 可以原生把任务委派给 Claude Code 作为子代理,而不是要求你二选一——见 DeepSeek Harness vs. Claude Code |
如实读这张表:dsh 并非在每个维度上都是最好的 deepseek v4 harness,本文也没有这么主张。如果你的优先级是解题最多或跑得最快,上面的数字指向的是别处。dsh 真正站得住脚的地方是成本效率与针对这个模型家族的插件深度——这正是"官方自家出品"该有的样子,也正是上一篇选型框架文章在任何 benchmark 出现之前就已经预判的方向。
关于所有 benchmark 数字的一个必要提醒
上文所有数字都来自单一公开来源,跑一次,固定任务集,特定的提示词与工具配置。这一点对 DeepSeek V4 尤其重要:本月另一份 benchmark 分析发现 DeepSeek V4 Pro 的 Agent 行为对起始提示词与工具 schema 的具体形态异常敏感——这也是同一个模型在 Terminal-Bench 上能从 50 多分打到 80 多分(取决于由哪个 harness 跑)的部分原因。我们在 DeepSeek Harness Benchmark 分数为何各不相同 里展开了这个落差——以及为什么它不是任何一方在作弊的证据。请把 Composio 的数字,以及本文的其他内容,都当作方向性参考,而非定论。
FAQ
现在最适合跑 DeepSeek V4 的 harness 是哪个?
没有一个放之四海而皆准的答案。基于目前唯一一份公开的头对头测试(Composio,30 个任务),Pi Agent 解题最多,dsh 单次成功任务成本最低,Claude Code 最快。按这三个维度里哪个对你最重要来选。
dsh 是最好的 DeepSeek harness吗,还是只是成本效率高?
公开数据具体展示的是成本优势(相对 Claude Code,每成功任务 $0.028 vs $0.074),而不是解题率或速度优势。dsh 同时拥有 DeepSeek 官方最深的第一方插件生态,这是 benchmark 数字之外选择它的另一个理由。
为什么同一个 DeepSeek V4 harness benchmark 到处分数不一样?
因为 DeepSeek V4 Pro 的 Agent 行为看起来对具体的系统提示词与工具 schema 很敏感——不是因为任何一方在虚报结果。完整解释见 DeepSeek Harness Benchmark 分数为何各不相同。
更精简的系统提示词真的有可衡量的差别吗?
社区反馈一致认为更轻量的系统提示词(dsh、Pi)在本地模型场景下表现更好,相比更重的选项(OpenCode、Claude Code、Hermes)——主要原因是 prefill 成本——但这些结论来自 Reddit 讨论和个案使用体验,不是受控 benchmark,请当作方向性参考。
我能同时用 dsh 和 Claude Code,而不是二选一吗?
可以——dsh 能把任务委派给 Claude Code 作为子代理,而不要求你排他性地二选一。具体机制见 DeepSeek Harness vs. Claude Code。
下一步
如果你还没选定 harness,先看 Best Harness for DeepSeek V4 的选型框架,然后再读 DeepSeek Harness Benchmark 分数为何各不相同,避免过度信任单一数字。如果成本是你最关心的因素,DeepSeek Harness KV Cache 详解 讲清楚了 dsh 价格优势背后的机制,用量与计费插件 汇总了社区里自己追踪成本的工具。想看发布两周以来的整体变化回顾,见 DeepSeek Harness:两周回顾。