Agent 通过率提升 19%,模型参数未动
Agent 通过率 67%→86%,模型一个参数没动:丢的分大多在 Harness,不在模型 当 Agent 表现不佳时,我们习惯归因于模型能力不足,去换更大的模型。但 @adaption_ai 用...
Adaption AI 证明 Agent 表现差往往不是模型问题,而是 Harness 设计问题。优化 Harness 能大幅提升性能,还能降低成本。
Adaption AI 在 Harvey 法律 Agent 基准上实验发现,仅优化 Harness 就将 Qwen3.6-27B 通过率从 67.10% 提升至 85.92%。同一 Harness 在 GLM-5.2 上通过率从 88.39% 升至 90.64%。优化后的 Harness 使 Qwen 以少 54% 的输入 token 达到与 Prime Agent 相近成绩。
Agent 通过率 67%→86%,模型一个参数没动:丢的分大多在 Harness,不在模型 当 Agent 表现不佳时,我们习惯归因于模型能力不足,去换更大的模型。但 @adaption_ai 用...
Agent 通过率 67%→86%,模型一个参数没动:丢的分大多在 Harness,不在模型 当 Agent 表现不佳时,我们习惯归因于模型能力不足,去换更大的模型。但 @adaption_ai 用实验证明:包围模型的 Harness (工具设计、上下文管理、执行循环、交付校验) 往往才是丢分的真正原因。低分可能意味着能力缺口,也可能只是 Harness 设计失败,而两者的解法完全不同。 实验设计在 Harvey 法律 Agent 基准(LAB)上,每个任务提供合伙风格的指令和沙箱中的用例文档,按条目逐项评分。在 140 个留出任务(与训练集不重叠)上量化了 Harness 的影响,有这几点关键发现。 adaptionlabs.ai/blog/a-better-… 1. 仅改 Harness 就大幅提升成绩(不动模型权重) Qwen3.6-27B 通过率从 67.10% 提升到 85.92%,随后训练又推到 88.03%,接近前沿模型水平。团队对两种增益来源做了精确区分——“Harness 恢复的是基座模型已具备但被埋没的能力,而后训练增加的是模型原本不具备的能力。” 轨迹分析揭示了丢分根源:跑完却没有可用文件、工具调用格式错误导致死循环、读取大文件后指令丢失。 针对性改进包括:有界的文件读取、可操作的工具报错、上下文压缩时的状态保留、退出前校验交付物。其中因路径缺失导致的写入失败从 120 次降到 0。 2. 跨模型泛化 同一 Harness 用在 GLM-5.2 上从 88.39% 升至 90.64%;Gemini 3.6 Flash 和 Claude Opus 4.8 的小规模评测也有增益(但任务子集较窄,结果仅具方向性参考)。 3. Token 效率:更准且更省 与 Prime Agent 0.7.1 和 OpenCode 1.18.23 对比(固定模型): · Qwen:84.13%(8.06M tokens)vs. 84.92%(17.48M)vs. 75.40%(6.38M) · GLM:92.06% vs. 落后 3.96 分,且多耗 18% tokens vs. 落后 5.16 分 Qwen 场景下以少 54% 的输入 token 达到与 Prime Agent 相差不到 0.8 分的成绩。结论是 token 数量本身不解释性能——harness 决定了模型使用上下文的生产率。用优化后的小模型替代前沿模型,成本可降低 10 倍以上。 4. Harness 优化反哺后训练 执行失败被清除后,剩余错误才真实反映模型的能力边界。基于成功端到端轨迹做后训练,全条目通过的任务占比从 5.67% 升至 9.22%。 团队认为:“可靠的 Harness 能产出更干净的证据(模型到底还不会什么)和更好的学习轨迹。” 也就是说,先修 Harness,后训练的数据质量才可信。 Sudip Roy @sudip_r0y Agent performance is often attributed primarily to the underlying model. Our research suggests the harness recovers what a model can already do, but it can't create capability the model doesn't have. @dhruvrnaik and I saw this with Qwen3.6-27B on the @harvey Legal Agent Benchmark. Harness optimization alone moved pass rate from 67% to 85%. Adding post-training pushed it to 88%. 🔗 View Quoted Tweet 💬 1 🔄 0 ❤️ 0 👀 106 📊 1 ⚡