00:47elvis@omarsar0Meta推出的Harness-of-Harness系统在GameCraft-Bench、FrontierSWE和ProgramBench三个基准测试中,与三种不同的harness和模型配对相比,经过三次迭代后平均提升52.25%,最高达82.86%。该系统通过将执行组织为规划、编码和测试的重复增量,平衡修复与能力增长,将工作范围限定为可验证的小步骤。系统保持实现时测试与独立评估分离,约束输出而非工作流程。AI产品Harness-of-HarnessMeta编程助手推荐理由:Meta新出的Harness-of-Harness能让编程代理连续工作数天,比独立系统平均提升52%,最高82%原文稍后读已读值得跟进有用关注 Harness-of-Harness
10:49官方一手arXiv: DeepSeek@Haoyang Yan, Min-le Su, Hangfan Zhang, Zhanhao Li, Chen Zhang, Shao Zhang, Yang Chen, Lei Bai, Shuyue Hu精选73°Harness-of-Harness(HoH)框架使基于LLM的编码代理能够在自主开发过程中持续改进软件。该框架在GameCraft-Bench、FrontierSWE和ProgramBench三个基准测试中,使用Codex与GPT-5.5、OpenCode与DeepSeek-V4-Pro、Pi与MiniMax-M3三对模型组合,平均相对提升52.25%,最高提升82.86%。在70多次迭代的多日部署中,HoH自主开发了一款具有连贯故事线、完整核心机制、可玩体验、精美视觉效果和集成音频的第一人称射击游戏。AI模型Harness-of-HarnessGPT-5.5DeepSeek-V4-Pro推荐理由:HoH框架让AI编码代理能持续改进软件,在三个基准测试中平均提升52%,还能自主开发完整游戏。原文稍后读已读值得跟进有用关注 Harness-of-Harness