事件专题 ·单一信源

HarnessDev基准评测LLM创建Agent Harness能力

ByteDance Seed团队发布HarnessDev基准,评测LLM能否自行创建和演化Agent执行基础设施。该基准包含Creation和Evolution两个阶段,涉及Opus 4.8、GPT-5.5等6个模型在4领域5基准的表现。结果显示代码领域落后人类参考10.7分,状态记忆几乎全是死代码,且成本与效果不相关,同等分数token消耗可差7-19倍。

当前结论

ByteDance团队推出HarnessDev基准,首次评测LLM能否自己创建Agent执行框架,发现模型间harness迁移性极差。

2 个信源73° AI 热度最后更新 2026/9/4 00:41:43

证据链

2 个信源

冲突核查

现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。