主要来源shao__meng
查看原文事件专题 ·单一信源
HarnessDev基准评测LLM创建Agent Harness能力
ByteDance Seed团队发布HarnessDev基准,评测LLM能否自行创建和演化Agent执行基础设施。该基准包含Creation和Evolution两个阶段,涉及Opus 4.8、GPT-5.5等6个模型在4领域5基准的表现。结果显示代码领域落后人类参考10.7分,状态记忆几乎全是死代码,且成本与效果不相关,同等分数token消耗可差7-19倍。
当前结论
ByteDance团队推出HarnessDev基准,首次评测LLM能否自己创建Agent执行框架,发现模型间harness迁移性极差。
2 个信源73° AI 热度最后更新 2026/9/4 00:41:43
证据链
2 个信源相关来源 1elvis
查看原文冲突核查
现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。