主要来源rohanpaul_ai
查看原文事件专题 ·多源确认
Agent基准测试需评估评分者而非仅任务
Parsewave审查了Zapier的AutomationBench中全部600个公开任务,发现206个评分者存在缺陷。研究人员使用智能体生成看似正确但实际错误的答案,验证评分者准确性。修复后的评分者在1,235次Kimi K3测试中,27.9%的情况下给出不同评分结果。任务813案例显示,原评分者仅检查Salesforce笔记而忽略DocuSign模板,错误通过13项检查。
当前结论
Zapier的AutomationBench基准测试被多家前沿实验室引用,但评分者存在严重缺陷,修复后评分差异达27.9%。
5 个信源73° AI 热度最后更新 2026/10/6 21:55:21
证据链
5 个信源冲突核查
现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。