论文Agent 与开发者多源确认精选73°05:57Agent基准测试需评估评分者而非仅任务Zapier的AutomationBench基准测试被多家前沿实验室引用,但评分者存在严重缺陷,修复后评分差异达27.9%。#AutomationBench#Kimi K3#Agent#基准测试4 个信源在谈事件专题rohanpaul_ai@rohanpaul_ai5 个信源在谈原文稍后读已读值得跟进有用关注 AutomationBench+1