论文Agent 与开发者76°06:09Google DeepMind 提出 XYEval:测试智能体是否会盲从用户的错误建议Google DeepMind 这篇论文挺扎心的:你给智能体一句自信但错误的建议,它会照做还不吭声,三大主流模型最多掉分 46.7%。#XYEval#Google DeepMind#Claude#GPT 5.5DAIR.AI@dair_ai原文稍后读已读值得跟进有用关注 XYEval