论文Agent 与开发者多源确认13:59AgentHop 基准发布:1,011 道题拆解智能体失败原因一个把智能体准确率拆开看的新基准,能看出各家模型是乱搜还是不敢搜,做 agent 评估的可以拿去用。#AgentHop#Claude#Gemini-3 Pro#智能体10 个信源在谈事件专题aarXiv: DeepSeek@Chanhee Park 等 5 人11 个信源在谈原文稍后读已读值得跟进有用关注 AgentHop