事件专题 ·多源确认

Artificial Analysis 推出 Terminal-Bench-Science 0.1 智能体科研基准榜单

Artificial Analysis 上线 Terminal-Bench-Science 0.1 排行榜,该基准由 Stanford 的 Steven Dillmann 与 Terminal-Bench 团队等合作构建,包含 70 个专家整理的真实科研任务。任务覆盖生命科学、物理科学、数学科学、工程科学和地球科学五个领域,智能体在沙盒环境中独立完成并按 pass@1 评分。GPT-6 Astra (max) 以 63% 排名第一,Claude Opus 5.5 (xhigh) 以 62% 紧随其后,是仅有的两个超过 50% 的模型。Claude Opus 5.5 (xhigh) 在数学科学任务上通过率 71%,但生命科学只有 46%。开源权重模型差距明显:GLM-5.3 (max) 得分 10%,DeepSeek V4.1 Flash (max) 得分 9%,落后头部模型超过 50 分。

当前结论

Stanford 联合 Terminal-Bench 团队搞了个科研智能体榜单,70 个真实科研任务里 GPT-6 Astra 拿 63% 排第一,开源模型才 10%,差距很直观。

11 个信源73° AI 热度最后更新 2026/9/24 23:30:55

证据链

11 个信源
主要来源Artificial Analysis
查看原文
相关来源 4Simon Willison’s Weblog
查看原文

冲突核查

现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。