事件专题 ·多源确认

Epoch发布自动化评估报告

EpochAIResearch推出自动化评估报告,测试前沿模型在开放性任务上的表现。Claude Fable 5.1和GPT-6 Astra表现领先,但仍远未完全自动化Epoch的工作。评估任务基于Epoch自身的研究工作设计,具有现实性和开放性。

当前结论

Epoch用AI评估自己的工作,Claude和GPT-6表现最好但还不够

11 个信源58° AI 热度最后更新 2026/10/8 17:36:46

证据链

11 个信源
相关来源 2Artificial Analysis
查看原文

冲突核查

现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。