主要来源ARC Prize
查看原文事件专题 ·单一信源
Grok 4.7 的 ARC-AGI 验证成绩公布:二代得分低于 Grok 4.6
ARC Prize 公布了 Grok 4.7 在 ARC-AGI 三代基准上的验证成绩:ARC-AGI-3 得分 1.8%(标准测试环境,花费 2.7k 美元),在 provider adapter 环境下为 10.0%。ARC-AGI-2 得分 61.4%,单任务成本 2.01 美元;ARC-AGI-1 得分 90.2%,单任务成本 0.64 美元。与 Grok 4.6 相比,Grok 4.7 在 ARC-AGI-1 上分数更高,但在 ARC-AGI-2 和 ARC-AGI-3 上反而更低。
当前结论
ARC Prize 晒出 Grok 4.7 的实测成绩,有意思的是它一代分数涨了,二三代替反而降了,可以看看这套数据对比
2 个信源68° AI 热度最后更新 2026/10/6 16:41:14
证据链
2 个信源相关来源 1lmarena.ai
查看原文冲突核查
现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。