事件专题 ·单一信源

Grok 4.7 发布,上线 Agent Arena 接受真实智能体任务评测

Grok 4.7 已发布并进入 Agent Arena 排行榜,用户可以用自己最难的 prompt 投票,得分随投票陆续公布。Agent Arena 基于来自全球用户的数百万条真实长程智能体任务评测模型,允许模型调用网页搜索、文件系统和终端工具完成复杂工作流。排行榜用 causal tracing 方法衡量模型结果相对平均模型的表现,官方还根据历代 Grok 在 net improvement score 上的走势发起投票猜 4.7 的落点。除 Agent Arena 外,Grok 4.7 已进入 Text、Vision、Code、Document 四个 Battle Mode 类别。

当前结论

Grok 4.7 上 Agent Arena 了,拿真实智能体任务投票打分,想看排名可以去投一票。

2 个信源75° AI 热度最后更新 2026/9/21 17:01:32

证据链

2 个信源

冲突核查

现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。