7月14日
02:33
02:33lmarena.ai@lmarena_ai
精选
SpaceXAI 发布 Grok-4.5,它是专为编程和智能体训练的首个模型。在 Agent Arena 排行榜上,Grok-4.5 从 Grok 4.3 的第29名升至第13名,基于9.8K个实时智能体会话评估。它在 Bash Recovery 任务上大幅提升,接近 Anthropic 和 OpenAI 模型,确认任务成功率显著提高。
事件专题

推荐理由:Grok-4.5 是 SpaceXAI 的首个编程+智能体专用模型,在 Agent Arena 上从29名跳到13名,Bash Recovery 追平了Claude和GPT,实测任务成功率很高。
02:30
02:30lmarena.ai@lmarena_ai
Grok-4.5在Agent Arena基准测试中总体排名第13,较此前提升5.0%。其幻觉指标排名第4,提升1.3%;确认任务成功排名第6,提升6.9%。Bash恢复排名第9,提升9.7%;表扬与投诉比例排名第12,提升6.1%。可操控性排名第15,提升0.9%。

推荐理由:xAI的Grok-4.5在Agent Arena进步明显,幻觉控制做到第4,任务成功提升近7%,适合关注智能体性能的朋友。