7月28日
06:11
06:11lmarena.ai@lmarena_ai
精选
GPT-5.6 的 Sol、Terra、Luna 三个变体在 Agent Arena 中以 xHigh 设置进行测试。Sol 以 +10.1% 的净改进位列排行榜第二。Terra (+4.0%) 和 Luna (+3.3%) 也取得正向提升,与 Claude Opus 4.8 (+3.5%) 的水平相当。

推荐理由:GPT-5.6 的 Sol 版在 Agent Arena 上表现亮眼,比 Terra 和 Luna 都强,直接对标 Claude Opus 4.8。想了解新模型实力的话可以看看。
02:52
7月25日
7月22日
06:43
06:43lmarena.ai@lmarena_ai
Chatbot Arena 推出了 Agent Arena 和 Frontend Code Arena 两个新排行榜。Agent Arena 评估 AI 智能体在真实世界任务中的表现,Frontend Code Arena 专门评测模型的前端代码生成能力。排行榜数据来自用户对战投票,结果实时更新在 arena.ai 上。
推荐理由:想看看哪个 AI 智能体干活最靠谱、哪个写前端代码最好?这两个新排行榜给你真实用户投票结果,直接去 arena.ai 查。
7月21日
04:23
01:43
01:43lmarena.ai@lmarena_ai
Agent Arena团队发布一篇博客,详细说明了其评估平台中使用的因果追踪方法论。该方法论旨在分析智能体在竞技场中的行为决策原因,提升可解释性。博客提供了技术实现与案例应用的具体说明。
推荐理由:Agent Arena团队发了新博客,讲因果追踪如何帮你搞懂智能体行为,适合做Agent评估和可解释性研究的同学。
01:31
7月16日
04:27
04:27lmarena.ai@lmarena_ai
精选
Thinking Machines 发布 Inkling,支持文本、图像和音频三种模态。Inkling 已加入 Agent Arena,该基准使用数百万全球用户的长时任务评估智能体,任务涉及网络搜索、文件系统和终端操作。Inkling 也参与文本、视觉和代码竞技场。Inkling 完整权重开放,可在 Tinker 平台进行微调。
事件专题

推荐理由:Thinking Machines 出了个新模型 Inkling,能同时处理文字、图片和音频,还在 Agent Arena 上测了长期任务能力。现在能免费下载权重自己微调,可以试试。
7月14日
02:33
02:33lmarena.ai@lmarena_ai
精选
SpaceXAI 发布 Grok-4.5,它是专为编程和智能体训练的首个模型。在 Agent Arena 排行榜上,Grok-4.5 从 Grok 4.3 的第29名升至第13名,基于9.8K个实时智能体会话评估。它在 Bash Recovery 任务上大幅提升,接近 Anthropic 和 OpenAI 模型,确认任务成功率显著提高。
事件专题

推荐理由:Grok-4.5 是 SpaceXAI 的首个编程+智能体专用模型,在 Agent Arena 上从29名跳到13名,Bash Recovery 追平了Claude和GPT,实测任务成功率很高。
02:30
02:30lmarena.ai@lmarena_ai
Grok-4.5在Agent Arena基准测试中总体排名第13,较此前提升5.0%。其幻觉指标排名第4,提升1.3%;确认任务成功排名第6,提升6.9%。Bash恢复排名第9,提升9.7%;表扬与投诉比例排名第12,提升6.1%。可操控性排名第15,提升0.9%。

推荐理由:xAI的Grok-4.5在Agent Arena进步明显,幻觉控制做到第4,任务成功提升近7%,适合关注智能体性能的朋友。
7月10日
7月7日
23:07