9月3日
07:03
00:33
00:33lmarena.ai@lmarena_ai
78°
Gemini 3.8 Flash (High)在Agent Arena排名第14,较3.7版本提升5.94个百分点。在Text Arena中位列第7,超越Claude Opus 5 (High)的1492分。该模型在写作、多轮对话和长查询等类别中排名显著提升。
事件专题

推荐理由:GoogleDeepMind发布Gemini 3.8 Flash (High),在多个基准测试中超越前代版本和Claude Opus 5。
9月1日
08:15
00:10
8月28日
22:11
22:11lmarena.ai@lmarena_ai
精选
Agent Arena使用因果追踪技术评估模型在现实世界长期任务上的表现。该基准测试显示模型相对于平均模型的净改进程度。用户可访问arena.ai/leaderboard查看整体排行榜,并按代码、聊天和工作类别进行筛选。
推荐理由:Agent Arena上线新基准,用因果追踪测模型在长期任务中的真实表现,还能按类别筛选对比。
8月27日
01:53
01:53lmarena.ai@lmarena_ai
78°
Agent Arena在数百万真实世界、长期目标型任务上对模型进行评估,Claude Opus 5在代码任务中排名第一。GitHub集成提升编码能力,支持深度仓库集成,让用户在浏览器中完成编码任务。

推荐理由:Agent Arena更新了模型评估功能,Claude Opus 5在代码任务中表现出色,GitHub集成让编码更便捷。
8月25日
05:06
8月21日
01:41
01:41lmarena.ai@lmarena_ai
精选
Meta 发布了 Muse Spark 1.2 (xHigh) 模型。该模型在 Agent Arena 基准测试中实现了 +2.1% 的净提升。相比前代 Muse Spark 1.1,其净提升分数从 0.9% 提升至 2.1%。在 Bash Recovery 任务上,性能从 +5.9% 提升到 +11.4%。

推荐理由:Meta 刚刚发布了 Muse Spark 1.2 (xHigh),在 Agent Arena 上的净提升分数从 0.9% 提升到了 2.1%,Bash Recovery 任务直接翻倍,比前代强了不少。
01:37
01:37lmarena.ai@lmarena_ai
Agent Arena 排行榜衡量模型在数百万个真实世界、长周期任务中的表现。模型可使用网络搜索、文件系统和终端工具完成复杂工作流。该榜单通过因果追踪方法,衡量模型相对于平均模型的结果表现。
推荐理由:看看 arena.ai 上新出的 Agent Arena 排行榜,它用真实任务测试模型,还能用工具,比普通测试更实用。
8月20日
07:36
07:36
07:36lmarena.ai@lmarena_ai
精选76°
DeepSeek - V4 - Pro (High) 以+6%净提升成为开放模型领域Agent Arena第2名;与DeepSeek - V4 - Flash (High) 相比,其性能更高且任务成本更低;在代码和工作类别排名第2,聊天类第5,多项指标表现突出。

推荐理由:DeepSeek发布的V4 - Pro (High),比前代版本强,成本还低,在开放模型里排第二,可以去试试。
03:31
03:31lmarena.ai@lmarena_ai
Agent Arena对比了15款模型任务成本,Kimi K3 (Max)每任务成本仅$0.62;Claude Opus 5 (Max)成本达$3.37,与同类存在明显差距;Kimi K3 (Max)排名第4,成本远低于多数同级别模型;Grok和Qwen以较低成本实现了不错表现。
事件专题

推荐理由:Agent Arena发布了各模型任务成本对比,能清楚看到不同模型花多少钱和效果,和同类比啥不一样。
8月19日
01:49
8月18日
07:17
07:17lmarena.ai@lmarena_ai
精选71°
Agent Arena 新增代码、工作、聊天三个分类榜单。代码榜第一是 OpenAI 的 GPT 5.6 Sol(xHigh)。工作榜和聊天榜第一均为 Anthropic 的 Claude Opus 5(High 和 Max)。该评测基于数百万真实长时程智能体任务,单次长会话成本可达数百至一千美元。
事件专题

推荐理由:想知道代码、工作、聊天分别谁最强?Agent Arena 新榜单给出答案:GPT 5.6 和 Claude Opus 5 各领风骚。
8月8日
04:00
8月4日
7月31日
7月30日