9月3日
01:37
01:37lmarena.ai@lmarena_ai
73°
Anthropic的Fable 5.1 (Max)在Code Arena: WebDev基准测试中以1765分排名第一,领先第二名Qwen3.8-Max-0902达77分。相比前代Fable 5 (Max)排名第八,新版本提升了137分。Fable 5.1 (Max)每百万代币成本为40美元,在高价区间重新定义了性能边界。
事件专题

推荐理由:Anthropic新发布的Fable 5.1 Max在代码基准测试中大幅领先,比第二名高出77分,刷新了高价模型性能标准。
9月2日
8月26日
23:36
8月25日
00:37
8月21日
08:32
08:32lmarena.ai@lmarena_ai
智谱AI发布的GLM-5.3 (Max)模型在Code Arena: WebDev基准测试中获得1597分。该模型在开源模型中排名第二,整体排名第八。其定价为3.65美元/百万token,性能优于Gemini-3.7-flash-high和Deepseek-v4-flash-high。
事件专题

推荐理由:智谱AI刚发布了GLM-5.3 (Max),在Web开发代码基准上拿了个高分,而且价格比Gemini和DeepSeek的类似模型还便宜。
8月13日
00:27
00:27lmarena.ai@lmarena_ai
79°
xAI 推出 Grok 4.6,在 LMArena 的 WebDev 基准上以 1618 分排名第7。相较 Grok 4.5 的 1553 分(第13名)提升明显,且定价保持不变。目前 Grok 4.6 与 GPT-5.6 Sol xHigh(1622 分)和 Claude Fable 5(1627 分)仅差 4 到 9 分,三者同处第5至第7区间。
推荐理由:xAI 把 Grok 4.6 放出来了,网页开发能力直接冲到 LMArena 第7,跟 GPT-5.6 和 Claude 最新版就几分之差,这代提升挺猛。
8月11日
09:29