06:11lmarena.ai@lmarena_ai精选LMArena的Agent Leaderboard基于170万+次真实Agent Mode会话分析,新增按任务类型筛选功能,用户可按Code、Work、Chat三类对比模型性能。排行榜同时展示每个模型完成单次任务的实际成本,并标出各性能水平下最省钱的Pareto前沿选项。这一更新让模型选择不再只看分数,还能结合具体场景和花费做决策。AI产品Agent LeaderboardLMArena智能体推荐理由:选模型前先看看这个排行榜,现在能按写代码、干活、聊天分开比,还直接告诉你每单花多少钱,省得自己瞎试。原文稍后读已读值得跟进有用关注 Agent Leaderboard
02:58lmarena.ai@lmarena_ai精选Z.ai 的 GLM-5.3 即将上线 LMArena 评测平台。官方将对比 GLM-5.1 与 GLM-5.2 的表现。此前 GLM-5.2 在 Agent Arena 的 5 项信号上取得进展,包括任务成功率与用户夸奖/抱怨等隐式反馈。新版本将检验这些改进能否延续。AI模型GLM-5.3Z.aiLMArena10 个信源在谈事件专题推荐理由:GLM-5.3 要上 LMArena 了,这次直接和前两代同台对比,想蹲 Z.ai 迭代幅度的话可以盯一下。原文稍后读已读值得跟进有用关注 GLM-5.3
02:45lmarena.ai@lmarena_aiLMArena 官方发布了 Code Arena 的 WebDev 子榜与 Text Arena 的完整排行榜。两份榜单均托管在 arena.ai 的 leaderboard 页面下。该榜单基于用户对战投票,反映模型在网页开发与文本任务上的能力对比。具体模型排名可在对应页面查看。AI产品LMArenaCode ArenaText Arena推荐理由:LMArena 把 Code Arena(WebDev)和 Text Arena 的完整榜单放出来了,想看模型在网页开发和文本任务上的排名,直接点链接查。原文稍后读已读值得跟进有用关注 LMArena
02:23lmarena.ai@lmarena_ai81°Google DeepMind 发布 Gemini 3.7 Flash (High),已在 LMArena 的 Code Arena: WebDev 和 Text Arena 上线。该模型在 WebDev 排名从第 19 位升至第 8 位,明显优于上一代 Gemini 3.6 Flash (High)。它在数据与分析类别排名第 7,在模拟、游戏与内容创作工具类别排名第 8,在参考设计类别排名第 9。AI模型Gemini 3.7 FlashGoogle DeepMindLMArena推荐理由:谷歌 DeepMind 的新 Flash 模型在 WebDev 榜冲到第8,比上代进步不小,做网页或数据任务可以试试。原文稍后读已读值得跟进有用关注 Gemini 3.7 Flash
18:05lmarena.ai@lmarena_aiLMArena在X平台发布了AutoEval方法论的讲解视频,并附有详细文章链接。视频地址为youtu.be/xlfuhC2GWos,文章可在x.com/i/article/2085查看。该推文已获得1742次浏览,但互动量较低,仅有2个赞。论文LMArenaAutoEval模型评测推荐理由:LMArena这段视频把AutoEval评测方法讲得挺清楚,还配了文章,想研究模型评测的可以戳进去看看。原文稍后读已读值得跟进有用关注 LMArena
17:53lmarena.ai@lmarena_aiArena AutoEval利用数千万条真实人类对战数据训练奖励模型,能在数小时内完成新模型评估,而传统流程通常需要数周。该方法通过人类提示和模型响应进行评分,保持实时基准特性,不同于LLM-as-judge方式。Arena ML工程师Haoran Guo和Wayne Zhang在视频中讲解了其方法论与应用场景。AI模型Arena AutoEval模型评估奖励模型推荐理由:LMArena出了个AutoEval,拿历史对战数据训练奖励模型,几小时就能出评估结果,比之前快多了,搞模型的可以看看。原文稍后读已读值得跟进有用关注 Arena AutoEval
17:51lmarena.ai@lmarena_ai81°LMArena分析了数万条Claude Opus和Fable从4.5到5版本的真实高推理输出。Opus 5平均每响应510个词,是Opus 4.5平均158个词的3倍多。句子长度上升58%,从句频率上升46%,但长实词占比从46.9%降至40.1%,抽象名词每千词从6.02个降至3.79个。Opus 5的破折号使用量是4.5的2.3倍,'honestly'等诚实类措辞增加50%。Fable 5平均316个词,比Opus 5短38%,但包含赞扬或'yes, exactly'式开头的概率接近2倍。AI模型ClaudeOpusFable推荐理由:Claude Opus 5和Opus 4.5差多少?LMArena用数据告诉你:回复长度是4.5的3倍,词汇反而更简单,破折号也更多。原文稍后读已读值得跟进有用关注 Claude
00:27lmarena.ai@lmarena_ai79°xAI 推出 Grok 4.6,在 LMArena 的 WebDev 基准上以 1618 分排名第7。相较 Grok 4.5 的 1553 分(第13名)提升明显,且定价保持不变。目前 Grok 4.6 与 GPT-5.6 Sol xHigh(1622 分)和 Claude Fable 5(1627 分)仅差 4 到 9 分,三者同处第5至第7区间。AI模型Grok 4.6xAILMArena推荐理由:xAI 把 Grok 4.6 放出来了,网页开发能力直接冲到 LMArena 第7,跟 GPT-5.6 和 Claude 最新版就几分之差,这代提升挺猛。原文稍后读已读值得跟进有用关注 Grok 4.6
13:46lmarena.ai@lmarena_aiGrok Imagine Image 2.0 (Low) 由 @SpaceXAI 发布,在 LMArena 图像编辑竞技场首次亮相即获第二名,得分 1439 分。相比 Grok Imagine Image Quality 的第 7 名,新模型排名提升 5 位。在按类别统计中,除 Art 外所有类别均列第二,Art 得分待更多投票后公布。AI模型Grok Imagine Image 2.0Grok Imagine ImageLMArena推荐理由:Grok Imagine Image 2.0 (Low) 在图像编辑榜冲到第二,1439 分,比自家 Quality 版升了 5 位,值得一试。原文稍后读已读值得跟进有用关注 Grok Imagine Image 2.0
23:40lmarena.ai@lmarena_ai精选LMArena 公布 DeepSeek-V4-Flash-20260731(High) 的五项关键信号。总体得分上升 1.98%,确认成功项提升 6.99%,好评对差评比增加 1.54%。可引导性下降 2.31%,Bash 恢复得分 2.53%,工具幻觉率 1.2%。数据来自竞技场真实用户反馈。AI模型DeepSeekDeepSeek-V4-FlashLMArena7 个信源在谈事件专题推荐理由:想知道 DeepSeek 最新版行不行?看这五个真实用户信号,总体涨近2%,确认成功涨7%,但可引导性跌了。原文稍后读已读值得跟进有用关注 DeepSeek
03:42lmarena.ai@lmarena_aiOpenAI 的 GPT-5.6 家族 Sol、Terra、Luna 已在 ChatGPT、Codex 和 API 中开始推出。在 LMArena 全栈代码竞技场中,Sol 以 1638 分排全栈第 3,总榜第 5;Terra 全栈 1579 分列第 10,总榜第 20;Luna 全栈 1568 分列第 14,总榜第 18。Opus 5 (Max) 即将加入全栈榜单。AI模型GPT-5.6OpenAILMArena10 个信源在谈事件专题推荐理由:OpenAI 的 GPT-5.6 三兄弟开测,Sol 全栈第 3,Terra 和 Luna 也进 top20,挑模型看这个。原文稍后读已读值得跟进有用关注 GPT-5.6