23:36lmarena.ai@lmarena_aiCode Arena 发布 WebDev 排行榜,基于 AutoEval 分数。查看排行榜详情和了解 AutoEval。AI产品Code ArenaAutoEvalWebDev推荐理由:想看看你的代码水平如何?来 Code Arena 的 WebDev 排行榜看看吧,还有 AutoEval 评分系统哦!原文稍后读已读值得跟进有用关注 Code Arena
18:05lmarena.ai@lmarena_aiLMArena在X平台发布了AutoEval方法论的讲解视频,并附有详细文章链接。视频地址为youtu.be/xlfuhC2GWos,文章可在x.com/i/article/2085查看。该推文已获得1742次浏览,但互动量较低,仅有2个赞。论文LMArenaAutoEval模型评测推荐理由:LMArena这段视频把AutoEval评测方法讲得挺清楚,还配了文章,想研究模型评测的可以戳进去看看。原文稍后读已读值得跟进有用关注 LMArena
17:58lmarena.ai@lmarena_aiArena.ai 发布了排行榜详情页面,地址为 arena.ai/leaderboard。官方同步介绍了 AutoEval 自动评估工具。用户可查看模型表现数据,并通过 AutoEval 进行自动化评估。该消息来自 Arena.ai 在 X 平台的官方账号。AI产品Arena.aiAutoEval模型评测推荐理由:Arena.ai 发了排行榜和 AutoEval 介绍,想对比模型表现和了解自动评估方式的可以看看。原文稍后读已读值得跟进有用关注 Arena.ai
17:42lmarena.ai@lmarena_aiArena.ai近期公开了关于AutoEval的更多细节。该推文由Arena.ai官方账号发布,并附带了相关链接。AutoEval的具体技术方案与评测基准尚未在推文中展开。目前这条推文已有550次浏览,读者可点击原文查看AutoEval的完整信息。AI产品AutoEvalArena.ai模型评估推荐理由:Arena.ai发了AutoEval的更多细节,想知道这评估工具是干嘛的,直接看原文。原文稍后读已读值得跟进有用关注 AutoEval
02:55lmarena.ai@lmarena_ai精选Arena.ai 今日发布 AutoEval,一种基于奖励模型的新评估方法,该模型由数百万条真实 Arena 用户偏好数据校准。AutoEval 与实时人工评估结果高度一致,能把模型评估耗时从数天缩短到数小时。它目前支持 Text、Vision、Image、Code 四个 Arena 榜单。新模型上线后,AutoEval 会直接在排行榜上给出估算分数。AI模型AutoEvalArena.ai模型评估1 个信源在谈事件专题推荐理由:想快速了解新模型水平?Arena 用真实用户偏好做评估,比传统基准快几个数量级,看榜就行。原文稍后读已读值得跟进有用关注 AutoEval
02:53lmarena.ai@lmarena_ai精选Inkling-Small在Text Arena获得约第88名,AutoEval得分1431,开放模型中约第21。它仅用12B激活参数(总276B),比肩Minimax M2.7(1417分,10B激活)、Nemotron 3 Ultra(1426分,55B激活)和DeepSeek V4 Flash(1436分,13B激活)。该分数为AutoEval初步结果,由奖励模型代替人工投票产生。AI模型Inkling-SmallthinkymachinesText Arena4 个信源在谈事件专题推荐理由:Inkling-Small只用12B激活参数就逼近DeepSeek V4 Flash,开放模型里排21名,少算力也能打,关注后续人投排名。原文稍后读已读值得跟进有用关注 Inkling-Small
05:38lmarena.ai@lmarena_ai71°Arena.ai 发布新评估方法 AutoEval,使用基于数百万真实用户偏好训练的奖励模型对 AI 模型进行排名。该方法与人工评估高度对齐,速度从数天缩短至数小时。AutoEval 支持 Text、Vision、Image 和 Code 等多个基准。新模型将直接在排行榜上显示 AutoEval 预估分数,加速社区获取结果。AI模型Arena.aiAutoEval奖励模型1 个信源在谈事件专题推荐理由:Arena.ai 搞了个新评估 AutoEval,用千万用户偏好打分,几小时出结果,比人工快多了,排行榜直接看分数。原文稍后读已读值得跟进有用关注 Arena.ai
03:39lmarena.ai@lmarena_ai精选Thinking Machines 发布 Inkling-Small,总参数量 276B,其中 12B 活跃。该模型在 Text Arena 的 AutoEval 初评中获得 1431 分,排名 #88,并在开放模型中位列 #21。它是美国仅有的五个进入开放模型前 25 的模型之一。初始分数基于 Arena 人类偏好数据训练的奖励模型自动投票得出,待与真实投票验证。AI模型Inkling-SmallThinking MachinesText Arena3 个信源在谈事件专题推荐理由:Thinking Machines 新出的开源模型,276B 参数但只激活 12B,一发布就挤进 Text Arena 前 100,美国厂商里排前几,想试大参数但轻量推理的可以看看。原文稍后读已读值得跟进有用关注 Inkling-Small
02:26lmarena.ai@lmarena_aiAutoEval 通过从实时 Arena 评估中采样的提示为新模型生成响应。它使用一个基于数百万对人类投票训练的点态奖励模型为每个响应打分,并将分数差转换为软投票。这些软投票通过相同的排名管道处理,结果直接显示在排行榜上作为初步 AutoEval 分数。闪电标记的行根据估计分数定位,但需获得足够实时人类投票验证后才能获得官方排名。AI模型AutoEvalArena Score奖励模型推荐理由:想知道 Arena 排行榜上的自动评分怎么算的吗?这篇解释了 AutoEval 如何用数百万人类投票训练奖励模型来给新模型打分,快且透明。原文稍后读已读值得跟进有用关注 AutoEval
02:25lmarena.ai@lmarena_ai72°LMSYS 发布 AutoEval,一种使用奖励模型基于数百万真实 Arena 用户偏好数据的新评估方法。它在文本、视觉、图像和代码领域均能与实时人工评估高度对齐,且将评估时间从数天缩短至数小时。AutoEval 使新模型能更快获得评分并直接显示在排行榜上。AI模型AutoEvalChatbot ArenaLMSYS推荐理由:以后新模型上线几小时就能看到评分了,比之前等几天快得多,而且数据来自真实用户偏好,可信度高。原文稍后读已读值得跟进有用关注 AutoEval
02:24lmarena.ai@lmarena_ai精选AutoEval团队训练了一个奖励模型,专门应对偏好漂移、模型差异细微、平局投票以及长上下文依赖交互等挑战。评估采用时间留出法:用历史投票训练,测试后续发布的模型。早期评分与实时排名的排名相关性超过0.98。该文本奖励模型预测人类偏好的准确率比前沿LLM裁判高8-10%,可作为人类投票积累前的早期排行榜信号。AI模型AutoEval奖励模型偏好预测推荐理由:Chai团队搞了个AutoEval奖励模型,预测人类偏好比GPT-4之类还准8-10%,新模型刷榜前先看它评分,省得等人类投票。原文稍后读已读值得跟进有用关注 AutoEval
02:23lmarena.ai@lmarena_ai精选LMSYS Arena 推出 AutoEval,一种在完整评测结果出炉前比较候选模型检查点的早期信号。实验显示,当两个模型的 Arena 分数差≥10 分时,AutoEval 在超过 90% 的案例中正确识别出更高分模型;分数差≥15 分时,对所有测试对均正确排序。AI模型AutoEvalLMSYS Arena模型评估推荐理由:如果你经常在评测结果出来前纠结选哪个检查点,AutoEval 能提前帮你判断,分差够大时几乎不出错。原文稍后读已读值得跟进有用关注 AutoEval
02:16向阳乔木@vista8Arena.ai 发布了新评测方法 AutoEval,使用基于数百万真实 Arena 用户偏好训练的奖励模型对模型进行排名。该方法与实时人工评测结果高度一致,并将评测速度从数天缩短至数小时。AutoEval 支持文本、视觉、图像和代码 Arena 多种模态。新模型上线后可直接在排行榜显示 AutoEval 预估分数。AI模型AutoEvalArena.ai奖励模型1 个信源在谈事件专题推荐理由:Arena.ai 出了 AutoEval,用真实用户偏好训练奖励模型,几个小时就能评测新模型,比人工快几十倍,结果还跟人工差不多。原文稍后读已读值得跟进有用关注 AutoEval