17:58lmarena.ai@lmarena_aiArena.ai 发布了排行榜详情页面,地址为 arena.ai/leaderboard。官方同步介绍了 AutoEval 自动评估工具。用户可查看模型表现数据,并通过 AutoEval 进行自动化评估。该消息来自 Arena.ai 在 X 平台的官方账号。AI产品Arena.aiAutoEval模型评测推荐理由:Arena.ai 发了排行榜和 AutoEval 介绍,想对比模型表现和了解自动评估方式的可以看看。原文稍后读已读值得跟进有用关注 Arena.ai
17:42lmarena.ai@lmarena_aiArena.ai近期公开了关于AutoEval的更多细节。该推文由Arena.ai官方账号发布,并附带了相关链接。AutoEval的具体技术方案与评测基准尚未在推文中展开。目前这条推文已有550次浏览,读者可点击原文查看AutoEval的完整信息。AI产品AutoEvalArena.ai模型评估推荐理由:Arena.ai发了AutoEval的更多细节,想知道这评估工具是干嘛的,直接看原文。原文稍后读已读值得跟进有用关注 AutoEval
11:58Guillermo Rauch@rauchg精选xAI 的 Grok Imagine Image 2.0 预览版独家上线 Vercel AI Gateway。该模型在 Arena.ai 图像基准上排名第 2。开发者可用 npx ai-cli -m xai/grok-imagine-image-2.0-preview 命令调用,或在 imagine.vercel.sh 直接体验。Vercel 官方称其为优秀的图像模型。AI模型Grok Imagine Image 2.0Vercel AI GatewayxAI1 个信源在谈事件专题推荐理由:图像榜第二的图像模型,现在 Vercel 网关一条命令就能跑,xAI 新东西值得试试。原文稍后读已读值得跟进有用关注 Grok Imagine Image 2.0
00:11lmarena.ai@lmarena_ai72°Arena.ai推出Fullstack Code Arena,将代码评测从纯前端扩展到全栈开发。新平台支持数据库、API密钥和快速部署,可构建真实软件。模型在Code Arena中作为智能体,通过结构化工具调用完成计划、执行和优化。该升级让代码评测更贴近真实世界任务。AI产品Code ArenaArena.ai全栈开发推荐理由:Arena.ai的Code Arena升级了,现在能搞全栈开发,模型自己调数据库和API,直接部署,比以前只测前端强多了。原文稍后读已读值得跟进有用关注 Code Arena
16:35官方账号阿里通义 Qwen@Alibaba_Qwen精选Qwen3.8-Max 在 Arena.ai 的 Frontend Code Arena 排行榜上拿下 1668 分,位列第四。它落后于 Claude Opus 5 (Max) 的 1705 分和 Kimi K3 (Max) 的 1676 分,与 Claude Opus 5 (High) 的 1669 分几乎持平。细分领域中,Consumer Product 排第二,Brand & Marketing、Reference-based design、Gaming、Content Creation Tools 均排第三。Data & Analytics 排第四,Simulations 排第五。阿里 Qwen 官方称该模型在 Text Arena 的真实任务中也有表现。AI模型Qwen3.8-MaxAlibaba_QwenArena.ai推荐理由:Qwen 的 Qwen3.8-Max 冲到代码榜第四,只比 Claude Opus 5 High 档低一分,做前端的可以看看。原文稍后读已读值得跟进有用关注 Qwen3.8-Max
02:55lmarena.ai@lmarena_ai精选Arena.ai 今日发布 AutoEval,一种基于奖励模型的新评估方法,该模型由数百万条真实 Arena 用户偏好数据校准。AutoEval 与实时人工评估结果高度一致,能把模型评估耗时从数天缩短到数小时。它目前支持 Text、Vision、Image、Code 四个 Arena 榜单。新模型上线后,AutoEval 会直接在排行榜上给出估算分数。AI模型AutoEvalArena.ai模型评估1 个信源在谈事件专题推荐理由:想快速了解新模型水平?Arena 用真实用户偏好做评估,比传统基准快几个数量级,看榜就行。原文稍后读已读值得跟进有用关注 AutoEval
05:38lmarena.ai@lmarena_ai71°Arena.ai 发布新评估方法 AutoEval,使用基于数百万真实用户偏好训练的奖励模型对 AI 模型进行排名。该方法与人工评估高度对齐,速度从数天缩短至数小时。AutoEval 支持 Text、Vision、Image 和 Code 等多个基准。新模型将直接在排行榜上显示 AutoEval 预估分数,加速社区获取结果。AI模型Arena.aiAutoEval奖励模型1 个信源在谈事件专题推荐理由:Arena.ai 搞了个新评估 AutoEval,用千万用户偏好打分,几小时出结果,比人工快多了,排行榜直接看分数。原文稍后读已读值得跟进有用关注 Arena.ai
02:16向阳乔木@vista8Arena.ai 发布了新评测方法 AutoEval,使用基于数百万真实 Arena 用户偏好训练的奖励模型对模型进行排名。该方法与实时人工评测结果高度一致,并将评测速度从数天缩短至数小时。AutoEval 支持文本、视觉、图像和代码 Arena 多种模态。新模型上线后可直接在排行榜显示 AutoEval 预估分数。AI模型AutoEvalArena.ai奖励模型1 个信源在谈事件专题推荐理由:Arena.ai 出了 AutoEval,用真实用户偏好训练奖励模型,几个小时就能评测新模型,比人工快几十倍,结果还跟人工差不多。原文稍后读已读值得跟进有用关注 AutoEval
03:50lmarena.ai@lmarena_aiArena.ai 发布了一个新的智能体平台,旨在帮助用户通过智能体完成真实世界的工作任务。该平台不仅提供实用的工作辅助功能,还致力于衡量智能体 AI 的进步程度。用户可以通过 arena.ai/agent 访问并参与其中。这一举措标志着智能体 AI 从实验走向实际应用的重要一步,同时为评估 AI 能力提供了量化手段。AI产品智能体AI 平台工作自动化推荐理由:想用 AI 智能体处理真实工作任务的团队,现在有了一个可以直接上手的平台,还能参与衡量 AI 进步,值得一试。原文稍后读已读值得跟进有用关注 智能体