02:23lmarena.ai@lmarena_ai精选LMSYS Arena 推出 AutoEval,一种在完整评测结果出炉前比较候选模型检查点的早期信号。实验显示,当两个模型的 Arena 分数差≥10 分时,AutoEval 在超过 90% 的案例中正确识别出更高分模型;分数差≥15 分时,对所有测试对均正确排序。AI模型AutoEvalLMSYS Arena模型评估推荐理由:如果你经常在评测结果出来前纠结选哪个检查点,AutoEval 能提前帮你判断,分差够大时几乎不出错。原文稍后读已读值得跟进有用关注 AutoEval
05:17lmarena.ai@lmarena_ai79°Claude Opus 5 在 LMSYS Arena 的 Frontend Code Arena 中排名第一,Text Arena(factuality 开启)也位列第一。开启默认高推理模式时,它在 Frontend Code Arena 排第三,仅次于 Kimi K3,在 Text Arena 排第二。该数据基于真实世界任务,包括智能体网页编码、文档推理和通用对话。Anthropic 发布的新模型在价格减半的情况下接近 Fable 5 的前沿智能水平。当前 Claude Opus 5 Max 的评分仍为初步结果,后续会更新。AI模型Claude Opus 5AnthropicLMSYS Arena10 个信源在谈事件专题推荐理由:Anthropic 的 Claude Opus 5 在多个 Arena 基准上拿了第一,价格还比 Fable 5 便宜一半。做前端编码或文档推理的朋友可以重点关注。原文稍后读已读值得跟进有用关注 Claude Opus 5