07:03lmarena.ai@lmarena_aiAgent Arena 发布了新的 Pareto frontier 排行榜。该排行榜展示了不同 AI 智能体在多个性能指标上的平衡表现。用户可以在 arena.ai/leaderboard/ag 查看详细数据。目前已有 517 次查看。AI产品Agent ArenaPareto frontier智能体推荐理由:Agent Arena 上线了新的 Pareto frontier 排行榜,帮你直观对比不同 AI 智能体的综合表现。原文稍后读已读值得跟进有用关注 Agent Arena
06:42lmarena.ai@lmarena_ai78°GoogleDeepMind 发布的 Gemini 3.8 Flash (High) 在 Agent Arena 中排名第 14 位,净提升 +5.94%,任务成本为 0.22 美元。该模型在 Text Arena 中排名第 7 位,得分 1494 分,超越 Claude Opus 5 (High)。相比 Gemini 3.7 Flash (High),在多个类别中排名显著提升,如写作类别从第 7 名升至第 3 名。AI模型Gemini 3.8 FlashGoogleDeepMindAgent Arena10 个信源在谈事件专题推荐理由:GoogleDeepMind 新发布的 Gemini 3.8 Flash (High) 在多个竞技场表现优异,成本比同类模型低 44-50%。原文稍后读已读值得跟进有用关注 Gemini 3.8 Flash
05:57lmarena.ai@lmarena_ai73°Muse Spark 1.3由Meta开发,现已加入Agent Arena评测平台。该模型在数百万真实世界长周期智能体任务中进行测试,可使用网络搜索、文件系统和终端工具完成复杂工作流。与Muse Spark 1.2相比,新版本工具调用减少约20%,token使用减少约25%。AI模型Muse SparkMetaAgent Arena推荐理由:Meta的Muse Spark 1.3上线Arena,能更好协作并减少幻觉,比前代更实用。原文稍后读已读值得跟进有用关注 Muse Spark
03:37lmarena.ai@lmarena_ai73°Gemini 3.8 Flash (High)在Agent Arena评测中较Gemini 3.7 Flash (High)提升5.94%,排名从第32位上升至第14位。该模型在"赞扬vs投诉"指标上提升14.78%,在"确认成功率"上提升11.12%,在"Bash恢复"能力上提升4.46%。Agent Arena评测使用网络、文件系统和终端工具衡量模型在真实世界长期任务中的表现。AI模型GeminiGemini 3.8 FlashGoogleDeepMind10 个信源在谈事件专题推荐理由:GoogleDeepMind的Gemini 3.8 Flash在智能体评测中排名大幅提升,用户反馈明显更积极。原文稍后读已读值得跟进有用关注 Gemini
00:33lmarena.ai@lmarena_ai78°Gemini 3.8 Flash (High)在Agent Arena排名第14,较3.7版本提升5.94个百分点。在Text Arena中位列第7,超越Claude Opus 5 (High)的1492分。该模型在写作、多轮对话和长查询等类别中排名显著提升。AI模型Gemini 3.8 FlashGoogleDeepMindClaude Opus 510 个信源在谈事件专题推荐理由:GoogleDeepMind发布Gemini 3.8 Flash (High),在多个基准测试中超越前代版本和Claude Opus 5。原文稍后读已读值得跟进有用关注 Gemini 3.8 Flash
08:15lmarena.ai@lmarena_aiAgent Arena 排行榜现已上线,提供各类 AI 智能体的性能对比。排行榜包含多个基准测试指标,帮助用户了解不同智能体的表现差异。目前已有 928 人查看了该排行榜。AI产品Agent Arena智能体排行榜推荐理由:Agent Arena 发布了智能体排行榜,能直观对比各 AI 智能体性能,比传统评测更直观。原文稍后读已读值得跟进有用关注 Agent Arena
08:14lmarena.ai@lmarena_ai73°Qwen3.8-Flash-Next由阿里巴巴发布,在Agent Arena中排名第7,在8.7K+真实智能体会话中实现+2.4%的净提升。该模型在任务完成确认成功指标上表现突出,达到+12.3%,在开放模型中排名第5。相比Qwen3.8-27B,Qwen3.8-Flash-Next在净提升和确认成功指标上均有显著优势。AI模型Qwen3.8-Flash-NextAlibaba_QwenAgent Arena推荐理由:阿里Qwen3.8-Flash-Next在Agent Arena排名第7,比前代模型提升2.4%,任务完成率高达12.3%。原文稍后读已读值得跟进有用关注 Qwen3.8-Flash-Next
00:10lmarena.ai@lmarena_ai73°智谱AI发布的GLM-5.3-Flash模型已在Agent Arena上线。该模型每任务中位成本为0.12美元,净提升4.6%。在9K+真实智能体会话中,GLM-5.3-Flash在开源模型中排名第4,总体排名第19,领先GLM-5.3 (Max)一位。在确认成功率指标上,GLM-5.3-Flash提升15.3%,排名第4。AI模型GLM-5.3-FlashZai_orgAgent Arena3 个信源在谈事件专题推荐理由:智谱AI的GLM-5.3-Flash在Agent Arena表现亮眼,成本仅0.12美元/任务,超越自家前代模型。原文稍后读已读值得跟进有用关注 GLM-5.3-Flash
00:10lmarena.ai@lmarena_ai精选Agent Arena使用因果追踪技术测量模型在真实世界长时程智能体任务上的表现。该评测显示模型相对于平均模型的改进程度。完整的Agent Arena排行榜已在arena.ai/leaderboard/ag上线。AI模型Agent Arena因果追踪智能体推荐理由:Agent Arena上线新评测,用因果追踪测智能体在真实任务表现,看模型如何超越平均水平。原文稍后读已读值得跟进有用关注 Agent Arena
22:12lmarena.ai@lmarena_aiGrok-4.6在Agent Arena排行榜中位列第15名,实现了6.1%的净提升。该模型在确认成功指标上表现突出,提升了13.2%。在工具幻觉方面表现稳定,仅提升1.0%。 bash恢复能力提升了8.8%,可操控性提升4.9%。AI模型Grok-4.6Agent Arena智能体推荐理由:Grok-4.6在Agent Arena排名上升,确认成功指标提升13.2%,bash恢复能力显著增强。原文稍后读已读值得跟进有用关注 Grok-4.6
22:11lmarena.ai@lmarena_ai精选Agent Arena使用因果追踪技术评估模型在现实世界长期任务上的表现。该基准测试显示模型相对于平均模型的净改进程度。用户可访问arena.ai/leaderboard查看整体排行榜,并按代码、聊天和工作类别进行筛选。AI模型Agent Arena因果追踪基准测试推荐理由:Agent Arena上线新基准,用因果追踪测模型在长期任务中的真实表现,还能按类别筛选对比。原文稍后读已读值得跟进有用关注 Agent Arena
22:00lmarena.ai@lmarena_ai73°Grok-4.6(xHigh)在Agent Arena代码类别中排名第12,净提升7.7%,基于4500+真实智能体代码会话。在确认成功率方面排名第6,提升15%。整体确认成功率提升13.2%,排名第6。与Grok-4.5相比有显著提升,中位任务成本为1.12美元。AI模型Grok-4.6SpaceXAIAgent Arena推荐理由:SpaceXAI的Grok-4.6在代码任务上表现亮眼,确认成功率提升15%,成本与Claude Opus 4.6相当。原文稍后读已读值得跟进有用关注 Grok-4.6
01:53lmarena.ai@lmarena_ai78°Agent Arena在数百万真实世界、长期目标型任务上对模型进行评估,Claude Opus 5在代码任务中排名第一。GitHub集成提升编码能力,支持深度仓库集成,让用户在浏览器中完成编码任务。AI模型Agent ArenaClaude Opus 5模型评估推荐理由:Agent Arena更新了模型评估功能,Claude Opus 5在代码任务中表现出色,GitHub集成让编码更便捷。原文稍后读已读值得跟进有用关注 Agent Arena
05:06lmarena.ai@lmarena_ai精选Discover the Pareto frontier for all Agent Arena categories at arena.ai/leaderboard/ag… with 1 comment, 0 reposts, 2 likes, and 1295 views.技巧Agent ArenaPareto frontierperformance comparison推荐理由:Check out the Pareto frontier for Agent Arena to see performance across different categories. It's a great way to compare agents!原文稍后读已读值得跟进有用关注 Agent Arena
01:41lmarena.ai@lmarena_ai精选Meta 发布了 Muse Spark 1.2 (xHigh) 模型。该模型在 Agent Arena 基准测试中实现了 +2.1% 的净提升。相比前代 Muse Spark 1.1,其净提升分数从 0.9% 提升至 2.1%。在 Bash Recovery 任务上,性能从 +5.9% 提升到 +11.4%。AI模型Muse SparkMetaAgent Arena推荐理由:Meta 刚刚发布了 Muse Spark 1.2 (xHigh),在 Agent Arena 上的净提升分数从 0.9% 提升到了 2.1%,Bash Recovery 任务直接翻倍,比前代强了不少。原文稍后读已读值得跟进有用关注 Muse Spark
01:37lmarena.ai@lmarena_aiAgent Arena 排行榜衡量模型在数百万个真实世界、长周期任务中的表现。模型可使用网络搜索、文件系统和终端工具完成复杂工作流。该榜单通过因果追踪方法,衡量模型相对于平均模型的结果表现。AI模型Agent Arenaarena.ai智能体推荐理由:看看 arena.ai 上新出的 Agent Arena 排行榜,它用真实任务测试模型,还能用工具,比普通测试更实用。原文稍后读已读值得跟进有用关注 Agent Arena
07:36lmarena.ai@lmarena_ai精选Agent Arena推出新模型评测标准,基于百万级真实世界长期任务;利用因果追踪方法测试模型在网页搜索等工具的复杂流程;通过与平均模型对比评估任务效果。AI模型Agent Arena模型评测工具测试推荐理由:Agent Arena发布了新模型评测标准,用多种工具测模型实际能力,比普通评测更全面。原文稍后读已读值得跟进有用关注 Agent Arena
07:36lmarena.ai@lmarena_ai精选76°DeepSeek - V4 - Pro (High) 以+6%净提升成为开放模型领域Agent Arena第2名;与DeepSeek - V4 - Flash (High) 相比,其性能更高且任务成本更低;在代码和工作类别排名第2,聊天类第5,多项指标表现突出。generalDeepSeek - V4 - Pro (High)Agent ArenaDeepSeek - V4 - Flash (High)推荐理由:DeepSeek发布的V4 - Pro (High),比前代版本强,成本还低,在开放模型里排第二,可以去试试。原文稍后读已读值得跟进有用关注 DeepSeek - V4 - Pro (High)
03:31lmarena.ai@lmarena_aiAgent Arena对比了15款模型任务成本,Kimi K3 (Max)每任务成本仅$0.62;Claude Opus 5 (Max)成本达$3.37,与同类存在明显差距;Kimi K3 (Max)排名第4,成本远低于多数同级别模型;Grok和Qwen以较低成本实现了不错表现。AI模型Agent ArenaKimi K3Claude Opus 57 个信源在谈事件专题推荐理由:Agent Arena发布了各模型任务成本对比,能清楚看到不同模型花多少钱和效果,和同类比啥不一样。原文稍后读已读值得跟进有用关注 Agent Arena
01:49lmarena.ai@lmarena_aiAgent Arena 推出了新的分类功能。用户可以通过 arena.ai/leaderboard/ag… 网址在线尝试这些新分类。该推文发布后获得了889次浏览。AI产品Agent Arena智能体多模态推荐理由:Agent Arena 上线了新分类,你可以去 arena.ai/leaderboard 看看,体验一下新功能。原文稍后读已读值得跟进有用关注 Agent Arena
07:17lmarena.ai@lmarena_ai精选71°Agent Arena 新增代码、工作、聊天三个分类榜单。代码榜第一是 OpenAI 的 GPT 5.6 Sol(xHigh)。工作榜和聊天榜第一均为 Anthropic 的 Claude Opus 5(High 和 Max)。该评测基于数百万真实长时程智能体任务,单次长会话成本可达数百至一千美元。AI模型Agent ArenaGPT 5.6Claude Opus 510 个信源在谈事件专题推荐理由:想知道代码、工作、聊天分别谁最强?Agent Arena 新榜单给出答案:GPT 5.6 和 Claude Opus 5 各领风骚。原文稍后读已读值得跟进有用关注 Agent Arena
03:45lmarena.ai@lmarena_ai智谱(Z.ai)推出GLM-5.3,基于743B基础模型进行后训练,主打编码和智能体能力。该模型已上线Agent Arena,接受基于数百万真实长程任务的评测,可调用网页搜索、文件系统和终端工具。官方称其在网络安全上取得重大提升,成为开源模型新标准。AI模型GLM-5.3Z.aiAgent Arena10 个信源在谈事件专题推荐理由:GLM-5.3已进Agent Arena,743B大模型主打编码和网络安全,可以拿你的难题去投票测一测。原文稍后读已读值得跟进有用关注 GLM-5.3
02:47lmarena.ai@lmarena_ai精选Agent Arena完整排行榜详情已在官网公开,页面地址为arena.ai/leaderboard。官方通过X平台账号发布了链接,该推文目前已有1233次浏览,并附带1张数据图表。用户可前往页面查看各智能体的具体排名与表现。AI模型Agent Arena智能体评测基准推荐理由:想看AI智能体谁强谁弱?Agent Arena完整榜单出来了,去arena.ai/leaderboard就能看。原文稍后读已读值得跟进有用关注 Agent Arena
02:24lmarena.ai@lmarena_ai72°Google DeepMind的Gemini 3.7 Flash (High)在Agent Arena取得+3.4%净提升。整体排名第20,高于Gemini 3.6 Flash (High)的第35名。长程智能体任务表现与Claude Sonnet 4.6和GPT-5.6 Terra (xHigh)处于同一区间。其Confirmed Success信号得分提升10%,位列第5。官方称该模型在编码、知识工作和网页开发方面更强。AI模型Gemini 3.7 FlashGoogle DeepMindAgent Arena推荐理由:谷歌新出的Gemini 3.7 Flash在智能体评测里冲到第20,比上代强一截,编码和网页开发更好用了,感兴趣的可以试试。原文稍后读已读值得跟进有用关注 Gemini 3.7 Flash
17:56IT之家(博客/媒体)韩国 Upstage 发布商用大模型 Solar Pro 4,上下文窗口 512K,输出长度 128K token。定价方面,输入每百万 tokens 0.3 美元,缓存读取 0.06 美元,输出 1.2 美元。该模型在 Terminal-Bench v2.1 得分 57,τ³-Banking 得分 23,AA-LCR 得分 71。在 Agent Arena 榜单排名第 44,与 MiniMax M2.7 同级,也是首个登上该榜单的韩国实验室模型。AI模型Solar Pro 4UpstageAgent Arena推荐理由:Upstage 发了主打智能体任务的 Solar Pro 4,定价不高,Agent Arena 排名和 MiniMax M2.7 同级,适合处理长文档和多轮工具调用。原文稍后读已读值得跟进有用关注 Solar Pro 4
10:01lmarena.ai@lmarena_ai精选Upstage 发布 Solar Pro 4,成为首个登上 Agent Arena、Code Arena: WebDev 和 Text Arena 榜单的韩国实验室模型。Solar Pro 4 在 Agent Arena 排名第 44,与 MiniMax M2.7 和 Nemotron 3 Ultra 并列,整体净改进得分为 -12.10%。该模型在 GDPval-AA 得分为 39,τ³-Banking 为 23,Terminal-Bench 2.1 为 57,定价为每百万 tokens 0.30 美元(输入)和 1.20 美元(输出),缓存价格 0.06 美元,优惠 90% 至 9 月 10 日。AI模型Solar Pro 4UpstageAgent Arena推荐理由:Upstage 的 Solar Pro 4 是首个登上多个 Arena 榜单的韩国模型,适合做生产级智能体,价格便宜,值得试试。原文稍后读已读值得跟进有用关注 Solar Pro 4
09:46lmarena.ai@lmarena_ai精选Agent Arena发布新评测基准,在数百万个真实世界长程智能体任务上衡量模型表现。评测中模型需使用网络搜索、文件系统和终端工具完成复杂工作流,包括编写代码、制作幻灯片、网络研究、构建应用和文档分析。该基准采用因果追踪方法,可深入分析模型在长程任务中的决策过程。评测结果已上线arena.ai/leaderboard/ag榜单。AI模型Agent Arena智能体评测基准推荐理由:想测智能体真实干活能力?Agent Arena用百万真实任务打分,比普通聊天评测靠谱多了。原文稍后读已读值得跟进有用关注 Agent Arena
04:00lmarena.ai@lmarena_aiAgent Arena 发布了因果追踪方法论的解读文章。因果追踪能定位智能体决策时的关键内部状态。Agent Arena 的这套方法旨在解释智能体为何在竞技场中做出某类选择。论文Agent Arenacausal tracing智能体推荐理由:Agent Arena 把怎么用因果追踪看清智能体行为的方法讲透了,做智能体评估或研究模型机制的人可以看看。原文稍后读已读值得跟进有用关注 Agent Arena
03:59lmarena.ai@lmarena_aiAgent Arena追踪模型完成真实任务所需的token数量。Opus系列从4.7到5,性能持续提升,但token消耗从约8.5k增至约21k,含推理和输出token。相反,GPT-5.5到GPT-5.6-Sol的token用量从约10k降至约8k,同时净改进提升约1.5pp。两组模型在效率与性能上呈现相反趋势。AI模型Agent ArenaOpus 5GPT-5.6-Sol7 个信源在谈事件专题推荐理由:看Opus 5和GPT-5.6-Sol在同一基准上的表现,一个越强越费token,一个越强越省,挺有意思的对比。原文稍后读已读值得跟进有用关注 Agent Arena
07:05lmarena.ai@lmarena_aiMeta 的 Muse Spark 1.2 模型正式进入 Agent Arena,参与数百万个真实世界长程代理任务的评测。该模型可调用网页搜索、文件系统和终端工具来完成复杂工作流。除 Agent Arena 外,Muse Spark 1.2 还出现在 Text、Vision 和 Code Arena: Frontend 中。同期发布的 Muse Code(beta)是面向长程软件工程的终端编码代理,能基于 Muse Spark 1.2 规划并验证跨多文件的代码修改。AI模型Muse SparkMuse CodeMeta10 个信源在谈事件专题推荐理由:Meta 把 Muse Spark 1.2 放进 Agent Arena 让大家拿难题测它,还出了个终端编码代理 Muse Code,能干多文件改代码的活,可以去试试。原文稍后读已读值得跟进有用关注 Muse Spark
09:41lmarena.ai@lmarena_aiAgent Arena 排行榜已上线,用户可访问 arena.ai/leaderboard 查看完整数据。该榜单提供智能体在各类任务中的表现对比,包含具体评分与排名。评测结果由 Arena 平台公开,供开发者与研究者参考。AI产品Agent Arena智能体排行榜推荐理由:想选个好用的智能体?去 Agent Arena 排行榜看看,直接比分数挑,省得自己挨个试。原文稍后读已读值得跟进有用关注 Agent Arena
09:38lmarena.ai@lmarena_ai精选DeepSeek-V4-Flash-20260731 (High)在Agent Arena中排名第21,净改进+1.98%,在开源模型中位列第3,基于12.5K次真实智能体会话。该模型每次任务的中位成本为0.024美元,低于GPT-5.6 Luna (xHigh)的0.026美元,但高于DeepSeek-V4-Pro (Thinking)的0.020美元。在各项信号中,Confirmed Success得分+6.99%,而Steerability为-2.31%。其排名比DeepSeek-V4-Pro高6位,比之前的DeepSeek-V4-Flash高13位。AI模型DeepSeek-V4-FlashAgent ArenaGPT-5.6 Luna9 个信源在谈事件专题推荐理由:DeepSeek新模型V4-Flash跑Agent任务每单只要0.024美元,比GPT-5.6 Luna还便宜,性价比很能打。原文稍后读已读值得跟进有用关注 DeepSeek-V4-Flash
23:41lmarena.ai@lmarena_ai74°Agent Arena 使用数百万个真实世界长程智能体任务评测模型。模型获得网页搜索、文件系统和终端工具,完成写代码、制作幻灯片、网络研究、构建应用和分析文档等工作流。评测采用因果追踪方法衡量模型的净改进,即相对平均模型提升结果的程度。完整排行榜见 arena.ai/leaderboard/ag…。AI模型Agent Arena智能体模型评测推荐理由:想知道哪个模型最能搞定真实长任务?Agent Arena 用几百万个任务跑分,还给模型上网、文件、终端工具,比谁净提升大。原文稍后读已读值得跟进有用关注 Agent Arena
23:39lmarena.ai@lmarena_ai精选DeepSeek 发布 DeepSeek-V4-Flash-20260731(High)版本,在 Agent Arena 综合排名第 21,净提升 +1.98%,开源模型中位列第 3。该成绩基于 12.5K 次真实智能体会话评估,比 DeepSeek-V4-Pro 高 6 位(-0.47%),比上一代 V4-Flash 高 13 位(-2.81%)。分项信号中 Confirmed Success 达到 +6.99%,而 Steerability 为 -2.31%。官方 API 同步开放公开测试,原生支持 Responses API 格式,并已适配 Codex。AI模型DeepSeek-V4-FlashAgent Arena智能体9 个信源在谈事件专题推荐理由:DeepSeek 新模型在 Agent Arena 排开源第三,API 上线且支持 Codex,做智能体可以试试。原文稍后读已读值得跟进有用关注 DeepSeek-V4-Flash
02:26lmarena.ai@lmarena_ai精选斯坦福博士生与Arena研究员@carrieeeeet提出一套框架,在历史任务上校准合成数据,避免依赖当前任务的真实标签。该方法覆盖社会科学调查、AI评估和Agent Arena排行榜早期信号,处理源于模型、时间和环境变化的系统偏差。核心通过任务可交换性(Task Exchangeability)从相邻任务学习,World Cup案例用于解释原理。案例还包括Bradley-Terry/AutoRater评分和Agent Leaderboard上的可操控性分数。论文Agent Arena合成数据校准推荐理由:斯坦福Carrie的新框架,用历史任务校准合成数据,不需要真实标签,Agent Arena也在用,能解决模型和时间带来的偏差。原文稍后读已读值得跟进有用关注 Agent Arena
00:35lmarena.ai@lmarena_ai81°DeepSeek-V4-Flash 已进入 Agent Arena,将在数百万个真实长程智能体任务中接受评测,任务可调用网页搜索、文件系统和终端工具。官方同步开放 V4-Flash API 公测,称其智能体能力大幅升级,基准得分已明显超过 V4-Pro-Preview。新版 API 原生支持 Responses API 格式,并已适配 Codex。该模型还将在 Frontend Code Arena、Text 和 Vision Arena 中评测,具体分数待公布。AI模型DeepSeek-V4-FlashDeepSeek智能体10 个信源在谈事件专题推荐理由:DeepSeek 把 V4-Flash 放进 Agent Arena,API 公测也开了,智能体跑分超过 V4-Pro-Preview,还适配 Codex,想试的可以看看。原文稍后读已读值得跟进有用关注 DeepSeek-V4-Flash
06:11lmarena.ai@lmarena_aiAgent Arena 的评分基于数百万来自全球用户的真实长期智能体任务。模型可使用网络搜索、文件系统和终端工具完成复杂工作流。排行榜使用因果追踪方法测量模型相对于平均模型的结果表现。详细方法可在 arena.ai/leaderboard/ag 查看。AI模型Agent Arena智能体基准测试推荐理由:想知道你的模型在真实任务里啥水平?Agent Arena 用数百万实际任务和工具调用测试,结果很客观。原文稍后读已读值得跟进有用关注 Agent Arena
02:32lmarena.ai@lmarena_aiAnthropic 的 Claude Opus 5 (Max) 在 Agent Arena 中以 11.88% 净改进率位居第二,紧随其后的 Opus 5 (High) 以 11.73% 位列第三。该排名基于超过 7,000 次真实世界智能体会话,且 Opus 5 Max 在 Confirmed Success 和 Praise vs Complaint 信号上均获得第一。默认版本 Opus 5 (High) 在 Praise vs Complaint 信号排第三,在 Confirmed Success 信号排第四。Agent Arena 通过数百万个长期任务评估模型的工具调用和复杂工作流完成能力。AI模型Claude Opus 5Agent ArenaAnthropic10 个信源在谈事件专题推荐理由:Anthropic 的 Opus 5 在 Agent Arena 上超过 GPT-5.6,你也能用自己提示词在 agent 模式里测试它。原文稍后读已读值得跟进有用关注 Claude Opus 5
01:00lmarena.ai@lmarena_ai82°OpenAI 的 GPT 5.6 Sol (xHigh) 在 Agent Arena 中排名第四,而 Anthropic 的 Claude Opus 5 (Max) 以 11.88% 的净提升位列第二,Opus 5 (High) 以 11.73% 净提升位列第三。Opus 5 Max 在 Confirmed Success 和 Praise vs Complaint 信号上均排名第一。Fable 5 (High) 在性价比上表现最优。Arena.ai 基于超过 7000 次真实世界智能体会话得出排名。AI模型Claude Opus 5GPT 5.6Agent Arena10 个信源在谈事件专题推荐理由:想比较 Claude Opus 5 和 GPT 5.6 在真实智能体任务上的表现?这份报告用 7000+ 次任务告诉你谁更强、谁更划算。原文稍后读已读值得跟进有用关注 Claude Opus 5
00:15lmarena.ai@lmarena_ai82°Anthropic 的 Claude Opus 5 (Max) 在 Agent Arena 中排名第二,基于超过 7000 次真实代理会话,净提升 11.88%。Opus 5 (High) 紧随其后排名第三,净提升 11.73%,两者均低于第一名 Fable 5,但高于 GPT-5.6 Sol (xHigh)。在 Frontend Code Arena 中,Opus 5 Max 排名第一,Opus 5 High 排名第三(落后于 Kimi K3)。在 Text Arena(事实性开启)中,Opus 5 Max 位列第一,Opus 5 High 第二。这些成绩基于全球社区的百万级真实长周期任务评测。AI模型Claude Opus 5Agent ArenaAnthropic10 个信源在谈事件专题推荐理由:Claude Opus 5 在 Agent Arena 和代码榜都冲进前三,Max 版更是双榜第一,比 GPT-5.6 还靠前,很强悍。原文稍后读已读值得跟进有用关注 Claude Opus 5