22:12lmarena.ai@lmarena_aiGrok-4.6在Agent Arena排行榜中位列第15名,实现了6.1%的净提升。该模型在确认成功指标上表现突出,提升了13.2%。在工具幻觉方面表现稳定,仅提升1.0%。 bash恢复能力提升了8.8%,可操控性提升4.9%。AI模型Grok-4.6Agent Arena智能体推荐理由:Grok-4.6在Agent Arena排名上升,确认成功指标提升13.2%,bash恢复能力显著增强。原文稍后读已读值得跟进有用关注 Grok-4.6
22:00lmarena.ai@lmarena_ai73°Grok-4.6(xHigh)在Agent Arena代码类别中排名第12,净提升7.7%,基于4500+真实智能体代码会话。在确认成功率方面排名第6,提升15%。整体确认成功率提升13.2%,排名第6。与Grok-4.5相比有显著提升,中位任务成本为1.12美元。AI模型Grok-4.6SpaceXAIAgent Arena推荐理由:SpaceXAI的Grok-4.6在代码任务上表现亮眼,确认成功率提升15%,成本与Claude Opus 4.6相当。原文稍后读已读值得跟进有用关注 Grok-4.6
01:43lmarena.ai@lmarena_ai83°xAI 的 Grok-4.6 (High) 在 Code Arena 的 WebDev 榜单以 1630 分升至第五名,超过 Claude Fable 5 的 1627 分和 GPT-5.6 Sol xHigh 的 1622 分。相比 Grok 4.5 的 1553 分(第13位),Grok-4.6 得分提升明显。目前这三款模型分差仅 4 至 9 分,分别排在第五至第七名。AI模型Grok-4.6SpaceXAICode Arena1 个信源在谈事件专题推荐理由:Grok-4.6 刚发布就把网页开发能力冲进第一梯队,分数压过 Claude 和 GPT 的最新版,差距只有个位数,写代码的可以关注下。原文稍后读已读值得跟进有用关注 Grok-4.6