01:08lmarena.ai@lmarena_ai精选Code Arena 公布 Image-to-WebDev 最新评测分数。Opus 5 (Max) 以 1669 分排名第一。GPT-5.6 的 Sol、Terra、Luna 三个版本分别拿到 1581、1531、1497 分,排在第 4、13、21 位。Grok-4.5 以 1578 分排第 5,Kimi K3 (Max) 以 1571 分排第 6,Muse Spark 1.1 以 1550 分排第 8。该评测考察模型根据截图生成网站,以及多步推理和工具调用的智能体编码流程。AI模型Opus 5GPT-5.6Code Arena4 个信源在谈事件专题推荐理由:想找能照着截图做网页的模型?直接看 Code Arena 这份榜单,Opus 5 (Max) 第一,GPT-5.6 和 Grok 的分数也都列出来了。原文稍后读已读值得跟进有用关注 Opus 5
19:46Yangyi@YangyixxxxxAI发布的Grok-4.5模型被用户评价为速度快、自由度高,能在NewMax中执行逆向Codex等复杂任务。该模型定位为编码、智能体和知识工作的全能旗舰,支持500k上下文窗口,可配置推理强度。API定价为$2/$6每百万token,低于同类旗舰模型。在独立评测中,其每智能指数任务成本显著低于对手,输出token效率领先。AI模型Grok-4.5xAI编程助手推荐理由:Grok 4.5被用户吹爆,说它又快又便宜还能干复杂活,甚至能逆向Codex。如果你想要个干活利索、不磨叽的模型,可以试试它。原文稍后读已读值得跟进有用关注 Grok-4.5
02:33lmarena.ai@lmarena_ai精选SpaceXAI 发布 Grok-4.5,它是专为编程和智能体训练的首个模型。在 Agent Arena 排行榜上,Grok-4.5 从 Grok 4.3 的第29名升至第13名,基于9.8K个实时智能体会话评估。它在 Bash Recovery 任务上大幅提升,接近 Anthropic 和 OpenAI 模型,确认任务成功率显著提高。AI模型Grok-4.5SpaceXAIAgent Arena10 个信源在谈事件专题推荐理由:Grok-4.5 是 SpaceXAI 的首个编程+智能体专用模型,在 Agent Arena 上从29名跳到13名,Bash Recovery 追平了Claude和GPT,实测任务成功率很高。原文稍后读已读值得跟进有用关注 Grok-4.5
02:30lmarena.ai@lmarena_aiGrok-4.5在Agent Arena基准测试中总体排名第13,较此前提升5.0%。其幻觉指标排名第4,提升1.3%;确认任务成功排名第6,提升6.9%。Bash恢复排名第9,提升9.7%;表扬与投诉比例排名第12,提升6.1%。可操控性排名第15,提升0.9%。AI模型Grok-4.5Agent Arena智能体推荐理由:xAI的Grok-4.5在Agent Arena进步明显,幻觉控制做到第4,任务成功提升近7%,适合关注智能体性能的朋友。原文稍后读已读值得跟进有用关注 Grok-4.5
04:07lmarena.ai@lmarena_aiGrok-4.5 在 Code Arena: Frontend 中取得第三名(#3),与 GLM-5.2 (Max) 和 Claude Opus 4.8 (Thinking) 表现相当。相比前代 Grok-4.3(排名 #62)提升了 59 个位次。该模型还在 Content Creation Tools、Simulations、Gaming 和 Reference-Based Design 四个子项中排名第二,Consumer Product 排名第三。这是 SpaceXAI 首个专为编码和智能体训练的前沿模型。AI模型Grok-4.5SpaceXAICode Arena推荐理由:Grok-4.5 在编码前端基准里干到了第三,比 4.3 狂升 59 名,跟 GLM-5.2、Claude Opus 4.8 一个水平线。想试试新编码模型的可以关注。原文稍后读已读值得跟进有用关注 Grok-4.5
00:22岚叔@lufzzliz用户实测对比Grok-4.5与GPT 5.5的前端编码能力,认为Grok-4.5凭借速度优势体验更好。Grok-4.5能快速迭代代码并理解用户需求,前端编写过程更流畅。该评价来自X平台个人分享。AI模型Grok-4.5GPT 5.5前端编程推荐理由:写前端代码试试Grok-4.5,比GPT 5.5快不少,迭代起来很顺手。原文稍后读已读值得跟进有用关注 Grok-4.5