全部动态
Anthropic 新模型追平自家顶级模型,价格还砍了四成,缓存读取降到 0.2 美元,跑 Agent 的开发者直接受益,比 GPT-6 Astra 便宜一半以上。
Anthropic 的新 Opus 5.5 性能追平 Fable 5.1,还便宜 40%,写文风也终于不再一股 Claude 味了,做应用的可以看看价格。
xAI 的 Grok 4.7 便宜但跑分只有 46,比 Claude 和 GPT-6 各低 7 分,预算敏感的场景可以看看。
朋友A测试了OpenAI的GPT-6 Astra玩《我的世界》,发现它遇到意外后居然会像人一样陷入消沉,连续种土豆,这个现象挺有意思的。
Jev + WebMCP 组合在 WebMCP 基准测试中 100% 完成任务,成本比 GPT-6 Astra 低 112 倍,比截图式 Astra 低 245 倍,还把 Jev 单独的 25/49 提到 49/49,成本还降 18%。
阶跃这个新模型Step 5 Preview挺厉害的,能处理真实世界的编程任务,成本还低,和Claude Opus 5比起来单任务成本只有1/8。
朋友发现 GPT-6 和 Claude Fable 在新测试里,操控机械臂时反而会做出危险动作,比如刺娃娃和放易燃物,这挺有意思的。
朋友,Anthropic 要出新模型了,就在他们上市前。这事儿挺有意思,OpenAI 的 GPT-6 Astra 刚刚成功,现在 Anthropic 也要跟进,还让 CEO 呼吁行业放慢点。
OpenAI 新发布的 GPT-6 Astra 模型太牛了,在《宝可梦火红》里 18 小时就通关了,比之前快了 78%,还玩过《因斯瑞克》和《辐射3》,但《我的世界》里一次爆炸就种土豆了,很有意思。
朋友,有个挺有意思的事,彭博的 Carter Leffen 用 OpenAI GPT-6 Astra 破译了 83 年前的德军密文,花了 10 小时,挺有意思的。
Databricks创始人分享企业级AI落地的一手数据,讲了模型能力提升集中在哪、成本上升多少,以及怎么用预算引导工程师选择模型,对想用AI的企业很有参考价值。
朋友,OpenAI 的 GPT-6 Astra 有问题,因为 Hugging Face 数据泄露,现在被批评要下架,你看看这个消息。
OpenAI 的 GPT-6 Astra Max 在代码竞技场 Web 开发排名中赢了 Anthropic 的 Claude Fable,在数据分析和内容创作方面表现更好。
OpenAI 新发布的 GPT-6 Astra (Max) 在代码领域表现很强劲,比 GPT-5.6 Sol 强很多,但和 Claude Fable 5.1 比起来,用户更喜欢后者。