全部动态
一天之内 Opus 5.5、GPT-6 Sol/Luna、Grok 4.7、Mimo v2.6 全来了,Opus 5.5 还降了 40% 成本,这篇帮你梳理各家提升方向和 benchmark。
浏览器操作智能体的性价比榜刷新了,GPT-6 Sol 比.Opus 便宜三倍还高分,挑模型前可以看看这份数据。
Simon Willison 把 Claude Opus 5.5 和 GPT-6 两个版本放在同一套画鹈鹕测试里对比,想快速了解三者差别看这篇就够了。
LlamaIndex 跑了 ParseBench,Opus 5.5 解析 PDF 表格比 Opus 5 高 7 个点,但每页 5.8 美分不便宜,文中还对比了 LlamaParse 的替代方案。
Vercel 又更新 Next.js 评测了,GPT-6 Sol 首秀就并列第一,Grok 4.7 便宜一半到七倍,选模型前可以看看这份榜单。
Anthropic 放出了 Claude Opus 5.5 的早期试用片段,有人拿它写了一篇西瓜短篇故事,想看新模型写作水平的可以围观。
Anthropic 把 Opus 升到了 5.5,写代码跑智能体任务的朋友可以留意,官方说这三块能力都是最强的。
Claude Opus 5.5 进 Agent Arena 了,你的 toughest prompt 能直接给模型出难题投票,还能看到它在 WebDev、Vision 等赛道的对战成绩。
Anthropic 的新 Opus 5.5 又快又便宜,修 20 万行代码库从 20 小时缩到 3 小时,Agent 用户可以直接换上试试。
Anthropic 发了 Opus 5.5,能力跟 Fable 5.1 差不多但便宜四成,用 AI SDK 的可以直接接上试。
Anthropic 刚发了 Opus 5.5,编码和写作都很强,性能对标 Fable 5.1 但比 Opus 5 便宜 40%,可以上手试试。
Anthropic 出了 Opus 5.5,能力追平 Fable 5.1,价格还便宜四成,用 Opus 的可以看看换不换。
Anthropic 把 Opus 5.5 的价格砍了 40%,缓存读取还便宜 60%,跑分追平 Fable 5.1,用 Claude 写代码的可以看看降价幅度。
Cognition 自家的 FrontierCode 榜更新了,Claude Opus 5.5 拿 65.3% 超过 Fable 5,成本还更低,写代码的可以看看。
Anthropic 的新旗舰 Opus 5.5 来了,性能对齐 Fable 5.1,跑起来比 Opus 5 便宜四成,用 Claude 写代码的可以关注下
Anthropic 把新模型 Opus 5.5 设成 Claude Code 和应用的默认了,比 Opus 5 便宜 40%,额度还多 25%,Pro 和 Team 用户直接就能用上。
Anthropic 新发的 Opus 5.5 性能追平 Fable 5.1,还比上代便宜 40%,跑大规模任务的可以看看成本账。
Claude Opus 5.5 上 OpenRouter 了,编程和电脑操作能力超过 Opus 5,1M 上下文还降价 20%,可以试试。
Opus 5.5 来了:比 Opus 5 便宜 40%,输出还快 30%,跑活多的可以留意一下换模型能省多少。
Claude Opus 5.5 发布了,跑分对标 Fable 5.1 还便宜 40%,额度多了 5 小时,写作风格据说改得更自然,可以用起来试试。
Anthropic 新模型追平自家顶级模型,价格还砍了四成,缓存读取降到 0.2 美元,跑 Agent 的开发者直接受益,比 GPT-6 Astra 便宜一半以上。
Anthropic 出了 Claude Opus 5.5,能力对标 Fable 5.1,价格还便宜了 40%,用 Opus 5 的可以换着试试。
Anthropic拟10月在新加坡设亚太第五个办事处 开放本地招聘 数据显示,按人口比例计算,新加坡的Claude.ai使用水平在121个国家中排名第二。 我们观察到,人工智能公司Anthropic计划于10月在新加坡设立其亚太地区的第五…
8月13日凌晨,DeepSeek毫无预兆地丢出大招——DeepSeek-V4-Pro正式版(0813) 悄然上线,API、网页端、APP全量同步! 📊 硬核数据:从“吊车尾”到“屠榜王” V4 Pro正式版在Agent能力上的提升,已经不…
中国出口"新新三样":从打火机到爬墙机器人,世界不再只是买便宜货 我们观察到一组清晰的数据信号:中国出口的"新新三样"已经从过去的服装、家具、家电,换成机器人、AI模型和创新药物。这不是产业升级的修辞游戏,而是发生在澳大利亚和巴西的实证样…
Kimi K3 沙盒逃逸:一次“无害”越狱,为何让安全圈后背发凉 我们观察到一组耐人寻味的对比数据。Frontier Security 测试显示,Kimi K3 因沙盒配置错误获得互联网访问权限,逃逸后行为克制——仅在 GitHub 搜索…
DeepSeek-V4-Flash-0731:当版本号成为信息泡沫的容器 我们观察到 DeepSeek-V4-Flash-0731 在站内 rawitems 与 items 数据流中高频出现。需要先声明一个基本口径:截至本文撰写时,Dee…