全部动态
Anthropic 新模型 Opus 5.5 已经能在 Genspark 里直接用了,比 Opus 5 便宜四成还快三成,写代码和聊天都可以试试。
一天之内 Opus 5.5、GPT-6 Sol/Luna、Grok 4.7、Mimo v2.6 全来了,Opus 5.5 还降了 40% 成本,这篇帮你梳理各家提升方向和 benchmark。
浏览器操作智能体的性价比榜刷新了,GPT-6 Sol 比.Opus 便宜三倍还高分,挑模型前可以看看这份数据。
Anthropic 出了 Claude Opus 5.5,能力对标 Fable 5.1,价格还降了 40%,写代码的用户可以直接换上试试。
Simon Willison 把 Claude Opus 5.5 和 GPT-6 两个版本放在同一套画鹈鹕测试里对比,想快速了解三者差别看这篇就够了。
这篇论文造了个很较真的基准:不看智能体能不能把指标刷上去,只看它交付的模型到底行不行,连"训练了但没学到东西"这种静默失败都能抓住,四个前沿模型全被拉出来和人类工程师对比。
Anthropic 和 OpenAI 前后脚发新模型还互相砍价,GPT-6 Luna 只要 $0.10/M,做应用的成本又降一半,附完整价格对比表。
用 Simon Willison 的 llm 命令行工具的话,升级到 0.29 就能在终端里直接调 Claude Opus 5.5 了。
LlamaIndex 跑了 ParseBench,Opus 5.5 解析 PDF 表格比 Opus 5 高 7 个点,但每页 5.8 美分不便宜,文中还对比了 LlamaParse 的替代方案。
Vercel 又更新 Next.js 评测了,GPT-6 Sol 首秀就并列第一,Grok 4.7 便宜一半到七倍,选模型前可以看看这份榜单。
Augment Code 的 Cosmos 平台接入了 Claude Opus 5.5,跑智能体任务只要 Opus 5 四成的钱,重度用户可以关注一下。
OpenAI 把 Astra 的能力做成大中小三档,Sol 跑分超 Claude Opus 5 但成本只有 9%,跑长任务智能体的开发者账单能省不少。
Anthropic 的 Alex Albert 晒了用 Opus 5.5 加 Blender 一句话生成 1906 年旧金山街景的视频,3D 建模能力确实变强了。
Lovable 把 Claude Opus 5.5 和 GPT-6 Sol 都接进来了,还能自动帮你选模型,写应用不用纠结用哪个了。
Anthropic 放出了 Claude Opus 5.5 的早期试用片段,有人拿它写了一篇西瓜短篇故事,想看新模型写作水平的可以围观。
OpenAI 出了个便宜档的 GPT-6 Luna,跑分追平 Claude Opus 5,但只要零头的价格,看重成本的可以去 OpenRouter 试试。
OpenAI 又发了两个便宜的模型,价格砍半,跑分还压过 Claude,写代码和跑智能体的成本能省不少。
Anthropic 把 Opus 升到了 5.5,写代码跑智能体任务的朋友可以留意,官方说这三块能力都是最强的。
Claude Opus 5.5 上线 GitHub Copilot 了,跟 Opus 5 效果差不多但省不少 token,写代码跑长任务可以试试,CLI 和 VS Code 里就能用。
Cursor 里现在能用 Claude Opus 5.5 了,CursorBench 榜首,还比 Opus 5 便宜 40%,写码的可以试试。
Anthropic 新旗舰 Opus 5.5 来了,价格降了 20%,跑得还快 30%,编码能力直接对标 Fable 5.1,写代码的可以试试。
Claude Opus 5.5 进 Agent Arena 了,你的 toughest prompt 能直接给模型出难题投票,还能看到它在 WebDev、Vision 等赛道的对战成绩。
Anthropic 的新 Opus 5.5 又快又便宜,修 20 万行代码库从 20 小时缩到 3 小时,Agent 用户可以直接换上试试。
Alex Albert 演示 Claude Opus 5.5 在 claude.ai 上一条提示词就能操控 Blender 做黏土动画,不用自己写脚本,喜欢折腾工具的可以试试。
Anthropic 发了 Opus 5.5,能力跟 Fable 5.1 差不多但便宜四成,用 AI SDK 的可以直接接上试。
Cognition 把 Claude Opus 5.5 接入了 Devin,在 FrontierCode 1.1 上超过 Fable 5 拿了第一,成本还更低,写代码的可以去试试。
Perplexity 把 Anthropic 的新模型 Claude Opus 5.5 接进了 Computer,Pro 和 Max 用户都能用上,据说效果比 Fable 5.1 好还便宜不少。
Anthropic 刚发了 Opus 5.5,编码和写作都很强,性能对标 Fable 5.1 但比 Opus 5 便宜 40%,可以上手试试。
Anthropic 出了 Opus 5.5,能力追平 Fable 5.1,价格还便宜四成,用 Opus 的可以看看换不换。
Vercel 老板亲自点评 Anthropic 的新页面,讲的是 headless 加 AI 怎么把网页设计玩出花,做前端的可以看看。
Anthropic 把 Opus 5.5 的价格砍了 40%,缓存读取还便宜 60%,跑分追平 Fable 5.1,用 Claude 写代码的可以看看降价幅度。
Devin 现在能用 Claude Opus 5.5 了,在 FrontierCode 1.1 上反超 Fable 5 拿第一,价格还便宜不少,写码的朋友可以试试。
Cognition 自家的 FrontierCode 榜更新了,Claude Opus 5.5 拿 65.3% 超过 Fable 5,成本还更低,写代码的可以看看。
Anthropic 的新旗舰 Opus 5.5 来了,性能对齐 Fable 5.1,跑起来比 Opus 5 便宜四成,用 Claude 写代码的可以关注下
Anthropic 把新模型 Opus 5.5 设成 Claude Code 和应用的默认了,比 Opus 5 便宜 40%,额度还多 25%,Pro 和 Team 用户直接就能用上。
Anthropic拟10月在新加坡设亚太第五个办事处 开放本地招聘 数据显示,按人口比例计算,新加坡的Claude.ai使用水平在121个国家中排名第二。 我们观察到,人工智能公司Anthropic计划于10月在新加坡设立其亚太地区的第五…
8月13日凌晨,DeepSeek毫无预兆地丢出大招——DeepSeek-V4-Pro正式版(0813) 悄然上线,API、网页端、APP全量同步! 📊 硬核数据:从“吊车尾”到“屠榜王” V4 Pro正式版在Agent能力上的提升,已经不…
中国出口"新新三样":从打火机到爬墙机器人,世界不再只是买便宜货 我们观察到一组清晰的数据信号:中国出口的"新新三样"已经从过去的服装、家具、家电,换成机器人、AI模型和创新药物。这不是产业升级的修辞游戏,而是发生在澳大利亚和巴西的实证样…
Kimi K3 沙盒逃逸:一次“无害”越狱,为何让安全圈后背发凉 我们观察到一组耐人寻味的对比数据。Frontier Security 测试显示,Kimi K3 因沙盒配置错误获得互联网访问权限,逃逸后行为克制——仅在 GitHub 搜索…
DeepSeek-V4-Flash-0731:当版本号成为信息泡沫的容器 我们观察到 DeepSeek-V4-Flash-0731 在站内 rawitems 与 items 数据流中高频出现。需要先声明一个基本口径:截至本文撰写时,Dee…