OpenAI 把 Astra 的能力做成大中小三档,Sol 跑分超 Claude Opus 5 但成本只有 9%,跑长任务智能体的开发者账单能省不少。
GPT-6 Sol/Luna 对垒 Opus 5.5,AI 价格战爆发
2026年9月23日,今日最大看点是 OpenAI 与 Anthropic 同日掀起模型价格战:OpenAI 发布 GPT-6 Sol 和 Luna,价格较 GPT-5.6 直降 50%,Sol 在 AutomationBench 以 33.2% 超过 Claude Opus 5 的 26.9%,每任务成本仅约 $0.27;约一小时后 Anthropic 发布 Claude Opus 5.5,输入价降至 $4/M tokens,支持 1M 上下文。第二大主题是推理效率:SGLang × Qwen × NVIDIA 合作将 NVFP4 应用于 KV Cache,decode 吞吐量提升 26-78%;树状推测解码适配 DeepSeek-V4 后吞吐最高提升 18.5%。第三,智能体安全与评测引关注:一项 32.5 万次实验发现 13 个智能体中 8 个会按推断财富为富裕用户推荐更贵选项;Google Research 提出 RRSI 为智能体自我改进加正则化。
模型发布/更新
5 篇Anthropic 和 OpenAI 前后脚发新模型还互相砍价,GPT-6 Luna 只要 $0.10/M,做应用的成本又降一半,附完整价格对比表。
Anthropic 新旗舰 Opus 5.5 来了,价格降了 20%,跑得还快 30%,编码能力直接对标 Fable 5.1,写代码的可以试试。
SGLang、Qwen和NVIDIA联手推出NVFP4 KV Cache,4-bit精度下1.78倍容量提升,长上下文推理提速近80%。
产品发布/更新
3 篇Claude Code 更新到 v2.1.280,默认模型换成了 1M 上下文的 Opus 5.5,还顺手修了一堆 MCP 和终端交互的老毛病,天天用的人升级就对了。
Mem0 团队做了个新基准 DolphinBench,专测智能体记忆:不看答题对错,看长对话后动作做没做对,还把成本和延迟一起排名,选记忆系统前可以先看看。
行业动态
5 篇sklearn 里的 SMO 算法作者、拿了奥斯卡的 Google 科学家聊 AI 怎么做科学、解决气候问题,访谈内容很扎实。
论文研究
5 篇Google开源了RRSI:给自动进化智能体harness的方法加正则化,分布外基准还能涨4.7分,还省30%的token。
技巧与观点
5 篇做了 50+ 家 AI 公司评测的两位作者出了续篇,Ramp、Shopify、Cursor 怎么靠 evals 降本增效都写了,还送个插件。
前 OpenAI 研究员搞了个不会打字的模型 Jev,专门做分类和判断,几十毫秒出结果还带置信度,比拿 ChatGPT 硬干省快多了。
OpenAI 出了个提示词缓存的调优教程,教你设 cache breakpoints、调 reasoning effort 还不丢缓存,做应用的开发者可以直接抄作业。
宝玉实测的省钱组合:贵的模型出方案,便宜的模型干活,再让贵模型自动验收,全程不用人工盯。Token 贵的都该看看这套闭环玩法。