OpenAI的GPT-6 Astro在科研领域大幅领先,但编程能力与上一代持平,定价10in 50out。
OpenAI今天凌晨公布了全新架构的GPT-6 Astro群星模型,内部将其视为首个AGI时代的模型。在科学研究方面表现突出,Terminal-Bench Science 0.1基准测试得分从22.4%大幅提升至64.6%,远超Fable的52.6%。FrontierMath Tier 4达到97.6%,协助数学家将素数间隔上界从240推进到186。但在编程方面进步有限,DeepSWE v1.1得分为74.1%,与Claude Opus 5相当。
OpenAI 今天凌晨公布了全新架构的 GPT-6 Astro 群星 内部将其视为第一个 AGI 时代的模型 这个模型在科学研究方面大幅提升 而且这个模型的智力模式非常特别 相比其他模型,可以大幅减少...
OpenAI 今天凌晨公布了全新架构的 GPT-6 Astro 群星 内部将其视为第一个 AGI 时代的模型 这个模型在科学研究方面大幅提升 而且这个模型的智力模式非常特别 相比其他模型,可以大幅减少推理步骤,以更少 Token 获得更高智能 但这个模型在 coding 方面却进步很小,不如 Fable 价格方面 10in 50out,也对齐 Fable/Mythos 也许从外界看来,Mythos 可能是第一个 AGI 时代的模型吧 但最让人欣慰的是,人类终于不再卷 coding,去瞄准科学的星辰大海了 科学 Terminal-Bench Science 0.1(科研终端与管线自主操作):从上一代 Sol 的22.4% 暴涨至 64.6%(大幅领先 Fable 5.1 的 52.6%)。 FrontierMath Tier 4 (v2)(前沿科研级数学):达到97.6%。 真实数学发现:协助数学家 Julia Stadlmann 将素数间隔(prime number gaps)上界从 240 推进到 186;推动了一项维持 80 多年未动的数学界限。 智能与效能 动作与步数效率(ARC-AGI-3):在96% 的关卡中,摸索并解出未知机制所用的动作步骤比人类中位数还要少,平均动作数减少 51.7%。它不再靠暴力穷举,而是在上下文里现场发明代数简记法(DSL)压缩状态。 任务级能效比(Cost-per-task):虽然每百万 token 单价更贵,但在 OSWorld 2.0 等长流程复杂任务上,单任务耗时从 75 分钟压到了 40 分钟左右,总消耗 token 显著减少。 工程 专业工业软件(BenchCAD):达到95.9%(领先 Fable 5.1 的 84.3%),直接落地 KiCad(PCB 电路设计)、Unity 3D 排布和金融建模(Financial Modeling World Cup)。 编程 DeepSWE v1.1(真实软件工程能力):Astra 得分为74.1%,对标 Claude Opus 5 的 74.0%、Gemini 3.8 Flash 的 73.7%,甚至低于 Meta Muse Spark 1.3 的 75.4%。基本和大家挤在同一个平台期,完全没有拉开代际差距。 Artificial Analysis (AA) 综合智能与智能体指数:Astra 仅拿到了61.2 分,几乎与上一代 GPT-5.6 Sol(61分左右)持平,在 Coding Agent 指数上未见断层提升。 完整模型介绍在官网,写的非常专业,直接看一首信息,不需要看三方解读,可以在此详细阅读 openai.com/index/gpt-6-as… 💬 0 🔄 0 ❤️ 0 👀 748 ⚡