OpenAI的GPT-6 Astra主打电脑操作能力,速度提升近一倍,但编程能力只是第一梯队并列。
OpenAI发布GPT-6系列首个模型Astra,在OSWorld V2-Offline基准测试中得分为72.6%,比前代Sol提升6.9个百分点,单任务耗时从75分钟降至40分钟。在DeepSWE v1.1编程基准测试中得分为74.1%,与Muse Spark 1.3、Gemini 3.8 Flash等模型表现相当。Astra新增跨上下文窗口记忆功能,支持非阻塞提问,价格为每百万token输入10美元、输出50美元。
GPT-6 Astra 来了:Coding 没拉开、Computer Use 拉开了 OpenAI 最新发布 GPT-6 系列首个模型 Astra > This is GPT-6 Astra. An...
GPT-6 Astra 来了:Coding 没拉开、Computer Use 拉开了 OpenAI 最新发布 GPT-6 系列首个模型 Astra > This is GPT-6 Astra. Anything you can do on a computer, Astra can do for you. Fast. GPT-6 Astra 亮点都在这句话里:电脑操作能力 + 速度。和前几代「更聪明、更会推理」的叙事逻辑明显不同了。 Computer Use(主打) · OSWorld V2-Offline:72.6%(Sol 65.7%),单任务平均耗时 75 分钟 → 40 分钟 · Mind2Web + 新 Codex harness:比 Sol 快 1.9× · 演示覆盖 KiCad、Excel、Blender、Power BI、填表、网站 QA,以及预约 DMV、找工作、找房 · 注意:Anthropic 报 Fable 5.1 在 OSWorld 77.9%,测试集版本不同,不能直接比 Coding:并列,不是领跑 · DeepSWE v1.1:74.1%(Sol 70.8%) · Muse Spark 1.3 报 75.4%,Gemini 3.8 Flash / Claude Opus 5 也都在 74% 附近,误差重叠 · OpenAI 对比图未列 Muse,还用了较低的 Fable 分数,视觉上放大了差距 对开发者真正有用的两处 · 跨上下文窗口记忆:不再只靠 compaction 摘要;可跨窗口记笔记、检索早期消息与工具输出(目前 `config.toml` 实验选项,几周内默认) · 非阻塞提问:卡住决策点时,先把不依赖该答案的活干完 价格与限制 · $10 / $50 每百万 token(输入/输出),>272K 输入按 2× / 1.5× 计费——是 Sol 促销价的 2.5 倍,与 Fable 5.1 持平 · OpenAI 说看「单任务成本」而非单 token 价;独立数据还没有 · 网络安全达到 Preparedness Critical:标准版会拒高阶安全任务,API 安全检查是直接终止而非暂停 · 推理链更难监控;Pachocki:「智能进步不保证对齐进步」 总结下来 GPT-6 Astra 的跃迁在「把电脑当工具端到端做完」的可靠性和速度,以及配套记忆与交互;纯编码它只是第一梯队并列。 Brockman 高喊「欢迎来到 AGI 时代」,OpenAI 自己也承认安全和可监控性在落后于能力——价格翻倍值不值,要看真实任务的每任务成本。 最后好奇一点:GPT-6 Astra 前端能力提上来了吗?现在前端最强还是 Claude Fable 5.1 吗?我试试去。 OpenAI @OpenAI This is GPT-6 Astra. Anything you can do on a computer, Astra can do for you. Fast. Your browser does not support the video tag. 🔗 View on Twitter 🔗 View Quoted Tweet 💬 0 🔄 0 ❤️ 1 👀 1273 ⚡