事件专题 ·多源确认

GPT-6 Astra评测:规划出色但执行能力差

GPT-6 Astra被评价为目前最佳规划模型,能处理最复杂的技术任务,也是最好的代码审计工具。该模型在创意和写作方面有所提升,但执行能力仍然很差,无法构建简单的操作序列,代码错误率高。与Fable 5.1和Claude模型相比,GPT-6 Astra在执行质量上仍有明显差距。

当前结论

Gary Marcus评测了GPT-6 Astra,发现它规划能力顶尖但执行糟糕,代码错误率高,远不如Fable和Claude平衡。

11 个信源58° AI 热度最后更新 2026/9/7 04:41:09

证据链

11 个信源

冲突核查

现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。