主要来源Decoder
查看原文事件专题 ·多源确认
GPT-6 Astra 在 Andon Labs 基准测试中表现优于 Claude Fable 5.1
GPT-6 Astra 在 Andon Labs 的 Vending-Bench 代理基准测试中,收入几乎达到 Claude Fable 5.1 的三倍。在无人机控制方面,Astra 是首个在所有五个子任务上都超越人类基线的模型,包括定位和跟踪单个人员。
当前结论
GPT-6 Astra 在 Andon Labs 的基准测试中表现更好,无人机控制能力更强。
11 个信源58° AI 热度最后更新 2026/9/13 10:52:16
证据链
11 个信源冲突核查
现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。