事件专题 ·多源确认

谷歌推出 Android 开发模型基准测试 Android Bench 2.0

谷歌推出 Android Bench 2.0 基准测试,专门衡量模型完成真实 Android 开发工作的能力。测试对象是“模型+Agent”组合,如 GPT + Codex、Claude + Claude Code 等。测试包含 30 个真实工程任务,覆盖应用转换、从零构建、架构迁移和新功能开发四类。评测结果显示,GPT 6 Astra + Codex 和 Claude Fable 5.1 + Claude Code 分别位列前两名,Google 自家的 Gemini 3.8 Flash 和 3.7 Flash + Antigravity 排名靠后。部分任务如 Flutter/React Native 转换和 XML→Compose 迁移,所有模型均未通过。

当前结论

谷歌推出的这个新基准测试挺有意思,专门测模型做真实 Android 开发的能力,比如从零写应用或者迁移代码,能看出不同模型在工程场景下的实际表现。

11 个信源78° AI 热度最后更新 2026/9/19 13:09:36

证据链

11 个信源
相关来源 10Rappler: Technology
查看原文

冲突核查

现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。