Bench在人工智能领域通常指基准测试(Benchmark),是评估AI模型、算法或系统性能的标准测试集。近期,多个新型基准测试被提出并取得进展,反映了AI评估体系的不断完善。 Bench 近期进展 StateM运行时实现了Terminal-Bench 2.1测试的95.3%原始准确率,StateM 运行时实现 Terminal-Bench 2.1 95.3% 原始准确率。这一结果展示了AI系统在终端任务处理上的显著进步。 PACE-Bench作为动态环境下基于代码演进的物理适应基准,PACE-Bench:动态环境下基于代码演进的物理适应基准,为AI系统在变化环境中的适应能力提供了新的评估标准。 智谱GLM-5.3编程安全模型在SWE-Marathon基准测试中得分翻倍至42.5,GLM-5.3发布:智谱编程安全模型SWE-Marathon翻倍至42.5,表明AI系统在编程安全领域的性能大幅提升。 Auggie CLI重构后每任务成本降低53%,质量保持不变,Auggie CLI 重构:每任务成本降53%,质量持平,展示了AI工具效率优化的显著成果。 当前焦点与观察点 基准测试正朝着更专业化、场景化的方向发展,如Terminal-Bench专注于终端任务,PACE-Bench关注动态环境适应能力。同时,基准测试的评估维度也在扩展,从单纯的准确率到成本效益、安全性等多维考量。值得注意的是,不同国家和地区对AI基准测试的重视程度存在差异,斯坦福AI Index 2026调查显示84%的中国受访者对AI表示兴奋,而美国仅有38%。这种差异可能影响未来基准测试的发展方向和重点。