bench·general

Bench

别名
首次出现
2026-05-22
最近出现
2026-09-03
累计提及
617
§ 01综述

Bench在人工智能领域通常指基准测试(Benchmark),是评估AI模型、算法或系统性能的标准测试集。近期,多个新型基准测试被提出并取得进展,反映了AI评估体系的不断完善。

Bench 近期进展

  • StateM运行时实现了Terminal-Bench 2.1测试的95.3%原始准确率,StateM 运行时实现 Terminal-Bench 2.1 95.3% 原始准确率。这一结果展示了AI系统在终端任务处理上的显著进步。
  • PACE-Bench作为动态环境下基于代码演进的物理适应基准,PACE-Bench:动态环境下基于代码演进的物理适应基准,为AI系统在变化环境中的适应能力提供了新的评估标准。
  • 智谱GLM-5.3编程安全模型在SWE-Marathon基准测试中得分翻倍至42.5,GLM-5.3发布:智谱编程安全模型SWE-Marathon翻倍至42.5,表明AI系统在编程安全领域的性能大幅提升。
  • Auggie CLI重构后每任务成本降低53%,质量保持不变,Auggie CLI 重构:每任务成本降53%,质量持平,展示了AI工具效率优化的显著成果。
  • 当前焦点与观察点

    基准测试正朝着更专业化、场景化的方向发展,如Terminal-Bench专注于终端任务,PACE-Bench关注动态环境适应能力。同时,基准测试的评估维度也在扩展,从单纯的准确率到成本效益、安全性等多维考量。值得注意的是,不同国家和地区对AI基准测试的重视程度存在差异,斯坦福AI Index 2026调查显示84%的中国受访者对AI表示兴奋,而美国仅有38%。这种差异可能影响未来基准测试的发展方向和重点。
    § 02相关报道10 条在档
    1. 01
      阿里 Zvec 团队开源 zg 搜索工具
      shao__meng
    2. 02
      Gemini 3.8 Flash 发布:接近前沿模型能力
      shao__meng
    3. 03
      Google发布Gemini 3.8 Flash和Flash Cyber
      Tech in Asia
    4. 04
      西班牙推出Quasar 438B模型,欧洲最强AI
      IT之家
    5. 05
      Google发布Gemini 3.8 Flash和Flash Cyber
      marktechpost
    6. 06
      谷歌推出Gemini 3.8 Flash Cyber模型
      IT之家
    7. 07
      双层协调反射:多智能体LLM系统的博弈论方法
      arXiv cs.AI
    8. 08
      Repo-To-Skill:将GitHub仓库提炼为AI技能
      arXiv cs.AI
    9. 09
      Meta发布Harness-of-Harness编程代理系统
      elvis
    10. 10
      文本到图像模型视觉隐喻生成基准研究
      arXiv cs.AI
    § 03邻近话题

    本页综述由 AITOP 基于公开报道整理。原报道版权归各自来源所有。

    /topic/Bench