PaperBench是OpenAI开发的一个基准测试,专门用于评估AI模型复制前沿研究论文的能力。这一测试已成为衡量AI系统学术理解与实现能力的重要指标。近期数据显示,Qwen模型在PaperBench上取得了93分的优异成绩,超过了OSWorld基准的86分。
PaperBench
general · 首次出现 2026-05-22 · 最近出现 2026-09-03 · 累计提及 8
PaperBench是OpenAI开发的一个基准测试,专门用于评估AI模型复制前沿研究论文的能力。这一测试已成为衡量AI系统学术理解与实现能力的重要指标。近期数据显示,Qwen模型在PaperBench上取得了93分的优异成绩,超过了OSWorld基准的86分。