9月3日
03:22
9月2日
12:46
10:11
10:11官方账号arXiv cs.LG@Yiming Huang, Ziche Liu, Zhuohang Wu, Yiqian Wang, Junxia Cui, Xinkai Zou, Linjun Mao, Nan Huang, Naicheng Yu, Kaijie Zhu, Yue Ma, Kun Zhou, Letian Peng, Jingbo Shang
精选73°
研究团队推出SCILAWS-BENCH基准,包含118个问题,源自381篇科学论文,覆盖291个候选定律和约800万真实数据点。该基准包含SCILAWS-REAL和SCILAWS-PARALLEL两种设置,分别评估模型从固定观测中提出定律和主动查询世界以恢复隐藏定律的能力。研究发现预测拟合度可能与科学有效性存在差异,模型记忆能力影响其能否再现或超越已发表公式。
推荐理由:研究人员发布科学定律发现基准SCILAWS-BENCH,包含真实数据和合成世界两种测试场景,评估LLM科学发现能力。
09:39
09:39官方账号arXiv cs.AI@Noor Abo Mokh, Kirill Chirkunov, Teresa Lynn, Nizar Habash, Reham Marzouk, Malik H. Altakrori, Younes Samih, Muhammed Abu Odeh, Nour Rabih, Rahaf Alshahrani, Hamad Alshehhi, Hamdan Al-Ali, Muhra Almahri, Besher Hassan, Mohamed Anwar, Abed Alhakim Freihat, Preslav Nakov, Alham Fikri Aji
EDRAC是首个大规模阿拉伯方言机器阅读理解和生成式问答基准,涵盖埃及、摩洛哥、阿联酋、叙利亚和沙特五种主要方言。该基准包含499段自然对话语料和4977个问答对,采用人机协作流程生成。研究显示,现有模型在语义答案质量和方言保真度间存在显著差距。
推荐理由:阿拉伯方言NLP研究者必看,首个覆盖五大方言的阅读理解基准,揭示现有模型局限。
09:37
09:37官方账号arXiv cs.AI@Leonardo Ranaldi, Sherrie Shen, Jushi Kai, Alexandra Birch
WorldBench是一个包含1600个任务的多语言基准测试,覆盖7种语言和8种文化。该基准测试通过结构化动作让智能体在沙盒环境中执行日常任务。研究显示前沿模型仅达到49.2%的约束任务成功率(CTS),所有模型在正确性和环境保持方面存在显著差距。
推荐理由:研究人员发布WorldBench基准,测试多语言智能体在真实场景中的表现,发现当前模型在长周期任务中表现脆弱。
06:29
06:29官方一手Hugging Face: Blog博客/媒体
BenchMIRT研究揭示了当前LLM基准测试的局限性。该研究分析了多个基准测试,包括MMLU、HellaSwag和TruthfulQA。研究发现这些基准可能无法全面评估模型的真实能力。研究团队提出了改进基准测试的建议。
事件专题

推荐理由:BenchMIRT研究告诉你,现在流行的LLM基准测试到底在测什么,有什么局限性。
9月1日
12:12
12:12官方账号arXiv cs.LG@Ahmed El Kady, Aravind Narayanan, Rehana Noorani, Yani Ioannou, Shaina Raza
研究团队对三种密集型和混合专家模型在BBQ和BBQ-V基准上进行了七种条件测试。INT4量化导致较大变化,而INT8基本保持质量但能耗增加1.79-4.26倍。减少基准测试提供最一致的节省,但极小子集对保留项目更敏感。
推荐理由:Vector Institute研究团队发现高效AI评估可能改变基准结论,不同优化方式对结果影响各异。
08:15
8月31日
09:34
8月29日
03:37
8月28日
22:11
22:11lmarena.ai@lmarena_ai
精选
Agent Arena使用因果追踪技术评估模型在现实世界长期任务上的表现。该基准测试显示模型相对于平均模型的净改进程度。用户可访问arena.ai/leaderboard查看整体排行榜,并按代码、聊天和工作类别进行筛选。
推荐理由:Agent Arena上线新基准,用因果追踪测模型在长期任务中的真实表现,还能按类别筛选对比。
18:07
18:07官方账号arXiv cs.AI@Dewu Zheng, Yanlin Wang, Xiwen Wang, Kefeng Duan, Hongyu Zhang, Xilin Liu, Yuchi Ma, Zibin Zheng
精选73°
MCR-Bench是首个缺陷状态感知的多轮代码审查基准,覆盖5种编程语言,包含2269个真实世界多轮代码审查任务。实验显示主流大模型在缺陷检测和生命周期状态跟踪方面能力有限,随着交互轮次增加性能显著下降。模型在不同缺陷类型和严重程度上表现差异大,语义复杂或低显著性缺陷更易被遗漏。
推荐理由:MCR-Bench揭示了当前LLM在真实代码审查中的不足,特别是跨轮次时间对齐和长程记忆问题。
17:22
17:22官方账号arXiv cs.AI@Yuandong Pu, Le Zhuo, Sayak Paul, Gabriel Jorge Menezes, Avram Đorđević, Shiyang Li, Yifan Zhou, Bin Fu, Wenlong Zhang, Junjun He, Yu Qiao, Yihao Liu, Jingbo Xing, Xi Chen
精选73°
PAWBench基准测试评估了11个当前视频生成系统在50个场景下的表现。研究发现,没有模型能够同时匹配参考概率并恢复有效行为范围。该研究引入了概率对齐概念,将世界模型定义为可能行为的分布采样器。PAWEval协议将重复视频展开转换为可能物理行为的经验分布。
推荐理由:PAWBench首次系统评估视频生成模型作为世界模型的概率对齐能力,揭示了当前模型与理想状态间的差距。
8月27日
16:18
10:26
10:26官方账号arXiv cs.AI@Yutong Chen, Guangfu Guo, Zhichao Xu, Kunpeng Liu
DualOPSD是一种不对称交替框架,自适应学生模型和教师模型。在Qwen3-8B上,DualOPSD在AIME 2024、AIME 2025和HMMT 2025上分别比OPSD提升了23.61、13.89和10.00个avg@12点。模型规模越大,准确率提升越明显。所有规模下,DualOPSD都减少了截断,4B规模下的诊断结果还显示教师和学生之间的KL散度更低。
推荐理由:DualOPSD在模型规模和性能上都有显著提升,是自蒸馏领域的一个新突破。与OPSD相比,DualOPSD在多个基准测试中取得了更好的成绩,值得关注。
09:24
09:24官方一手arXiv: DeepSeek@Dung Le Quang, Dong Cao Van, Nam Le Hai, Linh Ngo Van, Anh M. T. Bui, Phuong T. Nguyen
XREPOTEST是一个针对大型语言模型的多语言仓库级单元测试生成基准测试,涵盖Rust、Go、Julia、PHP和Ruby五种语言。它使用容器化执行框架和多种上下文增强策略,包括文件级、基于LSP和基于检索的上下文。实验结果表明,独立测试和仓库级测试之间存在显著差距,并揭示了更丰富的上下文和测试可靠性之间的权衡。
推荐理由:XREPOTEST提供了针对大型语言模型单元测试生成的挑战性基准,揭示了不同模型在不同上下文下的表现差异,值得研究。
04:07
00:43
00:43Jerry Liu@jerryjliu0
精选
@perplexity_ai 在Portable Computer版本中正确基准测试文档理解,使用ParseBench子集,涵盖表格、图表、布局、文本内容和格式。Portable Computer是一个本地优先的智能体,用于私有和成本效益的工作,27B模型在真实知识工作上得分82.6%,超过开源的Pi和Hermes。经过微调的PPLX 27B达到85.4%
事件专题

推荐理由:@perplexity_ai 发布了Portable Computer,这是一个本地优先的智能体,在文档理解方面表现优异,比开源的Pi和Hermes更胜一筹,值得一试。
8月26日
22:30
21:38
21:38官方账号阿里通义 Qwen@Alibaba_Qwen
精选78°
Qwen3.8-Flash-Next-Base参数量仅为6B,在14项基准测试中领先8项,包括MMLU-Pro、SuperGPQA等,与Qwen3.7-Plus-Base在剩余测试中保持竞争力。其51B N-gram嵌入参数使用确定性查找,不增加每词矩阵乘法成本。

推荐理由:阿里巴巴Qwen3.8-Flash-Next-Base模型参数少,性能强,是MMLU-Pro等基准测试的领先者,值得一看。
10:35
10:35Jerry Liu@jerryjliu0
精选
LlamaIndex发布文档提取基准测试,评估了多种系统,包括VLMs和LlamaParse,覆盖370个企业文档和67种文档类型。CTO和联合创始人Simon Suo将进行技术讲解,探讨提取难度、现有基准测试的不足以及成本与准确性的权衡。

推荐理由:LlamaIndex发布文档提取基准测试,全面评估多种系统,了解提取难度和成本与准确性的权衡,不容错过!
07:53
07:53官方一手marktechpost@Asif Razzaq
Liquid AI发布开源平台Pipette,用于在边缘设备上基准测试基础模型,与Artificial Analysis合作,独立验证方法。Pipette将设备上的行为作为评估标准,报告在服务器级、全精度条件下的模型卡片质量,这些数字很少能预测模型在手机上的表现。
推荐理由:Liquid AI发布了Pipette,这是一个开源的基准测试套件,可以综合评估设备模型、量化、运行时和硬件,对于想要了解模型在边缘设备上表现的人来说是个好工具。
03:59
8月25日
22:28
10:46
10:46官方账号arXiv cs.AI@Zhiqing Cui, Xinxiang Yin, Yihong Tang, Xinglang Zhang, Yuanzhe Hu, Siru Zhong, Weidong Tang, Yuxuan Liang, Weijia Li, Ming Jin, Shirui Pan, Yuhao Kang, Dingyi Zhuang, Jinhua Zhao
EarthVerse基准测试通过405个可复现任务评估科学智能体,基于199个记录事件和19种灾害类型。评估25个模型和智能体系统,平均答案单元准确率为84.65%,最高Strict@95为34.81%。测试显示当前智能体常在单个步骤完成,但缺乏跨证据、尺度、单元、计算和物理解释的一致性链。EarthVerse为测量动态地球系统中端到端科学可靠性提供可复现基础。
推荐理由:EarthVerse基准测试为评估科学智能体提供了全面的方法,揭示了当前智能体在跨证据和尺度上的不足,值得专业人士关注。
01:37
8月24日
22:43
8月23日
01:18
01:18elvis@omarsar0
精选
本文探讨了AI智能体当前存在的问题,如幻觉、成本效率低下等,提出了解决方案。通过将上下文获取视为主动推理,提出了一种名为“最优提问”的方法,并在25至300个候选者的二进制和多路任务上进行了基准测试。

推荐理由:这篇论文提出了AI智能体上下文获取的新方法,值得一读。它通过最优提问,提高了智能体的性能和效率,与现有方法相比有显著不同。
8月22日
02:33
8月21日
21:38
16:07
16:07官方一手pandaily@contact@pandaily.com (Pandaily)
78°
开源开发者新基准Qwen3.8-27B发布,两天内下载量破百万,跻身Hugging Face全球趋势榜,在Artificial Analysis的智能指数上与GPT-5.6 Luna和DeepSeek V4 Flash并列,昵称'本地Opus 4.6',将前沿能力压缩至27亿参数模型,4位量化后适配24GB GPU。新发布模型均以超越Qwen3.8-27B为标准。
事件专题

推荐理由:开源开发者有了新基准,Qwen3.8-27B横扫消费级硬件,比肩GPT-5.6 Luna和DeepSeek V4 Flash,参数量27亿,4位量化后适配24GB GPU,超越它才是新标准!