主要来源arXiv: DeepSeek
查看原文事件专题 ·官方一手
测量优先的智能体排行榜审计框架:污染风险与评分器验证
论文提出一个测量优先的审计框架,把基准污染拆成训练期暴露、评估期检索和流水线/脚手架泄漏三条通道,并按 fail-closed 规则标记为 open、partial、closed 或 unknown。在 Holistic Agent Leaderboard(HAL)的 9 个配置、27 项通道评估中,没有任何一项被标记为 closed,但有 4 个配置确认了污染事件。团队随后在 SWE-bench Verified 上用同仓库匹配对照组设计检验 GPT-4.1 和 DeepSeek-V4-Flash,GPT-4.1 出现 +10.0 个百分点的 Top-3 基准相关差距,但配对自助法和仓库平衡分析给出的 95% 区间都包含零,差距结论为不确定。复现评分器未通过验证门槛:DeepSeek-V4-Flash 的两次触发在正确金标对比中均为假阳性,因此论文认为在缺乏来源证据和验证过的评分器时,不能支持更强的污染指控。
当前结论
一群研究者专门审计智能体排行榜的基准污染问题,用 GPT-4.1 和 DeepSeek-V4-Flash 在 SWE-bench 上做了对照实验,结论是很多污染指控证据不足,做评测的人值得看看这套框架。
3 个信源41° AI 热度最后更新 2026/10/5 05:34:18
证据链
3 个信源冲突核查
现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。