7月11日
08:32
7月10日
12:18
12:18官方账号arXiv cs.AI@Yifan Zhou, Qihao Yang, Yan Li, Donggang Li, Xiru Hu, Hokin Deng, Ziyang Gong, Xuanyi Zhou, Huacan Wang, Xiangchao Yan, Wanghan Xu, Wenlong Zhang, Shaofeng Zhang, Yue Zhou, Yifan Yang, Zhihang Zhong, Xue Yang
该论文提出IdeaGene-Bench (IG-Bench)基准,包含1,961条黄金谱系轨迹、1,085个Idea Genome对象和920个pairwise GenomeDiff记录,覆盖10个科学领域。IG-Exam含42个任务类型、1,029个实例,用于封闭式谱系推理;IG-Arena使用种群进化得分(PES)评估生成质量。在14个LLM科学家的测试中,最强系统仅达到27.3%的精确准确率,且结构化谱系上下文会打乱模型排名。该研究揭示了当前AI在科学思想继承与变异推理上的组合瓶颈。
推荐理由:这篇论文拿IdeaGene-Bench测了14个LLM,最强也只有27.3%准确率,而且加谱系信息反而搞乱排名。想看看AI离真正理解科学进化还有多远?读它。
06:49
06:49IT之家博客/媒体
91°
OpenAI 发布 GPT-5.6 系列,包含 Sol、Terra、Luna 三档模型,价格从每百万 token 输入 1 美元到 5 美元不等。旗舰版 Sol 在 Terminal-Bench 2.1 上标准模式得分 88.8%,超过 Claude Mythos 5 的 88.0%,开启 Ultra 模式后达 91.9%。微软 CEO 纳德拉宣布 Copilot Chat、Cowork、M365、GitHub 和 Foundry 同步上线该模型。
事件专题

推荐理由:OpenAI 出了 GPT-5.6 系列,分三档定价,最贵的 Sol 编程跑分超 Claude Mythos 5,微软 Copilot 也直接用上了。想试试新模型可以看看。
7月9日
21:37
21:37官方账号Decoder@Maximilian Schreiner
精选73°
OpenAI 审查了 SWE-Bench Pro 基准测试,发现约30%的任务存在缺陷。该公司已在官网上撤回对该测试的先前认可。SWE-Bench Pro 常被用于评估AI模型(如 GPT-4)的编程能力,但OpenAI指出许多任务存在数据污染或描述不清的问题。
事件专题

推荐理由:OpenAI自己查了SWE-Bench Pro,发现三成测试题有毛病,所以不认这个榜了。做AI编程的可以看看。
05:30
05:30官方账号OpenAI@OpenAI
精选78°
OpenAI对SWE-Bench Pro进行了审计,发现该基准存在约70%的噪音上限,已无法可靠衡量前沿编码能力。该基准在业界广泛使用,但目前已被认为饱和。OpenAI决定撤回之前推荐研究社区使用该基准作为主要编码评估的建议。
事件专题

推荐理由:OpenAI发现SWE-Bench Pro这个编码基准有70%噪音上限,已经饱和了,不再适合用来衡量最强AI编码能力。
05:27
05:27官方账号OpenAI@OpenAI
OpenAI 在推特上指出,随着编码模型不断进步,现有的评估基准已不足以衡量真实进展。他们强调需要设计更难的测试、更公平的对比和更可靠的结果。这条观点引发社区对当前基准如 SWE-bench 等是否仍有效的讨论。
事件专题

推荐理由:OpenAI 自己说现在的编码测试太简单了,得加点难度和公平性。搞 AI 写代码的可以看看基准怎么改。
03:12
03:12Qdrant@qdrant_engine
精选
Elastic的基准测试声称Qdrant 1.18.1在磁盘搜索上慢7倍,但Qdrant指出测试未开启其两项磁盘优化功能。开启优化后,Qdrant实现2倍吞吐量、一半延迟和1/3计算资源消耗。测试在K8s网络附加存储上进行,Elasticsearch 9.4.1使用DiskBBQ算法,Qdrant 1.18.1。Elastic延迟120-150ms,Qdrant在开启优化后延迟更低。
推荐理由:Qdrant刚发了博客回应Elastic的测试,发现对方没开它的优化功能,一开就反超了:吞吐量翻倍,延迟减半,计算资源只要三分之一。想选向量数据库的可以看看。
7月8日
22:25
22:25量子位@思邈
RoboDojo新基准测试发布,人类表现100分,最强AI模型仅获12.8分。该基准包含200个具身智能任务,覆盖抓取、导航、操作等场景。当前模型在长时序任务和细粒度控制上明显落后于人类。测试揭示了机器人在泛化能力和物理交互方面的核心瓶颈。
推荐理由:RoboDojo这个新基准把人类和模型放到同一考场,人类满分100,最强模型才12.8,差距大到离谱,值得看看模型到底在哪栽跟头。
12:15
12:15官方账号arXiv cs.AI@Chase McDonald, Nathan Tsang, Wesley N. Kerr
FootsiesGym 是基于 HiFight 的极简 2D 格斗游戏 Footsies 构建的开源环境,用于研究双人零和不完美信息游戏中的循环非传递策略互动。该环境提供向量化模拟器,可在标准硬件上实现高吞吐量训练。论文对多种强化学习算法进行了基准测试,并讨论了开放研究方向。代码已开源在 GitHub。
推荐理由:想研究格斗游戏AI?这个新基准FootsiesGym基于极简游戏Footsies,自带高效模拟器,适合强化学习训练和对比。
7月7日
11:07
11:07官方账号arXiv cs.AI@Zefeng Wang, Minxi Yan, Jinhe Bi, Sikuan Yan, Volker Tresp, Yunpu Ma
MetaSkill-Evolve提出双时间尺度框架,使智能体技能改进递归化:任务技能在快循环演化,元技能(分析、检索、分配、提议、进化五组件)在慢循环自我应用。在OfficeQA、SealQA和ALFWorld三个基准测试上,该方法相比无技能基线分别提升+23.54、+16.09和+1.92个点。所有组件共享单一冻结骨干模型,无需额外模型或目标。
推荐理由:这篇论文让AI智能体不仅能学技能,还能自动改进改进方法本身,在三个测试集上都有明显提升,挺有意思。
7月4日
01:36
01:36lmarena.ai@lmarena_ai
Anthropic重新部署的模型在Arena上通过Fable 5测试集,涉及60多项复杂3D生成、小游戏和世界构建任务。该模型由@petergostev进行评测,结果展示在YouTube视频中。测试覆盖了高难度3D场景生成和交互式世界构建。
事件专题

推荐理由:Anthropic的模型又升级了,一口气通过了60多项3D生成和世界构建测试,挺能打的。
7月3日
10:59
10:58
10:58官方账号Epoch AI@EpochAIResearch
Epoch AI Research 推出新基准 EBR-bench,专门测量 AI 的实时学习(on-the-fly learning)能力。AI 反复玩一款名为 Earthborne Rangers 的高难度棋盘游戏,并尝试从错误中学习。截至目前,AI 未显示出任何改进迹象。
事件专题

推荐理由:Epoch AI 搞了个新基准 EBR-bench,专门看 AI 能不能边玩边学,结果 Earthborne Rangers 这游戏 AI 完全没进步,挺有意思的。
10:01
10:01官方账号arXiv cs.AI@Rintaro Otsubo, Ryo Fujii, Reina Ishikawa, Taiki Kanaya, Kanta Sawafuji, Hiroki Kajita, Shigeki Sakai, Hideo Saito, Ryo Hachiuma
AnyGroundBench是一个域适应基准测试,将时空视频定位评估从静态零样本测试转向严格的域适应。它覆盖动物、工业、运动、手术和公共安全五个专业领域,提供新拍摄视频(如专家标注的小鼠行为)与现有数据集配对,并配备密集的高保真时空标注。评估了15个SOTA视觉语言模型(VLM)的零样本泛化和上下文学习(ICL)能力。结果表明,当前模型在专业领域上的零样本和基于ICL的适应均失败,暴露出时空推理的关键缺陷。
推荐理由:想看看现在的VLM在专业视频场景下有多拉胯?这篇论文搞了个AnyGroundBench基准,测了15个模型在动物、手术等5个领域的表现,结果全翻车了。
7月2日
02:14
7月1日
08:21
08:21OpenRouter@OpenRouterAI
OpenRouter 持续在 GPQA 和 TAU-Bench 上测试多数开放权重模型,并公开发布结果。这些数据用于其 AutoExacto 元基准,该基准默认用于路由工具调用。在最新排名中,Parasail.io 和 Zai_org 位列第一。
事件专题

推荐理由:想知道哪些开放权重模型在 GPQA 和 TAU-Bench 上表现最好?OpenRouter 每周跑分、公开排名,还能帮你选最靠谱的推理服务。