8月21日
11:05
11:05官方账号arXiv cs.AI@Christos Koutsiaris
Daedalus-150M模型采用卷积-注意力混合架构,在CPU上实现高效推理;在59.9B tokens上从头训练,五任务基准测试得分47.31,优于GPT-2 124M等模型;与全注意力模型相比,在速度上具有显著优势,同时保持相似的质量指标。
推荐理由:Daedalus-150M模型在CPU上实现了高效推理,与同类全注意力模型相比,在速度上具有显著优势,同时保持了相似的质量指标,值得一试。
10:48
10:35
10:35官方账号arXiv cs.AI@Yejin Bang, Kirsty Fielding, Brandan Oliver, Brian Birke, Nabeel Seedat, Andrew M. Bean
合同审查是法律工作中依赖大量文本处理的领域之一,ContractScrub作为首个评估合同审查能力的基准,包含多种错误类型的合同,如定义术语误用、不正确的引用和不一致的语言。前沿模型在相关基准上表现出色,但在ContractScrub上表现不佳,仅有一个模型达到0.75的宏观平均召回率,突显了当前模型的实际限制和特定领域基准的重要性。
推荐理由:ContractScrub基准为评估合同审查能力提供了首个标准,揭示了前沿模型在特定任务上的局限性,值得法律和AI领域专业人士关注。
10:32
10:32官方账号arXiv cs.LG@Yizhe Chi, Wenyi Li, Deyao Hong, Xiaoqiu Wang, Mingju Gao, Kaisen Yang, Bingxiang He, Youjie Zheng, Calvin Xiao, Qinhuai Na
AI4AI-Bench发布,包含10个训练算法家族的10个研究仓库。测试中,智能体在4小时内重写训练算法,然后重新运行并评分。平均得分0.166,最佳系统达到0.250。测试显示,大多数智能体未改变模型学习方式,而改变模型学习的少数智能体平均得分为0.226。
推荐理由:AI4AI-Bench为LLM智能体算法设计提供了一个基准测试,展示了智能体在改进训练算法方面的潜力,值得研究者和开发者关注。
05:35
05:35Browser Use@browser_use
Opus 5 和 GPT-5.6 Sol 在浏览器使用基准测试中表现接近。该基准由数百名用户参与,将真实用户任务转化为测试。测试采用原子化、可验证且明确的评估标准。这是目前最好的浏览器智能体基准测试。
推荐理由:Opus 5 和 GPT-5.6 Sol 在一个新浏览器基准上打平了,这个基准是真实用户任务,评估标准很细,看看谁更会上网吧。
8月20日
10:15
10:15官方一手arXiv: OpenAI@Bo Liu, Simon Yu, Yiding Jiang, Ao Qu, Andrew Zhao, Zichen Liu, Junsu Kim, Zijian Zhou, Seungone Kim, Tongzheng Ren, Mickel Liu, Hanfei Yu, Zhaorun Chen, Weiyan Shi, Paul Pu Liang, Luke Zettlemoyer, Yejin Choi, Natasha Jaques
72°
SPADE利用30B参数模型实现自学习,构建自适应合成执行环境作为训练场景;让单一大语言模型同时承担环境设计与推理任务,提升数学、科学等领域表现;在八项推理与工具使用基准测试中,SPADE使模型平均提升5.3个百分点。
推荐理由:你可以试试SPADE,它是让大语言模型自己学建环境,在数学题这些领域比固定环境方法强5.3%呢。
8月19日
03:00
8月18日
8月14日
23:46
02:45
02:45lmarena.ai@lmarena_ai
LMArena 官方发布了 Code Arena 的 WebDev 子榜与 Text Arena 的完整排行榜。两份榜单均托管在 arena.ai 的 leaderboard 页面下。该榜单基于用户对战投票,反映模型在网页开发与文本任务上的能力对比。具体模型排名可在对应页面查看。
推荐理由:LMArena 把 Code Arena(WebDev)和 Text Arena 的完整榜单放出来了,想看模型在网页开发和文本任务上的排名,直接点链接查。
01:47
01:47lmarena.ai@lmarena_ai
Code Arena 推出 WebDev 排行榜,用于展示各模型在网页开发任务上的表现。WebDev 排行榜已通过 arena.ai 向公众开放,支持查看完整排名。Code Arena 的 WebDev 榜单为开发者在挑选模型时提供了直接对比。
推荐理由:Code Arena 搞了个 WebDev 排行榜,做网页开发选模型时可以参考排名,不用自己瞎试了。
8月13日
18:15
18:15OpenRouter@OpenRouterAI
DeepSeek V4 Pro 0813已在OpenRouter平台上线。相比V4 Pro Preview,新版在DeepSWE基准上得分62.7,提升49.9分;CyberGym得分83.3,提升30.6分;NL2Repo得分61.5,提升23.0分;Terminal Bench 2.1得分87.9,提升15.8分。更多服务提供商即将接入该模型。
推荐理由:DeepSeek把V4 Pro的智能体能力一口气拉高了,DeepSWE涨了快50分,写代码和操作终端都更顶了,现在就能在OpenRouter上直接用。
18:13
18:02
03:27
00:27
00:27lmarena.ai@lmarena_ai
79°
xAI 推出 Grok 4.6,在 LMArena 的 WebDev 基准上以 1618 分排名第7。相较 Grok 4.5 的 1553 分(第13名)提升明显,且定价保持不变。目前 Grok 4.6 与 GPT-5.6 Sol xHigh(1622 分)和 Claude Fable 5(1627 分)仅差 4 到 9 分,三者同处第5至第7区间。
推荐理由:xAI 把 Grok 4.6 放出来了,网页开发能力直接冲到 LMArena 第7,跟 GPT-5.6 和 Claude 最新版就几分之差,这代提升挺猛。
8月12日
18:16
18:16官方账号arXiv cs.LG@Songlin Du, Xiaoyong Lu, Zeyu Wu, Xiaobo Lu, Guobao Xiao, Bin Fan, Jiayi Ma, Takeshi Ikenaga
该综述系统梳理了跨视角特征匹配领域,提出涵盖特征提取、单类型匹配器、多类型匹配器、视觉基础模型方法、训练策略和鲁棒估计的分类体系。文章对代表性方法在统一协议下进行基准测试,比较性能差异。综述指出领域正从任务特定模型转向统一可泛化的对应模型,并讨论了效率、极端条件鲁棒性和跨域泛化等开放挑战。
推荐理由:想了解跨视角匹配的现状和未来?这篇综述把方法分类、基准测试和基础模型趋势都讲清楚了,适合快速入门。
17:45
17:45AI Will@FinanceYF5
AI Agent在电脑操作基准测试中的成绩一年内从42%提升至85%,超过约72%的人类基准。这些Agent已从演示阶段进入真实业务场景。企业关注的重点已从Agent能否点击按钮,转向其能否稳定完成整份工作。
推荐理由:AI Agent操作电脑的成绩一年翻倍,已经超过七成人类,现在开始进企业干整份活了,看看它们到底行不行。