9月2日
10:11
10:11官方账号arXiv cs.LG@Yiming Huang, Ziche Liu, Zhuohang Wu, Yiqian Wang, Junxia Cui, Xinkai Zou, Linjun Mao, Nan Huang, Naicheng Yu, Kaijie Zhu, Yue Ma, Kun Zhou, Letian Peng, Jingbo Shang
精选73°
研究团队推出SCILAWS-BENCH基准,包含118个问题,源自381篇科学论文,覆盖291个候选定律和约800万真实数据点。该基准包含SCILAWS-REAL和SCILAWS-PARALLEL两种设置,分别评估模型从固定观测中提出定律和主动查询世界以恢复隐藏定律的能力。研究发现预测拟合度可能与科学有效性存在差异,模型记忆能力影响其能否再现或超越已发表公式。
推荐理由:研究人员发布科学定律发现基准SCILAWS-BENCH,包含真实数据和合成世界两种测试场景,评估LLM科学发现能力。
10:11
10:11官方账号arXiv cs.LG@Tomáš Holeček, Viliam Lisý
精选73°
NashDreamer是一种基于模型的强化学习框架,专为双人零和博弈设计。该框架引入了多智能体循环状态空间模型(MARSSM),在四个基准游戏中显著提升了早期训练的样本效率。研究还分析了Dreamer算法族在随机环境中面临的后验崩溃问题。
推荐理由:斯坦福团队推出NashDreamer,解决零和博弈中的非平稳性问题,比无模型基线训练效率更高。
10:10
10:10官方账号arXiv cs.LG@Zhengze Zhou, Hejian Sang
精选73°
LatentPress 将对话历史和长文档压缩为连续记忆令牌,无需文本重建。该模型在 LongMemEval 基准上达到 0.504 准确率,压缩率为 7.70 倍,优于未压缩证据的 0.490。在 LongBench-QA 上,4-8 倍压缩时性能与原始上下文相当,压缩速度比文本摘要快约 10 倍。
事件专题

推荐理由:LatentPress 用连续记忆令牌替代文本和图像压缩,压缩速度提升 10 倍,性能超越传统方法。
10:08
10:08官方账号arXiv cs.LG@Clinton Enwerem, John S. Baras, Calin Belta
研究比较专家与模仿学习者在ParcelStow任务中的表现。专家和ACT模型在标准速度下均达到100%任务成功率。在最大加速条件下,专家成功率为84%,ACT模型降至53%。ACT模型在插入阶段出现35次对齐失败,相对运动交接后任务完成率仅64%。414次无闭合力的抓取均未完成任务。
推荐理由:ACT模型模仿专家学习,但在加速条件下性能下降幅度远大于专家,揭示模仿学习的时间鲁棒性问题。
10:08
10:08官方账号arXiv cs.LG@Mariia Drozdova, Aidan Sirbu, Pietro Miotti, Robert Obryk, Mayalen Etcheverry, Eyvind Niklasson, Blake Richards
精选73°
研究人员将持久隐藏状态添加到扩散去噪器中,移除其时间步条件,创建了一个可运行任意深度的共享更新模型。该模型在Sudoku-Extreme上达到99.90%的精确解决率,在Maze-Unique上获得98.93%的解决率。推理过程中,每步用高斯噪声替换所有非线索变量,无需渐进去噪即可实现近乎完美的求解。
推荐理由:新研究将扩散模型转化为迭代推理器,解决数独和迷宫问题表现优异,无需并行回滚或外部验证器。
10:07
09:41
09:39
09:39官方账号arXiv cs.AI@Noor Abo Mokh, Kirill Chirkunov, Teresa Lynn, Nizar Habash, Reham Marzouk, Malik H. Altakrori, Younes Samih, Muhammed Abu Odeh, Nour Rabih, Rahaf Alshahrani, Hamad Alshehhi, Hamdan Al-Ali, Muhra Almahri, Besher Hassan, Mohamed Anwar, Abed Alhakim Freihat, Preslav Nakov, Alham Fikri Aji
EDRAC是首个大规模阿拉伯方言机器阅读理解和生成式问答基准,涵盖埃及、摩洛哥、阿联酋、叙利亚和沙特五种主要方言。该基准包含499段自然对话语料和4977个问答对,采用人机协作流程生成。研究显示,现有模型在语义答案质量和方言保真度间存在显著差距。
推荐理由:阿拉伯方言NLP研究者必看,首个覆盖五大方言的阅读理解基准,揭示现有模型局限。
09:39
09:39
09:39官方账号arXiv cs.AI@Chao Gao, Haijiang Liu, Qiyuan Li, Caicai Guo, Frank van Harmelen, Jinguang Gu
研究显示大语言模型在面对支持导向和消除导向两种表述方式的多选题时,回答常不一致。研究者引入双框架协议,通过最小变化的提示词保持评估目标固定。研究发现两种框架在中间层诱导出可分离的[STATE]激活。交换这些激活能系统性地改变预测结果,提高跨框架一致性。
推荐理由:这篇论文揭示了大模型在多选题中不一致回答的内部机制,通过StateSwap技术证明了不同表述方式会激活不同内部状态。
09:37
09:37官方账号arXiv cs.AI@Fanrui Zhang, Ruixue Ding, Qiang Zhang, Xi Chen, Boli Chen, Shihang Wang, Qiuchen Wang, Hongmin Zhan, Jinxin Bian, Li xingchao, Peijin Zheng, Hao cheng, Pengjun Xie, Kaipeng Zhang, Jiawei Liu, Zheng-Jun Zha
精选73°
研究人员提出ARISE-RL框架,通过任务/评分生成器与推理求解器的协同进化解决开放智能体训练难题。该框架引入RG-SED蒸馏技术,仅在记忆带来经验奖励提升时进行知识蒸馏。团队还发布ECR-Bench基准测试,涵盖单工具深度研究和多工具旅行规划任务。实验显示ARISE-RL在所有评估基准上取得稳定的最先进性能。
推荐理由:OpenAI新框架ARISE-RL用评分协同进化解决开放智能体训练难题,ECR-Bench基准测试验证效果。
09:37
09:37官方账号arXiv cs.AI@Chengqi Yang, Yiran Qiao, Feng Liu, Xingyu Lou, Zijun Zhou, Xiaoyun Mo, Changwang Zhang, Jiayuan Xu, Jun Wang, Xiang Ao
CM-PTM是一种新型跨多源行为预训练模型,专为移动游戏用户表示学习设计。该模型采用分层级联掩码预测任务,首先预测下一个行为的来源,然后在应用-操作级别逐步细化预测。在真实大规模移动数据集上的实验表明,CM-PTM能有效捕捉用户的内生兴趣,并在下游移动游戏推荐任务中取得显著性能提升。
推荐理由:CM-PTM模型解决了移动设备用户行为建模的跨源挑战,能更好捕捉用户兴趣,提升游戏推荐效果。
09:37
09:37官方账号arXiv cs.AI@Leonardo Ranaldi, Sherrie Shen, Jushi Kai, Alexandra Birch
WorldBench是一个包含1600个任务的多语言基准测试,覆盖7种语言和8种文化。该基准测试通过结构化动作让智能体在沙盒环境中执行日常任务。研究显示前沿模型仅达到49.2%的约束任务成功率(CTS),所有模型在正确性和环境保持方面存在显著差距。
推荐理由:研究人员发布WorldBench基准,测试多语言智能体在真实场景中的表现,发现当前模型在长周期任务中表现脆弱。
09:35
09:35官方账号arXiv cs.AI@Enci Zhang, Haofeng Wang, Yuesheng Zhu, Xiaole Cui, Guibo Luo
78°
AgentFactory是一个框架,可同时优化智能体系统的基础模型和工作流结构。该框架采用三阶段优化流程,在八个基准测试中表现优异,平均提升9.1%。在专业领域任务中表现尤为突出,MedQA上提升19.6%,FinEval上提升18.7%。
推荐理由:研究人员推出AgentFactory,能自动优化智能体系统,比手动设计和现有方法效果更好,平均提升9.1%。
09:33
09:33官方一手arXiv: DeepSeek@Huimin Wang, Zhengyi Zhao, Yutian Zhao
精选73°
ClinTraceBench 包含 385 个来自 MIMIC-IV 的验证对话,采用九项任务分类和 L0-L4 确定性验证。研究评估了八种历史表示策略,包括检索、压缩方案和智能体记忆系统,在 6,271 个问题上进行了 200,672 次预测。研究发现压缩策略在多访视趋势和跨患者比较上存在聚合损失,盲法与全上下文方法差距达 29.8-62.7 个百分点。
推荐理由:斯坦福团队发布临床推理基准,测试八种历史表示策略,发现压缩导致关系损失,小模型 Haiku 在全上下文下超越大模型 Sonnet。
09:33
09:33官方一手arXiv: DeepSeek@Mustafa Yasir Altunhan, Hüseyin Özgür Kamalı, Eray Tüzün
精选73°
研究通过微调GPT-4o和多个开源模型(CodeLlama-7B、CodeQwen1.5-7B等)来分类PR与问题的对应关系。微调后的模型准确率和F1-micro提升了6.15%,F1-macro提升了14.69%。CodeLlama-7B表现最佳,代码差异与问题内容对预测影响最大。
推荐理由:研究人员微调了多个大模型来自动匹配PR和问题,准确率提升显著,还能解释模型决策依据。
09:32
09:32官方一手arXiv: DeepSeek@Mohammad Hossein Shalchian, Mostafa Amiri, Amir Mahdi Sadeghzadeh
研究人员使用DeepSeek-V3-0324、GPT-OSS-120B和Qwen3-235B-A22B-Instruct-2507三种LLM为波斯语聊天数据生成标注,训练了四个MatinaRoberta-based NER模型。OSS_ZeroShot标注产生的模型在宏平均F1和标签覆盖率召回率(LCR)上表现最佳,能在单块RTX 3090上约2分钟内完成4万条消息的匿名化处理。
推荐理由:波斯语数据匿名化新方案,用LLM标注训练轻量NER模型,消费级GPU上2分钟处理4万消息。
09:32
09:32官方一手arXiv: DeepSeek@Seungwoo Jung, Dohyeok Kwon, Seungmin Cha, Junseok Lee, Yeonho Yoo, Chuck Yoo, Gyeongsik Yang
精选73°
PARSER是一种新的残差稀疏化方法,用于压缩Mixture-of-Experts大模型。该方法通过引入输出重要性指标,将压缩目标从最小化孤立矩阵误差转变为保留专家输出误差。实验显示,在Qwen和DeepSeek模型上,PARSER将压缩后模型与未压缩模型之间的精度差距分别缩小1.41倍和1.44倍,同时实现了相同的峰值内存减少。
推荐理由:PARSER方法解决了MoE模型压缩中误差累积问题,在相同内存减少下提升模型精度。
09:07
09:07官方一手arXiv: Anthropic@Xun Wang, Bihe Zhao, Michael Backes, Franziska Boenisch, Adam Dziedzic
精选73°
AgentProv是首个基于行动的身份审计方法,通过分类工具调用分布来识别部署模型。该方法在630个评估检查点对中实现了100%的替换模型检出率,且在系统提示注入下的误报率仅为7%。与MET和RUT相比,AgentProv在第三方API端点上的不一致性与独立令牌计数侧信道检测结果一致。
推荐理由:MIT研究团队推出AgentProv,通过工具调用分布检测API是否偷偷更换底层模型,准确率远超现有方法。
9月1日
12:12
12:12官方账号arXiv cs.LG@Ahmed El Kady, Aravind Narayanan, Rehana Noorani, Yani Ioannou, Shaina Raza
研究团队对三种密集型和混合专家模型在BBQ和BBQ-V基准上进行了七种条件测试。INT4量化导致较大变化,而INT8基本保持质量但能耗增加1.79-4.26倍。减少基准测试提供最一致的节省,但极小子集对保留项目更敏感。
推荐理由:Vector Institute研究团队发现高效AI评估可能改变基准结论,不同优化方式对结果影响各异。
12:10
12:10官方账号arXiv cs.LG@Nikita Koriagin, Yaroslav Aksenov, George Bredis, Gleb Gerasimov, Nikita Balagansky, Daniil Gavrilov
精选73°
研究人员提出Soft Latent Thinking方法,在推理过程中用轻量投影器替代大词汇量头。在DeepSeek-Qwen-1.5B和LLaMA-3.2-3B模型上测试,该方法在所有k值下均提升pass@k指标,同时减少思维链每步计算量。该方法在所有软思维方法中达到最高pass@32,证明连续空间可有效进行推理。
推荐理由:新方法让模型在嵌入空间连续推理,不生成离散token,性能还提升了。

仅展示最近 2000 条内容。更早的内容请查阅 AI 日报存档(侧边栏 → AI 日报 → 顶部「往期日报」)。