10:11
10:11
官方账号arXiv cs.LG@Yiming Huang, Ziche Liu, Zhuohang Wu, Yiqian Wang, Junxia Cui, Xinkai Zou, Linjun Mao, Nan Huang, Naicheng Yu, Kaijie Zhu, Yue Ma, Kun Zhou, Letian Peng, Jingbo Shang 研究团队推出SCILAWS-BENCH基准,包含118个问题,源自381篇科学论文,覆盖291个候选定律和约800万真实数据点。该基准包含SCILAWS-REAL和SCILAWS-PARALLEL两种设置,分别评估模型从固定观测中提出定律和主动查询世界以恢复隐藏定律的能力。研究发现预测拟合度可能与科学有效性存在差异,模型记忆能力影响其能否再现或超越已发表公式。
推荐理由:研究人员发布科学定律发现基准SCILAWS-BENCH,包含真实数据和合成世界两种测试场景,评估LLM科学发现能力。
09:39
09:39
官方账号arXiv cs.AI@Noor Abo Mokh, Kirill Chirkunov, Teresa Lynn, Nizar Habash, Reham Marzouk, Malik H. Altakrori, Younes Samih, Muhammed Abu Odeh, Nour Rabih, Rahaf Alshahrani, Hamad Alshehhi, Hamdan Al-Ali, Muhra Almahri, Besher Hassan, Mohamed Anwar, Abed Alhakim Freihat, Preslav Nakov, Alham Fikri Aji EDRAC是首个大规模阿拉伯方言机器阅读理解和生成式问答基准,涵盖埃及、摩洛哥、阿联酋、叙利亚和沙特五种主要方言。该基准包含499段自然对话语料和4977个问答对,采用人机协作流程生成。研究显示,现有模型在语义答案质量和方言保真度间存在显著差距。
推荐理由:阿拉伯方言NLP研究者必看,首个覆盖五大方言的阅读理解基准,揭示现有模型局限。
09:37
09:37
官方账号arXiv cs.AI@Fanrui Zhang, Ruixue Ding, Qiang Zhang, Xi Chen, Boli Chen, Shihang Wang, Qiuchen Wang, Hongmin Zhan, Jinxin Bian, Li xingchao, Peijin Zheng, Hao cheng, Pengjun Xie, Kaipeng Zhang, Jiawei Liu, Zheng-Jun Zha 研究人员提出ARISE-RL框架,通过任务/评分生成器与推理求解器的协同进化解决开放智能体训练难题。该框架引入RG-SED蒸馏技术,仅在记忆带来经验奖励提升时进行知识蒸馏。团队还发布ECR-Bench基准测试,涵盖单工具深度研究和多工具旅行规划任务。实验显示ARISE-RL在所有评估基准上取得稳定的最先进性能。
推荐理由:OpenAI新框架ARISE-RL用评分协同进化解决开放智能体训练难题,ECR-Bench基准测试验证效果。
仅展示最近 2000 条内容。更早的内容请查阅 AI 日报存档(侧边栏 → AI 日报 → 顶部「往期日报」)。