8月6日
11:16
11:16官方账号arXiv cs.LG@Zheyuan Zhang, Manqing Mao, Hong Wang, Zhuoer Wang, Samson Koelle, Jie Yuan, Yanjun Lin, James Feng, Nikki Lijing Kuang, Yanfang Ye, Wei Niu
RAIL是一种训练时框架,通过在线上下文bandit建模干预选择,学习如何为策略生成rollout。它利用影子到实时程序收集干预轨迹,训练恢复控制器,使控制器随策略演化持续学习。在多个设置下,RAIL在有限rollout预算下持续提升性能。结果表明恢复感知干预能生成更有信息量且更少冗余的rollout,增强后训练的学习信号。
推荐理由:这篇论文提出RAIL,把干预选择当成在线学习问题,让模型在有限预算下学到更有效的rollout,适合做RL后训练的人看。
09:06
09:06官方一手arXiv: Google DeepMind@Agnese Chiatti, Michael Cochez, Cristina Cornelio, Sebastijan Dumancic, Artur d'Avila Garcez, Luis C. Lamb, Lia Morra, Mathias Niepert, Robert Peharz, Alberto Speranzon, Maarten Stol, Annette Ten Teije, Thiviyan Thanapalasingam, Frank Van Harmelen, Emile Van Krieken, Antonio Vergari, Benjie Wang
这篇论文提出RAIL框架,从推理、保证、接口与学习四个维度指导神经符号AI系统设计。作者用RAIL分析了Google DeepMind的Alpha-*系列等神经引导搜索系统,以及工具增强的大语言模型。该框架同样适用于物理感知机器学习和因果学习等研究方向。其目标是帮助工程师在生产级AI系统设计中做出更原则性的决策。
推荐理由:这篇论文把神经符号AI拆成RAIL四个原则,用同一套框架分析Alpha-*和工具增强LLM,搞系统设计的人可以翻翻。