11:23官方账号arXiv cs.AI@Jingxiao Yang, Wangjie Gan, Yingxuan Zhuang, Wenqi Zhang, Jintao Chen, Xuhong Zhang精选73°TASPO将特权监督转化为结果导向的行动信用,在三个智能体基准测试中比GRPO提高10.6%。该方法从验证的成功经验中构建决策适用的特权信息,在可执行行动级别聚合PI引起的似然变化。TASPO将相对行动支持转换为原始轨迹优势上的正、有界、均值保留权重,验证结果确定更新方向和平均规模。论文TASPO智能体GRPO推荐理由:TASPO解决了智能体政策优化中的监督-信用差距问题,让特权信息只重新分配行动间的信用,不改变整体更新方向。原文稍后读已读值得跟进有用关注 TASPO
12:15官方账号arXiv cs.LG@Riccardo Cadei, Frank Otchere, Nyasha Tirivayi, Gustavo Angeles Tagliaferro, Falco J. Bargagli-Stoffi, Francesco Locatello该论文提出NEXIS(Neural Exposure Interaction Search),一种迭代方法,用于在可控实验中从多模态预处理表示中识别异质处理效应的因果结构。NEXIS将HTE识别重新定义为马尔可夫毯发现问题,并提供了可证明的一致性选择保证。作者将NEXIS应用于非洲两项扶贫项目,结合卫星影像捕捉未测量的环境效应修饰因子,得到了新的、可解释的政策优化指南。实验验证了NEXIS在合成数据和实际数据上的有效性。论文NEXIS异质处理效应因果推断推荐理由:这篇论文用NEXIS方法在非洲扶贫数据上找到了新的环境因子,能指导政策迭代,因果推断爱好者可以看看。原文稍后读已读值得跟进有用关注 NEXIS