9月1日
10:49
10:49官方账号arXiv cs.LG@Michal Korniak, Kamil Dybek, Benjamin Eysenbach, Marco Bagatella, Michał Bortkiewicz
精选73°
研究者将对比强化学习(CRL)从单步动作扩展到动作块,在18个离线环境和11个在线环境中分别实现了31.7%和93.1%的性能提升。研究发现,在CRL中,动作块比单步动作携带更多关于目标的信息,显著提升了评价器的表示能力。这种改进并非完全通过建模非马尔可夫、时间扩展策略或传播无偏多步回报来实现。
推荐理由:这篇论文展示了对比强化学习通过动作块建模获得显著性能提升,揭示了动作块携带更多目标信息的新机制。
7月29日
7月2日
10:15
10:15官方账号arXiv cs.AI@Hao Huang
论文将Muon优化器解释为隐式残差连接。正交化更新牺牲局部梯度保真度,但改善下游层的表示保留。在受控线性优化中,Muon学习对局部目标拟合慢但下游层易利用的表示。该视角为设计平衡局部下降与下游可用性的优化器提供了新思路。
推荐理由:这篇论文给了Muon一个新视角:它不只是优化器,更像隐式残差连接,专门为下游层保留好的表示。想理解Muon为什么管用的可以看看。
6月11日
11:03
11:03官方账号arXiv cs.AI@Hui Wang, Tianyu Ren, Joseph Butler, Christopher Baker, Karen Rafferty, Simon McDade
针对生物科学应用中多模态数据常部分缺失的问题,研究者提出Latent World Recovery (LWR)框架。LWR通过将不同模态的嵌入对齐到共享潜在空间,并仅融合实际可用的模态嵌入来构建统一表示,避免了传统缺失模态重构带来的误差传播。该方法无需固定模态集或显式插补缺失数据,在真实多组学基准上对癌症表型分类和生存预测等下游任务表现有效。
推荐理由:做多模态学习或生物信息学研究的团队,LWR解决了缺失模态下的鲁棒表示学习痛点,直接利用可用模态避免误差累积,值得关注其实验结果。