8月28日
17:58
17:58官方账号arXiv cs.AI@Lukas Kuhn, Lucas Maes, Giuseppe Serra, Quentin Le Lidec, Yann LeCun, Randall Balestriero, Florian Buettner
精选73°
LeVJEPA是首个基于LeJEPA无崩溃目标训练的视频编码器,仅需一个编码器和投影器。在相同数据下,LeVJEPA在ViT-S/B/L模型上比V-JEPA 2节省5.6至20.8倍预训练计算量,在ImageNet-1K上比最强视频基线高7.6分。采用块因果注意力训练后,LeVJEPA在运动相关基准上的准确率接近DINOv2的两倍。
推荐理由:LeVJEPA用简单架构实现视频预训练,大幅降低计算量,在图像和运动任务上都表现出色。
6月30日
12:29
12:29官方账号arXiv cs.AI@Heejeong Nam, Chandradithya S Jonnalagadda, Harshit Aggarwal, Eric Xu, Randall Balestriero
Observed Transition Factorization (OTF) 将每个过渡分解为稀疏的观察过渡原语,用于解耦智能体动作与干扰物、相机动态等。基于此,OTF-LAM 在标准逆向正向动力学框架中将运动原语抽象为动作潜变量,而 OTF-LAM-Dino 则在冻结的 DINOv2 表示空间中预测未来状态,无需解码器。实验表明,OTF 原语在控制载体和形态变化下零样本迁移,下游策略学习性能在复杂过渡歧义下匹配或优于基线。
推荐理由:这篇论文提出了新方法 OTF,能在有干扰的场景下解耦动作源。OFT-LAM 和 OFT-LAM-Dino 两种变体在零样本迁移和复杂环境下表现不错,适合做多物体交互推理的研究者看看。