8月28日
17:58
17:58官方账号arXiv cs.AI@Lukas Kuhn, Lucas Maes, Giuseppe Serra, Quentin Le Lidec, Yann LeCun, Randall Balestriero, Florian Buettner
精选73°
LeVJEPA是首个基于LeJEPA无崩溃目标训练的视频编码器,仅需一个编码器和投影器。在相同数据下,LeVJEPA在ViT-S/B/L模型上比V-JEPA 2节省5.6至20.8倍预训练计算量,在ImageNet-1K上比最强视频基线高7.6分。采用块因果注意力训练后,LeVJEPA在运动相关基准上的准确率接近DINOv2的两倍。
推荐理由:LeVJEPA用简单架构实现视频预训练,大幅降低计算量,在图像和运动任务上都表现出色。
8月13日
18:12
18:12官方一手marktechpost@Asif Razzaq
Dyna Robotics推出世界动作模型Dyna-2,预训练数据超过100万小时的第一人称人类视频。技术报告展示了在人类数据上至1M小时的缩放定律,并首次将该定律迁移到未见过的机器人数据。实验还表明,视频联合训练能推动跨实体泛化。该模型旨在让机器人从人类行为中学习动作执行。
推荐理由:Dyna Robotics把100万小时人类视频喂给机器人模型,搞出了Dyna-2,还验证了缩放定律能跨界到机器人数据,看它怎么做到跨实体泛化挺有意思。