17:58官方账号arXiv cs.AI@Lukas Kuhn, Lucas Maes, Giuseppe Serra, Quentin Le Lidec, Yann LeCun, Randall Balestriero, Florian Buettner精选73°LeVJEPA是首个基于LeJEPA无崩溃目标训练的视频编码器,仅需一个编码器和投影器。在相同数据下,LeVJEPA在ViT-S/B/L模型上比V-JEPA 2节省5.6至20.8倍预训练计算量,在ImageNet-1K上比最强视频基线高7.6分。采用块因果注意力训练后,LeVJEPA在运动相关基准上的准确率接近DINOv2的两倍。论文LeVJEPAV-JEPA视频预训练推荐理由:LeVJEPA用简单架构实现视频预训练,大幅降低计算量,在图像和运动任务上都表现出色。原文稍后读已读值得跟进有用关注 LeVJEPA
18:12官方一手marktechpost@Asif RazzaqDyna Robotics推出世界动作模型Dyna-2,预训练数据超过100万小时的第一人称人类视频。技术报告展示了在人类数据上至1M小时的缩放定律,并首次将该定律迁移到未见过的机器人数据。实验还表明,视频联合训练能推动跨实体泛化。该模型旨在让机器人从人类行为中学习动作执行。AI模型Dyna-2Dyna Robotics世界模型推荐理由:Dyna Robotics把100万小时人类视频喂给机器人模型,搞出了Dyna-2,还验证了缩放定律能跨界到机器人数据,看它怎么做到跨实体泛化挺有意思。原文稍后读已读值得跟进有用关注 Dyna-2
18:09官方账号arXiv cs.AI@Wenrui Bao, Tianyun Jiang, Zhiben Chen, Ser-Nam Lim, Peter D. Peng, Yuzhang ShangSurgical WAM 是一个基于 Cosmos Policy 构建的统一生成模型,能同时预测内窥镜观察和可执行的手术机器人动作块。它先从无动作视频中学习手术视觉动态,再在固定数量的动作标注数据上微调。在四项模拟手术任务中,视频预训练将平均成功率从 63.5% 提升至 77.8%,其中 PegTransfer 任务绝对提升 20 个百分点。接触密集和双臂协调任务受益最大,表明无动作视频可提供可迁移的视觉动态先验。论文Surgical WAMCosmos Policy手术机器人推荐理由:手术机器人数据难搞,这个模型用便宜的视频预训练把成功率拉高了 14 个点,PegTransfer 直接涨 20%,搞机器人学习的可以看看。原文稍后读已读值得跟进有用关注 Surgical WAM