9月2日
10:08
10:08官方账号arXiv cs.LG@Clinton Enwerem, John S. Baras, Calin Belta
研究比较专家与模仿学习者在ParcelStow任务中的表现。专家和ACT模型在标准速度下均达到100%任务成功率。在最大加速条件下,专家成功率为84%,ACT模型降至53%。ACT模型在插入阶段出现35次对齐失败,相对运动交接后任务完成率仅64%。414次无闭合力的抓取均未完成任务。
推荐理由:ACT模型模仿专家学习,但在加速条件下性能下降幅度远大于专家,揭示模仿学习的时间鲁棒性问题。
7月31日
5月19日
14:27
14:27官方账号arXiv cs.AI@Feng Chen, Tianzhe Chu, Li Sun, Pei Zhou, Zhuxiu Xu, Shenghua Gao, Yuexiang Zhai, Yanchao Yang, Yi Ma
精选
DexHoldem 是一个基于 ShadowHand 灵巧手系统的真实世界基准测试,围绕德州扑克操作任务设计。它提供了 1470 个遥操作演示、14 种操作原语、标准化物理策略基准和智能体感知基准。实验显示,π0.5 在原始执行上完成率最高(61.2%),而 Opus 4.7 在感知准确率上领先(34.3%),但整体闭环部署中感知与策略错误会累积。该工作旨在评估灵巧操作、智能体感知和具身决策路由的协同能力。
推荐理由:灵巧操作与决策感知的闭环评估是具身智能的硬骨头,做机器人操作或具身智能的团队值得看看这个新基准怎么暴露真实部署中的累积错误。