模型多源确认精选

Nvidia 发布 Long-WAM 框架,扩展世界动作模型的上下文

精选理由

Nvidia 的 Long-WAM 把机器人模型的上下文拉到 19.2 秒,RoboCasa GR-1 成功率直接从 63.3% 涨到 78.7%,做机器人方向的可以看看。

Nvidia 提出 Long-WAM,一个用于扩展 world-action models 上下文的框架。在 RoboCasa GR-1 基准上,把上下文从 0.0 秒提升到 19.2 秒后,成功率从 63.3% 升到 78.7%。结果表明更长的历史上下文能明显改善机器人动作模型的执行表现。

原文 · Aran Komatsuzaki (论文推介)

Nvidia presents Long-WAM

- A framework for scaling the context of world-action models - Increasing context from 0.0 to 19.2 seconds raises success from 63.3% to 78.7% on RoboCasa GR-1 https://t.co/Fg2cnXnMzC