事件专题 ·多源确认

NVIDIA 发布 Skill2Env:把社区 Agent Skills 编译成 RL 训练环境

NVIDIA 研究团队发布开源项目 Skill2Env,将 3.4k 个公开 Agent Skills 编译成 7,971 个带程序化测试和行为量规的终端任务,生成成本超 9 万美元。仅 300 步 GRPO 训练后,Qwen3.8-27B 在 Terminal-Bench 2.1 上从 49.4 提升到 54.1,私有基准 S2EBench pass@1 也提高 4.3。流水线分 Plan、Diversify、Create、Verify 四阶段,验证采用 Oracle 全满分、NOP 全零分的双重门槛。论文还给出一个负结果:加入量规校准奖励的版本在 TB 2.1 上只有 50.1,落后于纯结果奖励版本。

当前结论

NVIDIA 把社区写的 3.4k 个 Agent Skills 直接变成 RL 训练环境,300 步就把 Qwen 27B 在 Terminal-Bench 上拉高近 5 个点,流水线和负结果都写得很细,做 agent 训练的值得看看仓库。

4 个信源79° AI 热度最后更新 2026/9/28 02:45:06

证据链

4 个信源

冲突核查

现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。