主要来源arXiv cs.AI
查看原文事件专题 · 多源确认
终端智能体环境演化方法研究
该研究提出环境演化方法,通过离线增加环境难度,在训练过程中持续提供学习信号。研究团队从多轮学习目标中推导出三种影响环境难度的演化方向,并通过循环工程多智能体工具实现。在Hy4预览版、Claude Opus 5和GPT-5.6 Sol的定量滚动实验中,环境演化方法 consistently 生成更具挑战性的环境。在Qwen3.6-27B和Qwen3.6-35B-A3B的简单长程强化学习训练中,该方法使它们在Terminal-Bench 2.1上的性能分别提升了14.4和18.0个百分点。
当前结论
研究人员提出环境演化方法,让终端智能体训练环境持续变难,在Qwen模型上提升了18%性能。
3 个信源58° AI 热度最后更新 2026/9/3 17:26:33
证据链
相关来源 1AI Will
查看原文相关来源 2lmarena.ai
查看原文冲突核查
现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。