ByteDance Seed 和 TokenWave 的研究揭示了AI Agent自我进化的难点,值得关注。
ByteDance Seed 和 TokenWave 发布的「Self-Developing Agents」研究显示,在缺乏外部老师的情况下,AI Agent 的自我进化几乎失效。研究通过三个基准测试,发现目标形成、经验整合和系统整合方面均存在问题。
拿掉外部老师,AI Agent 自我进化几乎全部失效! 大多数所谓 "递归自我改进" 系统其实是半闭环:它们默认存在一个 "黄金验证器",一个外部的、可靠的评分信号,持续告诉模型 "方向对不对"。一...
拿掉外部老师,AI Agent 自我进化几乎全部失效! 大多数所谓 "递归自我改进" 系统其实是半闭环:它们默认存在一个 "黄金验证器",一个外部的、可靠的评分信号,持续告诉模型 "方向对不对"。一旦这个外部老师被拿掉,Agent 能否自己闭合这个环,是一个悬而未决的问题。 ByteDance Seed 和 TokenWave 发布的「Self-Developing Agents」,就是要实现从半闭环到全闭环的递归自我改进。 self-developing-agents.github.io # 团队把闭环 RSI 拆成三个问题 类比人类的学习过程: · 目标形成:模糊目标如何变成具体行动? · 经验整合:没有老师时,能否自我评判并从经验中学习? · 系统整合:改进能否沉淀到"行动方式"中并持续? 每个基准的共同设计原则:在 Agent 看不到的 held-out 评估上检验,不是看它自己声称的进步。 # 三个基准 Aspire(选什么去改进) 给 Agent 一个宽泛目标(如"提升数学推理"),不告知下游任务与最终评估。Agent 自行决定学什么、怎么学。配套:6 个能力目标、520 题封闭专家评测集、支持权重与 harness 更新的最小交互环境、48 组"模糊目标 vs 明确任务"配对轨迹。 S³Gym(能否从经验中学习) 7 个带可执行验证器的游戏(国际象棋、扫雷、贪吃蛇、俄罗斯方块、PvZ、Nullify、Trust)。把过程拆为 Self-Testing / Self-Judging / Self-Improvement,比较三种经验载体:原始历史 ICL、摘要记忆、参数训练。 HarnessDev(改进能否持久) 让模型从零构建一个可运行的 agent harness,再依据下游执行反馈演化它。评估对象是 harness 本身在 held-out 任务上的表现,并额外检验"固定执行器下演化是否仍然有效"。 # 实验发现:闭环在哪里断裂 1. 目标形成:模糊目标改变的是搜索过程,不是能力 · 30 个"配置×目标"单元中,28 个产出了 checkpoint,仅 2 个超过基座模型,只有 1 个达到保留阈值。 · Qwen3.5-4B 的自训练 checkpoint 逐步"改善",但全部低于未演化的基线。 · 模糊目标下,Agent 把预算更多花在解释目标、选代理指标上,实际训练与评估时间下降;LoRA 使用率从 24.1% 升至 89.8%。 · 结论:跑完更新循环 ≠ 目标能力提升。 2. 经验整合:不存在通用的经验路径 · 摘要记忆与原始历史各胜 3 个游戏,一个打平;换一种归一化指标(NABA vs AUC+),领先者就重排。 · 参数更新不稳定:Trust 在多数 checkpoint 上提升,PvZ 却从 23 跌到 6 且不再恢复,原因未知。 · 自我评判几乎不能预测下一步增益(ρ = −0.010 / −0.018)——这是对"无老师自学"最直接的否定证据。 3. 系统整合:可运行的 harness 里存在"死机制" · LLM 生成的 18 个 harness 全部可运行,但其中一些状态/记忆机制在代码中声明、运行时从未触发。 · 64 次版本切换中,Agent 主要修改执行流程与工具,很少触碰状态管理与验证。 · 可见反馈与 held-out 分数方向一致的仅 34/64(53.1%),接近随机;9 个"最终版本"中只有 2 个在 held-out 上最优。 · 固定 Gemini 为执行器的四次演化中,只有 Opus 相对自身起点在 held-out 上提升,其余三个回退。 团队的方法论主张 1. 在 Agent 看不见的评估上检验目标——防止"操作化了目标"被误认为"验证了目标"。 2. 用下一次决策检验经验——按环境选择经验载体,并在 held-out 决策上确认。 3. 在固定执行器 + held-out 任务上检验演化——只保留带版本管理与可回滚的变更。 💬 2 🔄 0 ❤️ 2 👀 265 📊 3 ⚡
- elvis09-02 15:24原文