11:55官方账号arXiv cs.LG@Tianyi Men, Zhuoran Jin, Kang Liu, Jun Zhao论文提出统一多轮环境,系统研究规划能力在预训练与后训练三阶段的获取、塑造与整合。预训练中,显式世界模型通过CoT状态转换建模提升长程泛化,少量长程数据即可实现组合泛化,但次优轨迹因误差累积严重损害性能。后训练中,OPD在低质长程设置下的有效区域比GRPO更广,不同知识的教师蒸馏可能损害学生先验世界模型。多教师在线策略蒸馏(MOPD)通过收敛到共享规划模式整合能力,兼容模式支持跨环境泛化,冲突模式导致干扰。论文MOPDGRPOOPD推荐理由:这篇用一个可控环境拆解了AI长程规划的训练机制,发现次优数据会拖累性能,多教师蒸馏能整合不同能力,值得做训练方法的人细读。原文稍后读已读值得跟进有用关注 MOPD
00:57AK@_akhaliqPlanBench-XL是一个新基准,专门评估LLM工具使用智能体在包含数千个工具的大型生态系统中的长程规划能力。该基准通过构建复杂任务链,要求智能体在工具选择、参数传递和结果融合中做出多步决策。初步测试中,GPT-4和Claude 3.5等主流模型在PlanBench-XL上的平均成功率低于40%,暴露了当前模型在规划深度和工具协调上的局限。AI模型PlanBench-XLLLM智能体推荐理由:想看看你用的LLM在多工具长流程场景下到底多靠谱?PlanBench-XL用上千个工具设计了真实任务链,测出来主流模型成功率不到40%,值得一测。原文稍后读已读值得跟进有用关注 PlanBench-XL