上下文窗口越长越好?8B 模型学会整理记忆后,32K 打败 128K 自己

上下文窗口越长越好?一个 8B 模型学会整理记忆后,用 32K 打败了 128K 的自己 清华大学、腾讯优图实验室、上海 AI Lab 的研究者们发布了一个研究框架「ContextPilot」,通过...

精选理由

清华大学等机构的研究框架ContextPilot,通过主动管理上下文,让8B模型在长文档问答和深度搜索任务上表现出色,优于128K窗口的原始模型。

AI 摘要

清华大学等机构发布研究框架「ContextPilot」,通过工具集补齐、SFT 数据合成和定制 RL,让 Agent 学会主动管理上下文。实验结果显示,ContextPilot-8B-RL 在长文档问答和深度搜索任务上均优于原始模型和128K窗口的版本。

原文 · shao__meng

上下文窗口越长越好?一个 8B 模型学会整理记忆后,用 32K 打败了 128K 的自己 清华大学、腾讯优图实验室、上海 AI Lab 的研究者们发布了一个研究框架「ContextPilot」,通过...

上下文窗口越长越好?一个 8B 模型学会整理记忆后,用 32K 打败了 128K 的自己 清华大学、腾讯优图实验室、上海 AI Lab 的研究者们发布了一个研究框架「ContextPilot」,通过补齐工具集、SFT 数据合成和定制 RL,让 Agent 学会主动管理自己的上下文。 论文和模型地址: huggingface.co/collections/pa… # 现在 Agent 的问题在哪? 长文档问答、深度搜索这类长程任务,智能体每一轮的思考、工具调用、返回结果都会追加进上下文,越跑越长。现有解法分两派: 被动管理:超长了就按规则截断或摘要。模型只是被动接受,无法决定"何时、如何"整理。 主动管理(MemGPT、StateLM、AgentFold 等):给模型一套上下文编辑工具,让它自己决策。方向对,但作者指出三个缺陷: · 工具太窄:只有搜索、删除、摘要,缺全局规划、长期记忆、可恢复的压缩。 · 探索平均主义:RL 训练把所有编辑动作一视同仁。但作者做了先导实验——从不同工具调用处分叉往下跑,最终成功率的波动差异很大,说明某些编辑决策的影响远大于其他。 · 信用分配粗糙:把整条轨迹的最终对错平均摊给所有中间编辑动作。论文举了两个真实案例:一条答对的轨迹全程反复检索、从不清理;一条答错的轨迹反而记笔记、删冗余、管理得很规矩。按轨迹级奖励训练,前者被强化,后者被惩罚。 # 研究方法(三部分) 1. 补齐工具集 在 StateLM 基础工具上新增三类: · 规划:plan 提出简明计划,checkBudget 查剩余 token 预算。 · 长期记忆:memorize 把实体、时间、事件抽成结构化记忆并在相关项之间建边;readMemory 读取时连带返回相邻节点。 · 软卸载:summarizeContext 用摘要替换消息;compressContext 调轻量压缩模型;foldHistory 把全部历史折叠为关键词加摘要,后续可以按关键词搜回来。 凡是会改写历史的动作(卸载、写记忆、更新记忆)都被视为"上下文编辑动作",轨迹在这些点被切成一段段"快照",每个快照作为独立训练样本。 2. SFT 数据合成 教师是 Qwen3.5-397B,通过一个"脚手架"生成轨迹:只在前置条件满足时暴露工具(没写过记忆就看不到读记忆工具),上下文超长时只允许调用清理工具,出错时给提示重试。这些脚手架提示不进入最终数据。三级过滤(答案正确、过程质量、峰值不超 32K)后得到约 3 千条轨迹、5 万个快照。 3. 定制 RL(核心贡献) 上下文感知的部分回滚。 不再只做完整轨迹采样。对每个编辑动作打一个"敏感度分",由两项相加:该动作让上下文长度变化了多少比例,以及动作之后模型生成的不确定性相对轨迹起点变了多少。每个问题的采样预算中,先跑几条完整轨迹,剩余预算按敏感度排序,从最关键的编辑动作处分叉,多采一些续写。探索资源倾斜给影响大的决策。 细粒度信用分配。 中间某个快照的奖励,不再是它恰好所在那一条轨迹的对错,而是所有从它出发的续写轨迹的平均得分。然后把同一问题下的所有快照放在一组做 GRPO。附录给了一个简短论证:两种做法估计的是同一个目标,但新方法的方差随续写数量成比例下降;而部分回滚恰好为关键动作增加了续写数量,两个模块互相成全。 # 实验结果 长文档问答(四个基准,32K 窗口) · ContextPilot-8B-RL 平均 69.4,比 StateLM-8B-RL 高 3.6 分,超过用 128K 窗口的原始 Qwen3-8B(45.9)。14B 版本 72.2,同样领先。Gemma4-E4B 从 31.0 提到 61.0,涨幅最大。 · 一个很有意思的对照:只给工具不训练,反而更差。Qwen3-8B 从 45.9 掉到 27.6。工具不是即插即用的,小模型必须训练。 · RL 在难任务上收益更大:NovelQA(平均 12 万 token,且 SFT 数据含同源)只涨 1.3 分;BrowseComp+(平均 55 万 token)涨 5.3 分。 深度搜索(四个基准,两个骨干) · 平均分均为最高,比最强基线 SUPO 高约 1.5 分。幅度温和,个别单项与 SUPO 打平。 · Token 效率对比明显:原模型每轮输入近乎线性涨到约 3 万,ContextPilot 稳定在 8 千到 1 万。 训练过程中发生了什么 · 早期约一半调用是检索类;随训练进行,检索占比下降,规划、记忆、卸载类上升。 · SFT 后的模型"会调用"记忆和卸载工具但失败率很高(不理解前置条件),RL 过程中失败率大幅下降,与成功率同步提升。 消融实验 · 工具层:规划、软卸载、长期记忆逐项加入,性能逐项上升,其中长期记忆贡献最大,BrowseComp+ 从 63.5 涨到 81.0。 · RL 层:只用熵做分叉信号不稳定(BrowseComp+ 反降 1.3);加入上下文变化量后趋稳;细粒度信用分配在四个基准上全部进一步提升,是 RL 部分最有效的单点改进。 💬 1 🔄 1 ❤️ 2 👀 230 📊 2 ⚡