02:44elvis@omarsar0精选Google团队发表论文提出SKILL.state方法,解决长时程智能体执行效率问题。该方法通过替换历史记录为显式可变执行状态,减少累积token消耗。实验显示,在多个数据集、模型和执行环境中,任务准确率提升同时token消耗下降。该抽象架构与具体实现无关,可移植到现有技能运行时环境。论文SKILL.stateGoogle智能体推荐理由:Google团队提出SKILL.state解决长时程智能体性能问题,准确率提升同时减少token消耗。原文稍后读已读值得跟进有用关注 SKILL.state
00:10lmarena.ai@lmarena_ai精选Agent Arena使用因果追踪技术测量模型在真实世界长时程智能体任务上的表现。该评测显示模型相对于平均模型的改进程度。完整的Agent Arena排行榜已在arena.ai/leaderboard/ag上线。AI模型Agent Arena因果追踪智能体推荐理由:Agent Arena上线新评测,用因果追踪测智能体在真实任务表现,看模型如何超越平均水平。原文稍后读已读值得跟进有用关注 Agent Arena
11:29官方账号arXiv cs.AI@Zhaochen Yu, Yingcheng Wu, Zhenfei Yin, Kaiyuan Chen, Zhe Zhao, Mengdi Wang, Shuicheng Yan, Ling YangRecuris,一种用于长时程智能体驱动的递归经验-工作记忆架构,通过工作记忆跟踪任务进度并指导技能选择,提高GPT-5.6 Sol和Claude Opus 5在tau-bench和Qwen3.6-27B/35B上的任务成功率,最多提升16.6/13.5点,并减少长时程失败率至80%以下。论文Recuris递归记忆架构GPT-5.6 Sol1 个信源在谈事件专题推荐理由:Recuris模型在长时程任务中显著提升了GPT-5.6 Sol和Claude Opus 5的表现,是长时程智能体驱动的递归记忆架构的一个突破。原文稍后读已读值得跟进有用关注 Recuris
15:32官方账号arXiv cs.AI@Bingxin Xu, Yuzhang Shang, Emilio Ferrara精选BATON是一种针对长时程机器人操作的新方法,通过将探索单元从整个任务细化为子任务,使成本从指数级降为线性。它引入了过渡感知记忆,包括验证器、交接和前瞻机制,以处理子任务间的状态转换。在RoboMemArena基准上,BATON将任务成功率提升了11.6%,累计成功率提升了14.9%。该方法无需更新参数,仅通过语言记忆和智能体协作实现。论文BATON机器人操作VLA模型推荐理由:BATON解决了长时程机器人操作中错误累积和子任务衔接的难题,成功率提升明显,值得一看。原文稍后读已读值得跟进有用关注 BATON
01:34AK@_akhaliq精选LongHorizon-Harness 是一个面向长时程智能体的新评估框架。论文编号 2608.01 已在 Hugging Face 上公开。LongHorizon-Harness 用于评测智能体在真实世界多步骤任务中的表现。现有基准多偏短时程,LongHorizon-Harness 试图弥补这一缺口。论文LongHorizon-Harness智能体评估基准推荐理由:有人发了 LongHorizon-Harness,一个专测长时程智能体的框架,论文在 Hugging Face,想评估多步任务表现可以看。原文稍后读已读值得跟进有用关注 LongHorizon-Harness