8月26日
11:29
11:29官方账号arXiv cs.AI@Zhaochen Yu, Yingcheng Wu, Zhenfei Yin, Kaiyuan Chen, Zhe Zhao, Mengdi Wang, Shuicheng Yan, Ling Yang
Recuris,一种用于长时程智能体驱动的递归经验-工作记忆架构,通过工作记忆跟踪任务进度并指导技能选择,提高GPT-5.6 Sol和Claude Opus 5在tau-bench和Qwen3.6-27B/35B上的任务成功率,最多提升16.6/13.5点,并减少长时程失败率至80%以下。
事件专题

推荐理由:Recuris模型在长时程任务中显著提升了GPT-5.6 Sol和Claude Opus 5的表现,是长时程智能体驱动的递归记忆架构的一个突破。
8月5日
01:34
01:34AK@_akhaliq
精选
LongHorizon-Harness 是一个面向长时程智能体的新评估框架。论文编号 2608.01 已在 Hugging Face 上公开。LongHorizon-Harness 用于评测智能体在真实世界多步骤任务中的表现。现有基准多偏短时程,LongHorizon-Harness 试图弥补这一缺口。
推荐理由:有人发了 LongHorizon-Harness,一个专测长时程智能体的框架,论文在 Hugging Face,想评估多步任务表现可以看。